一、定义误导性图表(Define Misleading Charts)
图表的用途——以及它们如何误导
图表(chart)是一种以简单方式展示信息的绘图,通常用线条和曲线来表示数量。图表帮助我们比单纯查看原始数据点更快地识别数据中的关系或模式。图表有多种类型,包括图形(graph)、表格(table)、示意图(diagram)和地图(map)等。
图表帮助我们做比较、看趋势、得出结论并更高效地采取行动。例如,你的电费单上的用电量图表,很可能比一张同样数字的表格更能吸引你的注意力。当你发现七月的用电量飙升时,你可能会去调查背后的原因,并决定在八月限制空调使用或调整预算。
图表在工作场所也是非常有用的工具。它们帮助我们看清业务单元的运行效率、理解和评估一项举措的成功,甚至可以帮助我们审视绩效管理中的人为偏见。
「一个好的可视化不仅能回答问题,它还能帮助你发现还有哪些问题需要你去回答。」——数据可视化专家 Steve Wexler
误导性的数据呈现:一张误导观众的图表有时是无意造成的。例如,创建图表的人可能理解数据,却无意中做出了误导他人的设计选择。请看下面这张柱状图——乍一看,Central 和 South 两个区域的销售额之间似乎存在相当大的差异。
现在,再看看下面这张柱状图:
两张图呈现的是相同的数据、相同的图表类型,只是坐标轴不同。这个微小的变化会如何影响你的结论?把两张柱状图并排来看:
左边的柱状图是零基线(zero baseline),右边的柱状图则是 $390K 基线。被截断的坐标轴(truncated axis)夸大了两个区域总销售额之间的差异,可能误导你得出 Central 区域的销售额远高于 South 的结论。
当你学会准确阅读并明智地解读图表时,你会发现误导性图表无处不在——博客文章、报纸文章、社交媒体帖子,甚至专业演示中都有。要更清晰、更准确地了解数据,你需要负责任地阅读图表,并帮助他人也这样做。下面的单元将为你提供一个更准确、更自信地分析图表的框架。
二、质疑数据(Question the Data)
质疑数据:来源、数字与充分性
「不要相信任何没有明确提及或链接其报道来源的出版物。」——Alberto Cairo,数据可视化专家、《How Charts Lie》作者
从商业报告到社交媒体帖子,识别并评估你遇到的数据和图表来源都至关重要。了解来源是判断图表是否具有误导性的第一步,也是最重要的一步。通过提问来深入探究图表是谁、是什么、在哪里、何时以及为什么被创建的。
五 W 来源评估框架:
- Who(谁):谁负责这些数据、分析和呈现?谁收集和分析的数据?作者是否因这项工作获得报酬,是否存在利益冲突?作者或发布者是否是这一领域的权威?
- What(什么):收集和准备数据使用了什么方法?呈现了哪些类型的数据?测量是否准确?样本量多大?被调查人群的人口统计分布如何?
- Where(哪里):数据是从特定地区、州或国家收集的吗?是否在多个地点收集?数据是否可在可信来源的网站上获取?
- When(何时):数据是最新的吗?数据回溯多久?是每年、每月、每天还是实时收集的?
- Why(为什么):是否有财务、政治、科学或其他动机影响数据的客观性?是否有公司付费让研究者测试新产品?
务必研究元数据(metadata),即「关于数据的数据」。阅读随附文档,从中获取有用信息,例如数据是何时、如何以及为何被收集的。
审查数字:「垃圾进,垃圾出(garbage in, garbage out)」——输出的质量取决于输入的质量。要判断可视化中数据的质量和准确性,请尽可能审查底层数字。
- 汇总值(summary values):图表常附带描述底层数据的汇总值。常见的汇总值包括:Sum(总和)、Count(计数)、Mean(平均数)、Median(中位数)、Mode(众数)、Range(极差)、Min(最小值)、Max(最大值)。
- 比率与百分比(rates and percentages):比率和百分比衡量值之间的关系。例如,一篇文章标题说「2,139 名 DACA 受益者被判刑或被指控犯罪」,这个数字看起来很大。但同一篇文章提到 DACA 受益者总数超过 80 万。考虑比率或百分比:2,139/800,000 = 0.3%!百分比是更有信息量的值,并不是受益者总数的大比例。
警惕数据不足:「没有任何图表能捕捉现实的全部丰富性。但图表的好坏取决于它在过度简化现实与用过多细节掩盖现实之间取得平衡的能力。」——Alberto Cairo
阅读图表时,问问自己是否包含了足够的数据来呈现有意义且准确的版本。Cairo 举例:2017 年减税与就业法案(TCJA)承诺「典型的四口之家每年可节省 $1,182」。但美国家庭收入分布范围很广——3% 的家庭年收入低于 $5,000,超过 9% 的家庭年收入超过 $200,000。当几乎无法准确计算「典型收入」时,讨论平均节省额几乎毫无意义。
这个直方图显示了家庭收入分布的显著范围。单一的平均值掩盖了完整的故事。
三、检查坐标轴(Check Axes)
检查坐标轴:柱状图、折线图与区间
坐标轴(axes)为图表中数据的显示创建结构,提供为数据点赋值和标注的标度。多数图表有两个坐标轴:水平轴(x 轴)和垂直轴(y 轴)。
定性标度与定量标度:图表坐标轴有两种标度类型:定性(qualitative)标度为类别(如食品、住房、服装)分配标签;定量(quantitative)标度为数值变量(如 0、5、10)分配值。
常见的图表类型包括:柱状图(bar chart,用高度或长度比较类别值)、饼图(pie chart,用占整体的百分比表示类别)、散点图(scatterplot,显示两个定量变量之间的关系)、折线图(line chart,连接一系列定量值,常用于时间序列)、直方图(histogram,显示数据分布与频率,条形的宽度称为 bin)、箱线图(box and whisker plot,用百分位数显示数据分布)。
区间(intervals):区间是定量坐标轴上数值(刻度线)之间的距离。定量坐标轴上每个刻度线之间应始终保持一致的距离,即等距区间。例如,员工通勤时间图使用 10 分钟的等距区间是合适的;而不一致的区间(如 15 分钟、40 分钟、60 分钟)会导致误解和错误结论。
看一个例子:Sue 的番茄收成「令人印象深刻地增长」。
上图显示 Sue 在 2022 年比 2010 年多收了几磅番茄。但你有没有注意到 x 轴缺少了 2016 到 2018 年?现在看包含这些年份的图表:
使用一致的区间后,更容易看出 Sue 的番茄收成可能是随时间逐渐增长的。此外,还要注意缺失的数据点(nulls)——2016 到 2018 年发生了什么?也许 Sue 在那段时期经历了困难。
警惕把定量数据画在定性轴上:注意任何试图用定性轴来显示散点图、折线图或直方图的尝试。例如,下面关于不同行业借款人数量的图表,用折线图是错误的——折线图用于显示日期或时间等顺序值,x 轴应是定量变量。对于这种数据,柱状图才是更好的选择。
柱状图必须从零开始:所有柱状图都应以零基线开始,即柱子的底部是零。看下面两张区域销售额图表:
右边的图让你误以为两个区域之间存在显著差异,因为 y 轴从 $380K 开始而不是零。解读柱状图时,你比较的是柱子的长度。从 $380K 开始会让你的眼睛误判出三倍的差异。记住:查看柱状图时,务必检查基线是否从零开始。
折线图可以不从零开始:然而,折线图不受「必须从零开始」规则的约束。事实上,有时折线图的 y 轴不从零开始反而更好。看下面两张全球温度随时间变化的折线图:
第二张图让你更清楚地看到全球温度随时间变化的模式,因为它的 y 轴不从零开始,你可以看到之前不明显的逐年变化细节。
双轴之争:数据可视化领域对单个图表中使用双轴(dual axes)的实用性存在很多争论。双轴在正确使用时很有帮助,但有时也可能误导。
合理使用:用双 y 轴显示同一组数据点的两种不同标度,例如用两种不同单位(英寸/厘米、千克/磅)表示相同数据。下图左侧 y 轴显示华氏温度,右侧显示摄氏温度。
误导使用:用两个不同的 y 轴显示两组不同数据点。下面的图表用两个不同的 y 轴标度,让你误以为 2011 年德国 GDP 与全球 GDP 相同——实际上两者差异超过 66 万亿美元!
记住,查看图表时务必检查坐标轴,确保数据的呈现方式是合理的!
四、避免误导性图表设计(Avoid Misleading Chart Design)
图表设计陷阱
柱状图是黄金标准:研究表明,柱状图是最容易理解的可视化类型之一。简单的格式让观众能快速比较柱子的长度,使柱状图成为数据可视化领域的主力。
警惕气泡图(bubble chart):气泡图可能看起来有趣,但并非总是有效。人类的眼睛很难比较圆的面积——几个大泡泡看起来大小相似,难以准确排序。相同的数据用柱状图呈现则一目了然。
注意饼图(pie chart):饼图用于显示部分与整体的关系。所有扇区加总应等于 100%——如果你看到一个加总不等于 100% 的饼图,那就是有问题的。
不幸的是,饼图在不恰当使用时会造成混淆。眼睛擅长分辨柱状图中长度的差异,却难以比较扇区的面积。当类别值相近或有多个小百分比类别时,解读饼图会变得更困难。
避免饼图陷阱的建议:尽量请饼图制作者用相同数据做柱状图;能访问源数据就自己做一个柱状图;实在不行就放慢速度,给自己时间处理饼图中的数据,不要急于下结论。
饼图也有适用场景——当你想显示恰好一半的比例时,饼图更有效。总之,仅在扇区很少且大小差异明显时使用饼图。
小心 3D 图表:3D 图像虽然吸引眼球,却让图表解读更加困难。3D 物体越靠近画面中心看起来越大,这在你按大小比较时会造成问题。下面的 3D 饼图让 Darjeeling 切片看起来更小,而柱状图能准确显示 Mint 占总销售额的比例略高于 Green。
颜色选择很重要:不恰当的颜色会让图表难以阅读。图表中的颜色滥用包括:同一图表中颜色过多、用不同颜色表示相同值、难以阅读的配色方案、不色盲友好的配色、不同强度的颜色。
上图用红色和绿色表示一系列值(红色表示高于零,绿色表示低于零),色盲人士无法区分这种差异。请尽量使用色盲友好的调色板,做到包容且易于解读。
象形图(pictogram)可能误导:象形图用符号和图像传达信息,可能增加视觉吸引力,但若未遵循最佳实践,也可能误导观众。例如,底层数据是 A=100、B=300(3 倍差异),但象形图用面积而非高度来显示差异,让观众误以为是 9 倍差异。
无论何时查看图表,都要停下来深入探究表象之外。图表可能因为未按最佳实践设计而难以阅读或具有误导性。
五、自信地阅读图表(Read Charts with Confidence)
自信地阅读图表
即使图表使用了准确的源数据和恰当的设计选择,也可能被误解。关键在于批判性思考,并花时间仔细评估你在图表和其他数据可视化中看到的数据解读。
从大局思考:另一个常见陷阱是图表未能展示场景的完整背景。例如,Cairo 在《How Charts Lie》中讨论了一张柱状图,其暗示的结论是「失业率在上升」。但如果你把这两个数据点放在全年甚至多年的背景下,会出现不同的模式——虽然失业率在 2017 年 7 月到 8 月之间确实上升了,但整体上失业率随时间在下降。
考虑误差范围与不确定性:没有什么是完美的,数据也不例外。当民调显示落选候选人领先时,你有时会感到意外。解读民调时,要寻找误差范围(margin of error)或置信区间。例如,误差范围为 ±3 个百分点意味着什么?
误差范围描述的不是研究中的「错误」,而是估计中的不确定性程度。通常估计值是某个范围的中间点。例如,「Rick Saccone 的估计值在 42 到 48 之间,即 45 加减 3;Conor Lamb 的估计值在 39 到 45 之间,即 42 加减 3。」当置信区间重叠时,我们无法从这些结果得出任何候选人会获胜的结论。
例如,一项民调可能显示 60% 的受访者偏好 A 品牌。如果误差范围是 2%,那么偏好 A 品牌的实际比例在 58%–62% 之间。如果误差范围未明确说明,请记住始终存在一定程度的不确定性需要考虑。
相关不等于因果:相关性只显示变量之间的关联强度,并不解释「如何」或「为什么」。例如,冰淇淋销量与太阳镜销量相关——人们是因为买了太阳镜才买冰淇淋吗?不是。导致两者购买的原因显然是别的——在这个例子中,原因可能是炎热的天气。
务必避免仅凭相关性就下结论,始终考虑是否有其他隐藏变量影响了数据中显示的内容。
注意措辞:留意用来描述和标注图表的语言。标题和副标题是否恰当描述了图表?标签是否正确?措辞是否带有情感色彩,影响了你对数据的感知?「暴涨(skyrocketing)」与「温和增长(modest increase)」——相同的数据,不同的框定,会带来完全不同的情绪反应。
持续提问:当你阅读图表以及他人对数据的解读或可视化呈现时,永远要提问。如果看到不合理的现象,追问为什么并深入挖掘数据。
SCAM 检查清单
为了指导你审查和仔细分析图表,请参考便捷的 SCAM 检查清单。SCAM 代表 Sources(来源)、Charts(图表)、Axes(坐标轴)和 Messages(信息)。
Source(来源):
- 数据来自哪里?
- 数据是如何收集的?
- 谁做的呈现?
- 对数据做了哪些汇总?
Chart(图表):
- 图表中是否存在任何误导性设计实践,可能欺骗或分散你对正确解读数据的注意力?
- 是否有气泡图掩盖了比较?饼图扇区是否过多?是否存在 3D 失真?颜色是否难以辨认或误导?象形图是否用面积而非高度?
Axes(坐标轴):
- 是否有多个坐标轴?
- 柱状图的坐标轴是否从零开始?
- 标度和区间是多少?区间是否一致?
- 是否存在任何潜在的欺骗性坐标轴使用?
Message(信息/解读):
- 可视化传达了什么信息或解读?
- 该解读是否适合所示的数据分析?
- 解读中做了哪些类型的比较?这些比较是否恰当、公平?
- 是否展示了完整背景?是否承认误差范围?
与他人讨论数据:阅读图表并不像看起来那么简单。虽然批判性思考和自我提问很重要,但与他人一起分析数据也极有帮助。与同事和朋友讨论你的解读和图表评论,你们可以互相帮助,成为更熟练的图表和数据阅读者。
总结:每当你准确阅读图表或指出误导性图表时,你都在帮助改进决策方式。带上你的批判性思维,运用刚学到的知识和工具,你就能更好地分析、解读图表,并从对数据和信息更深入的理解中获益。现在,去征服那些图表吧!










