数字没有错,为什么结论可能误导?
信息判断 · 第四课:看清统计中省略的信息
预计学习时间:20–25 分钟。建议先完成来源核查一课。
教学说明:本课全部数据为虚构教学数据,计算可复核,不代表实际产品或群体。
学完后,你能做什么
- 同时表达相对变化、绝对变化和分母。
- 区分平均表现、典型表现与个体差异。
- 检查样本选择、分组和时间窗口是否影响结论。
- 写出数据支持的较窄结论,不仅笼统称其“误导”。
1. 一个惊人的标题
新流程让错误率降低了 50%,效果惊人!
你会直接采用它吗?先写下最想知道的三个数字,以及“效果惊人”还需要什么判断标准。标题可能计算正确,但尚未说明规模、成本、错误严重程度或如何比较。
2. 相对变化要和绝对变化一起看
假设旧流程处理 1,000 件任务发生 20 次错误,新流程处理另 1,000 件任务发生 10 次错误。
- 旧错误率:20 ÷ 1,000 = 2%。
- 新错误率:10 ÷ 1,000 = 1%。
- 绝对下降:2% − 1% = 1 个百分点。
- 相对下降:(2% − 1%) ÷ 2% = 50%。
两种描述都正确。按这次观察,新流程每 1,000 件任务少出现 10 次错误;这还不能保证未来都如此,也不能在缺少可比条件时把差异全归因于流程。
“下降 1 个百分点”不等于“相对下降 1%”。起点为零时,相对增长率不能按除以起点的通常公式计算。
绝对变化小不自动意味着不重要。是否值得采用,还要看规模、后果、成本和结果的不确定性。
3. 平均值没有告诉你每个人怎样
某五人团队的月产出依次为 10、10、10、10、60 件。平均值为 20,中位数为 10,范围为 10 到 60。
“人均产出 20 件”计算正确,但不能推断多数人产出 20 件,更不能把它当作每人的最低标准。一个高值明显影响了平均值。
平均值适合描述总量如何按人数平均分摊,中位数帮助描述排序中间的位置。没有一种指标能替代全部信息;需要时查看分布、范围、分组和原始数量。
4. 分母、分组和样本可以改变故事
| 呈现方式 | 容易忽略什么 | 应补充什么 |
|---|---|---|
| “投诉从 10 件增至 20 件” | 服务量可能从 100 增至 1,000 | 同时列出投诉率 10% 与 2%,并核对投诉定义 |
| “完成者通过率很高” | 报名后退出的人没有进入分母 | 报名人数、完成数和通过数 |
| “A 的总体通过率更高” | A 可能有更多容易任务 | 按任务难度分组,比较组内结果 |
| “这个月增长了” | 季节性、异常低起点或长期变化 | 更长的时间序列及相同口径 |
| “指标显著提升” | “显著”可能只是形容词 | 具体差值、样本数与不确定性说明 |
分组后可能出现与总体不同的趋势,因为总体是按各组人数加权的结果。不要只挑有利于自己立场的总体或分组数字;应先明确要比较的问题。
5. 用四个问题读数字
- 测了什么? 指标、单位、时间和定义是什么?
- 谁进入统计? 分母、样本来源、退出与缺失如何处理?
- 和什么比较? 起点、时间范围、任务或人群是否可比?
- 变化有多确定? 数据量多大、差异可能受什么影响、结论适用于谁?
图表也要回到数值:截短纵轴可能放大视觉差异,但不必然造假;不同图表需要不同刻度。检查轴标签、范围和原始数值,再判断视觉是否帮助理解。
本课做描述性计算,不根据几个数字推断统计显著性,也不把前后变化直接当作因果效果。
6. 练习一:下降 50% 到底是多少?
虚构记录:旧流程的 2,000 件任务中有 40 次错误;新流程的另 2,000 件任务中有 20 次错误。没有提供任务难度与分配方式。
计算两次错误率、绝对和相对下降,再改写“新流程效果惊人,应全面推广”。写出推广前要核查的一项条件。
查看参考答案与解析
参考解析
错误率分别为 2% 和 1%;绝对下降 1 个百分点,相对下降 50%。这两批各 2,000 件任务中观察到的错误数相差 20 次。
可改写:“在所记录的两批任务中,新流程的错误率为 1%,旧流程为 2%。尚需核查任务可比性、流程成本及更多观察,才能决定是否推广。”
不要写成“降低 1%”而不说明含义,也不要保证每次都能减少 20 个错误。可核查任务如何分配、人员经验是否相似,或错误记录口径是否改变。
7. 练习二:完成者代表所有报名者吗?
虚构训练营:100 人报名,40 人完成,完成者中 36 人通过测验。其余 60 人没有测验记录。宣传写“学员通过率 90%”。
分别计算完成者通过率、报名者中已记录通过者的比例。这个材料能证明所有报名者真实通过率为 36%,或者证明未完成者都失败了吗?
查看参考答案与解析
参考解析
36 ÷ 40 = 90%,描述完成者的通过率。36 ÷ 100 = 36%,描述全部报名者中已记录通过者的比例。
未完成者缺少成绩,不能当作已知失败。若问题是“报名者中多少人的能力达到了测验标准”,当前不能确定全体情况;若规则事先定义“未参加测验即未获认证”,则可以描述认证率,但必须说明定义。
可改写:“100 人报名,40 人完成,其中 36 人通过。完成者通过率 90%;报名者中有 36% 已记录通过,其余未完成者没有测验数据。”这既不隐藏退出,也不虚构其成绩。
8. 练习三:总体领先,组内也领先吗?
两种虚构方法处理不同难度任务,表格中的数字为成功数/任务数:
| 方法 | 容易任务 | 困难任务 | 合计 |
|---|---|---|---|
| A | 81/90 | 1/10 | 82/100 |
| B | 19/20 | 16/80 | 35/100 |
计算总体和各难度的成功率。评价“A 总体成功率更高,所以任何难度都应该选 A”。如果两种方法各处理 50 个容易和 50 个困难任务,并暂用现有组内比例估算,预计成功数是多少?
查看参考答案与解析
参考解析
总体上 A 为 82%,B 为 35%。容易任务中 A 为 90%,B 为 95%;困难任务中 A 为 10%,B 为 20%。B 在两个组内的观察成功率都更高,但 A 接到的容易任务更多。
按相同的 50/50 任务构成估算,A 为 50 × 90% + 50 × 10% = 50;B 为 50 × 95% + 50 × 20% = 57.5。这是比例模型下的期望值,实际成功数必须是整数,未来结果也未必等于估计。
总体率回答本次任务组合下发生了什么;组内率帮助比较相同难度。仍需检查任务分配与其他差异,不能据此证明方法 B 的因果优势。小组数据有限,也没有提供不确定性估计。
9. 检查你的统计解读
遗漏可能来自简化、疏忽或有意选择,仅凭缺项不能判断作者动机。指出缺失如何影响结论,比贴标签更有用。
10. 数字核查记录
下一课将专门检查从证据到结论的推理是否越界,进一步区分相关与因果、个例与普遍结论。可通过下方课程导航继续学习。
填写内容仅保存在当前浏览器,切换语言后的记录分别保存;可导出备份。