Fineuralab能力体系EN专题目录

数字没有错,为什么结论可能误导?

信息判断 · 第四课:看清统计中省略的信息

预计学习时间:20–25 分钟。建议先完成来源核查一课。

教学说明:本课全部数据为虚构教学数据,计算可复核,不代表实际产品或群体。

学完后,你能做什么

  • 同时表达相对变化、绝对变化和分母。
  • 区分平均表现、典型表现与个体差异。
  • 检查样本选择、分组和时间窗口是否影响结论。
  • 写出数据支持的较窄结论,不仅笼统称其“误导”。

1. 一个惊人的标题

新流程让错误率降低了 50%,效果惊人!

你会直接采用它吗?先写下最想知道的三个数字,以及“效果惊人”还需要什么判断标准。标题可能计算正确,但尚未说明规模、成本、错误严重程度或如何比较。

2. 相对变化要和绝对变化一起看

假设旧流程处理 1,000 件任务发生 20 次错误,新流程处理另 1,000 件任务发生 10 次错误。

  • 旧错误率:20 ÷ 1,000 = 2%。
  • 新错误率:10 ÷ 1,000 = 1%。
  • 绝对下降:2% − 1% = 1 个百分点。
  • 相对下降:(2% − 1%) ÷ 2% = 50%。

两种描述都正确。按这次观察,新流程每 1,000 件任务少出现 10 次错误;这还不能保证未来都如此,也不能在缺少可比条件时把差异全归因于流程。

“下降 1 个百分点”不等于“相对下降 1%”。起点为零时,相对增长率不能按除以起点的通常公式计算。

绝对变化小不自动意味着不重要。是否值得采用,还要看规模、后果、成本和结果的不确定性。

3. 平均值没有告诉你每个人怎样

某五人团队的月产出依次为 10、10、10、10、60 件。平均值为 20,中位数为 10,范围为 10 到 60。

“人均产出 20 件”计算正确,但不能推断多数人产出 20 件,更不能把它当作每人的最低标准。一个高值明显影响了平均值。

平均值适合描述总量如何按人数平均分摊,中位数帮助描述排序中间的位置。没有一种指标能替代全部信息;需要时查看分布、范围、分组和原始数量。

4. 分母、分组和样本可以改变故事

呈现方式容易忽略什么应补充什么
“投诉从 10 件增至 20 件”服务量可能从 100 增至 1,000同时列出投诉率 10% 与 2%,并核对投诉定义
“完成者通过率很高”报名后退出的人没有进入分母报名人数、完成数和通过数
“A 的总体通过率更高”A 可能有更多容易任务按任务难度分组,比较组内结果
“这个月增长了”季节性、异常低起点或长期变化更长的时间序列及相同口径
“指标显著提升”“显著”可能只是形容词具体差值、样本数与不确定性说明

分组后可能出现与总体不同的趋势,因为总体是按各组人数加权的结果。不要只挑有利于自己立场的总体或分组数字;应先明确要比较的问题。

5. 用四个问题读数字

  1. 测了什么? 指标、单位、时间和定义是什么?
  2. 谁进入统计? 分母、样本来源、退出与缺失如何处理?
  3. 和什么比较? 起点、时间范围、任务或人群是否可比?
  4. 变化有多确定? 数据量多大、差异可能受什么影响、结论适用于谁?

图表也要回到数值:截短纵轴可能放大视觉差异,但不必然造假;不同图表需要不同刻度。检查轴标签、范围和原始数值,再判断视觉是否帮助理解。

本课做描述性计算,不根据几个数字推断统计显著性,也不把前后变化直接当作因果效果。

6. 练习一:下降 50% 到底是多少?

虚构记录:旧流程的 2,000 件任务中有 40 次错误;新流程的另 2,000 件任务中有 20 次错误。没有提供任务难度与分配方式。

计算两次错误率、绝对和相对下降,再改写“新流程效果惊人,应全面推广”。写出推广前要核查的一项条件。

查看参考答案与解析

参考解析

错误率分别为 2% 和 1%;绝对下降 1 个百分点,相对下降 50%。这两批各 2,000 件任务中观察到的错误数相差 20 次。

可改写:“在所记录的两批任务中,新流程的错误率为 1%,旧流程为 2%。尚需核查任务可比性、流程成本及更多观察,才能决定是否推广。”

不要写成“降低 1%”而不说明含义,也不要保证每次都能减少 20 个错误。可核查任务如何分配、人员经验是否相似,或错误记录口径是否改变。

7. 练习二:完成者代表所有报名者吗?

虚构训练营:100 人报名,40 人完成,完成者中 36 人通过测验。其余 60 人没有测验记录。宣传写“学员通过率 90%”。

分别计算完成者通过率、报名者中已记录通过者的比例。这个材料能证明所有报名者真实通过率为 36%,或者证明未完成者都失败了吗?

查看参考答案与解析

参考解析

36 ÷ 40 = 90%,描述完成者的通过率。36 ÷ 100 = 36%,描述全部报名者中已记录通过者的比例。

未完成者缺少成绩,不能当作已知失败。若问题是“报名者中多少人的能力达到了测验标准”,当前不能确定全体情况;若规则事先定义“未参加测验即未获认证”,则可以描述认证率,但必须说明定义。

可改写:“100 人报名,40 人完成,其中 36 人通过。完成者通过率 90%;报名者中有 36% 已记录通过,其余未完成者没有测验数据。”这既不隐藏退出,也不虚构其成绩。

8. 练习三:总体领先,组内也领先吗?

两种虚构方法处理不同难度任务,表格中的数字为成功数/任务数:

方法容易任务困难任务合计
A81/901/1082/100
B19/2016/8035/100

计算总体和各难度的成功率。评价“A 总体成功率更高,所以任何难度都应该选 A”。如果两种方法各处理 50 个容易和 50 个困难任务,并暂用现有组内比例估算,预计成功数是多少?

查看参考答案与解析

参考解析

总体上 A 为 82%,B 为 35%。容易任务中 A 为 90%,B 为 95%;困难任务中 A 为 10%,B 为 20%。B 在两个组内的观察成功率都更高,但 A 接到的容易任务更多。

按相同的 50/50 任务构成估算,A 为 50 × 90% + 50 × 10% = 50;B 为 50 × 95% + 50 × 20% = 57.5。这是比例模型下的期望值,实际成功数必须是整数,未来结果也未必等于估计。

总体率回答本次任务组合下发生了什么;组内率帮助比较相同难度。仍需检查任务分配与其他差异,不能据此证明方法 B 的因果优势。小组数据有限,也没有提供不确定性估计。

9. 检查你的统计解读

遗漏可能来自简化、疏忽或有意选择,仅凭缺项不能判断作者动机。指出缺失如何影响结论,比贴标签更有用。

10. 数字核查记录

下一课将专门检查从证据到结论的推理是否越界,进一步区分相关与因果、个例与普遍结论。可通过下方课程导航继续学习。

填写内容仅保存在当前浏览器,切换语言后的记录分别保存;可导出备份。

完成标记仅供自己记录,不代表能力认证。