17 / 18 · 面对不确定的证据
相信百分比之前,先数一数
用自然频数区分 P(标记|缺陷) 与 P(缺陷|标记)。
先修衔接 证据支持,不等于必然推出
前往练习 ↓带着这个问题读
检测器能发现 90% 的缺陷,被标记的项目就有 90% 概率有缺陷吗?
条件概率 P(A|B) 描述 B 群体中属于 A 的比例。交换 A、B 会改变分母。灵敏度关注缺陷中有多少被标记;收到标记后,用户关心的却是被标记项目中有多少真的有缺陷。
教学模型:恰好 1,000 个项目,其中 10 个有缺陷。检测器标记 90% 的缺陷项目,以及 990 个非缺陷项目中的 10%。因此标出 9 个真缺陷、99 个非缺陷,共 108 个标记。标记中真正有缺陷的只占 9/108,约 8.33%。
基础比例很重要:即使假阳性率不大,乘以很大的群体也会产生许多标记。这里的规定频数不是任何真实产品的实测表现。实际使用中,比率与流行比例都是估计值,也会在人群间变化。
一起拆一个例子
- 先分总体:10 个缺陷 + 990 个非缺陷 = 1,000。每个比率只乘它对应的群体。
- 真标记:10 × 0.9 = 9。假标记:990 × 0.1 = 99。收到标记后的分母是 108,不是 10 或 1,000。
- 贝叶斯公式记录同一个账:P(D|F) = P(F|D)P(D) / P(F)。把群体数出来,可以看清分母。
轮到你了
0 / 3练习 1未检查
换一批:1,000 个项目,100 个有缺陷,灵敏度 90%,假阳性率 10%。计算标记群体。
查看解析 · 不计作完成
真标记/假标记/总标记/百分比: 90 / 90 / 180 / 50%
90 个真标记、90 个假标记,共 180 个。标记中一半有缺陷,即 50%。检测比率没变,变的是基础比例。
练习 2未检查
计算 P(缺陷|标记) 时,分母是哪一群?
查看解析 · 不计作完成
所有被标记项目
计算之前,先说清竖线后面的条件限定了哪个群体。
练习 3未检查
低缺陷比例的部署中出现很多假标记,怎样处理较合理?
查看解析 · 不计作完成
加入确认步骤,并比较误判成本及部署环境中的实际比率。
概率本身不会独自决定行动,还需要成本、收益和进一步证据。
带回你自己的问题
找一个你关心的百分比主张,写清分子、分母,以及测量前是否筛选过群体。