跳至课程正文

11 / 12 · 比较之前先问清楚

p 值小,到底在说什么?

把 p 值读成一个“假如……会怎样”的问题,不把它当成结论为真的概率。

先修衔接 方法更好,还是人本来就不同?

前往练习 ↓

带着这个问题读

如果 p 值约为 0.04,就能说新方法有 96% 的概率更好吗?

不能。不能用 1 减去 p,就得到新方法更好的概率。p 值是在把起始模型当作成立的前提下,问可能出现怎样的检验结果;它没有给不同解释分配真假概率。

比如,先假定“两种方法没有真实差异”,同时满足检验的其他假设。在固定检验规则下,出现本次这么极端或更极端检验结果的概率是多少?这就是 p 值。“更极端”由选定的检验来定义,不能看完结果再换规则。

下面的例子会把“至少同样极端”的结果都数进去,不是只数与本次一模一样的结果。p 值小,表示结果在假定模型下不太寻常;它不告诉你效果有多大、是否值得采用,也不替另一种解释证明正确。

一起拆一个例子

全部模拟1000 次
至少同样极端40 次
为无差异模型和固定检验规则虚构的教学次数,本站未实际运行这次模拟。相除仅演示近似计算,不是精确 p 值或真实研究结果。
  1. 先定好无差异模型、假设,以及什么叫“至少同样极端”,不要看完结果再改。
  2. 在这组虚构教学次数里,1000 次中有 40 次满足规则。每一次都使用同一个起始模型;40 数的是符合条件的结果,不是“假设为假”的次数。
  3. 40/1000 = 4%,所以模拟给出的粗略 p 值是 0.04。整个相除过程仍是在假定起始模型成立。

轮到你了

0 / 3
练习 1未检查

按给定模型模拟 1000 次,其中 40 次至少同样极端。这个比例是多少?

你的答案
查看解析 · 不计作完成
  • 模拟中的比例: 4 %

是 4%。它近似的是给定模型下检验结果的概率,不是模型本身的概率。

练习 2未检查

哪一种对小 p 值的解释合适?

你的答案
查看解析 · 不计作完成

在假定模型下,所选检验的结果不太寻常。

不能把“模型成立时出现某结果的概率”,反过来当作“看到结果后模型成立的概率”。这就是第 3 课的条件方向问题。

练习 3未检查

一个很大的实验发现了很小的提升,p 值也很小。判断是否有用,还需要什么?

你的答案
查看解析 · 不计作完成

效果大小、不确定性、研究设计,以及实际付出和收益。

把结果读完整:多大、多不确定、怎么测的、对什么有用。一个阈值回答不了这些问题。

带回你自己的问题

补完这句话:“p 值小没有告诉我____。要理解这次结果,我还会问____。”

仅保存在此浏览器0 / 6000