Fineuralab

把 AI 回答评估做成一个实验

一套小而可重复的 AI 回答比较设计,避免只奖励流畅度。

类型实验设计
状态试点工具已就绪;尚无结果
证据等级量表 + 合成校准样本
更新2026-08-17

研究问题

当正确性、证据、可执行性和风险都重要时,怎样比较两个 AI 回答?

人的偏好很容易跟着语气和润色走。实验式比较需要固定任务、隐藏答案身份、明确维度并记录分歧,避免把自信程度当成主要指标。

冻结任务契约

写清用户目标、已提供上下文、约束、允许假设、预期输出和不可接受失败。所有被比较答案都使用完全相同的契约。

对独立维度分别评分

分别评估需求覆盖、事实支持、推理线索、可执行性、不确定性校准、隐私或安全风险,以及不必要的冗长。

  • 不要一开始就凭直觉合成总分。
  • 事实主张必须有证据。
  • 对虚构约束和遗漏边界扣分。

尽量遮蔽表面信息

评审前移除模型名称并统一格式,同时归档原始回答。盲评不能消除所有偏差,但可以减少品牌和排版效应。

记录分歧和弃权

评审者可以标记证据不足、不适用或未解决。分歧通常意味着量表有歧义,或任务需要领域专家。

  • 每个分数旁边保留评审理由。
  • 平均分前先解决标准歧义。
  • 高风险主张交给合格评审者。

选择动作,而不只是选赢家

结果可以是接受、修改、核验、合并或拒绝。最流畅的回答不一定是最好的产物,也可能两个答案都需要补证据才能使用。

FL-EVAL-001 · v0.4

校准附录

20 条双语合成样本用来检查量表是否足够清楚。它是这套方法的研究依据,不是具名模型的测评榜单,也尚无真人复核结果。

查看校准附录
边界说明

本页记录的是 Fineuralab 当前采用的方法、协议或维护者判断。除非状态明确写为“已复现”或“实验完成”,否则不应把它理解成对具体论文结果的复现声明。

已复核并更新:2026 年 8 月 17 日