Fineuralab
AI 回答复核校准附录
FL-EVAL-001 的研究附录,包含 20 条双语合成校准样本、本地复核工具,以及这项试点能够与不能够说明的边界。
FL-EVAL-001 · 校准协议 v0.4
这些样本在校准什么
这个附录用 20 条合成回答检查复核维度是否足够清楚,以及两名复核者是否会做出相近的处理判断。完整工作台保留在页面末尾,仅在需要参与校准时展开。
内置回答是为校准量表而编写的合成材料,故意包含不同程度的问题。它们不是 ChatGPT、Claude、Gemini 或任何其他具名模型的输出,页面也不展示预设“标准答案”。
怎样把这个工具变成真实试点
- 复核者 1 先独立完成 20 条任务并导出 JSON。
- 复核者 2 在不看第一份结果的情况下重复复核。
- 导入双方记录,优先分析分歧理由,不用平均分掩盖标准问题。
可选研究工具 展开本地双复核工作台 仅在参与量表校准,或把合成回答替换为真实盲化回答时使用。
AI 回答双复核工作台
复核者 10/20
复核者 20/20
可比较任务0
处理动作一致率—
已复核并更新:2026 年 8 月 17 日