全部工具

AI 回答质量检查

回答写得像样,就能信吗?

检查空泛建议、缺失步骤和引用线索。粘贴一段回答,看看哪些地方值得追问。

一次实际运行 · 合成回答

这段回答算错了,为什么还有 82 分?

这段英文回答有编号步骤,提醒读者检查数据,也写了限制条件。乍看很周全,第一步却把相对增长算错了。

“conversion rose from 20% to 30%, a relative increase of 10%, according to [1].”

它说:转化率从 20% 升至 30%,相对增长为 10%,依据见 [1]。

算一下就能发现:增加的是 10 个百分点。用增加量除以原来的 20%,相对增长是 50%。

(30% − 20%) ÷ 20% = 50%

工具给这段英文原文 82/100 分。它提醒补充来源,却没有指出计算错误。[1] 没有对应文献,仍被识别成了引用格式;步骤、验证词和限制词则为回答加了分。

这就是检查器能帮上忙、也会漏掉东西的地方:它能找到某些文字信号,计算和引用还得逐项核对。

展开英文原文与实际检查结果
1. First record the metric: conversion rose from 20% to 30%, a relative increase of 10%, according to [1].
2. Then check the starting and ending values in the file, for example by keeping the original counts and observation window for the same group.
3. Finally state the limitation: these are synthetic numbers, and other groups may differ; verify the denominator and sampling method, and preserve the calculation and source in the report.

回答类型:研究/事实说明 · 2026-09-08 · 82/100

  • 部分断言需要来源 — 补充来源或降低语气强度。
  • 补充来源、证据、方法边界和不确定性。 — 补充来源、证据、方法边界和不确定性。

此处运行的是英文原文。操作区另有中文措辞版本,得分为 73;两段文字命中了不同规则。

先核对数字和来源,再考虑怎么改写。 做一道百分比练习 →

查看检查方法与运行记录

检查在浏览器本地运行,不调用 AI。规则从 92 分起,按高、中、低级命中减 18、9、4 分,再按结构项、验证词和限制词加分,限制在 0—100。分数不是准确率。

工具不读取原始问题来判断需求覆盖。简短而正确的回答可能被要求加长,否定句里的“保证”也可能触发规则。断言扫描只保留前 160 个长度大于 12 的句段。

两个演示都是合成材料,输出由工具函数实际运行生成。核验说明由 AI 辅助撰写,待维护者复核。

研究依据:FL-EVAL-001 目前只有合成校准材料,尚无真人复核结果,也没有验证本工具分数的准确性。 评估方法与状态

下载两组演示的完整输入与输出(JSON)