知识可靠性

AI 模型幻觉率对比:知识准确性与可靠性怎么看

哪个 AI 模型更少产生幻觉?分别比较知识可靠性、事实知识准确率与无错误断言率,解释低幻觉不等于高准确,并提供问答、检索和企业知识库场景的验证方法。

Keygate 编辑团队8 分钟读完数据更新于 2026年8月3日 20:42

快速结论

30 秒先看结论

先看关键结论,再结合任务、预算和等待时间做选择。

ClaudeClaude Fable 5 (with fallback)40.1
综合观察知识准确性与避免错误断言的能力
ClaudeClaude Fable 5 (with fallback)61.4%
回答正确的比例,不包含谨慎不答的价值
openbmb 品牌标识MiniCPM5-1B99.1%
正确回答或谨慎不答,均优于自信地给出错误事实
ClaudeClaude Opus 5 (max)60.7
总体能力与知识可靠性是不同维度
AI 模型幻觉率对比:知识准确性与可靠性怎么看信息图

选型对照

知识可靠性前列模型

按知识可靠性排列,同时展示事实准确率、无错误断言率和综合智力;低幻觉与高准确不是同一个结论。

知识可靠性

31.3

事实准确率

54.2%

无错误断言率

49.9%

综合智力

60.7

知识可靠性

29.8

事实准确率

53.3%

无错误断言率

49.8%

综合智力

60.1

知识可靠性

28.1

事实准确率

52.7%

无错误断言率

48.1%

综合智力

58.9

知识可靠性

26.4

事实准确率

52.0%

无错误断言率

46.5%

综合智力

53.8

数据更新于 2026年8月3日 20:42;本文分别比较知识可靠性、事实知识准确率和无错误断言率。三项指标含义不同,不能把任一项直接扩写成所有场景下的“幻觉率”。

哪个 AI 模型更少产生幻觉

当前知识可靠性排名前三的候选是 Claude Fable 5 (with fallback)Gemini 3.1 Pro PreviewClaude Opus 5 (max)。这项结果适合筛选事实问答候选,但不能保证模型在你的企业资料、最新事件、专业领域或检索流程中同样可靠。

“少说错话”包含两种不同能力:知道正确答案,以及不知道时避免自信地编造。只看准确率会忽略谨慎不答,只看非幻觉率又可能奖励过度保守,因此需要把两项放在一起。

知识可靠性排行榜

  1. Claude Fable 5 (with fallback) — 40.1
  2. Gemini 3.1 Pro Preview — 32.9
  3. Claude Opus 5 (max) — 31.3
  4. Claude Opus 5 (xhigh) — 29.8
  5. Claude Opus 5 (high) — 28.1
  6. Grok 4.5 (high) — 26.4
  7. Claude Opus 5 (medium) — 25.6
  8. Gemini 3.6 Flash — 23.5
  9. Claude Opus 5 (low) — 23.2
  10. Gemini 3.5 Flash — 22.7

查看完整知识可靠性图表 · 了解评测方法

知识可靠性综合观察事实知识准确性与避免错误断言的能力,适合快速判断模型在知识问答中的整体取舍。

事实知识准确率排行榜

  1. Claude Fable 5 (with fallback) — 61.4%
  2. GPT-5.6 Sol (max) — 58.5%
  3. GPT-5.6 Sol (xhigh) — 58.0%
  4. GPT-5.6 Sol (high) — 57.3%
  5. GPT-5.6 Sol (medium) — 56.7%
  6. GPT-5.6 Sol (low) — 56.4%
  7. Gemini 3.1 Pro Preview — 55.3%
  8. Claude Opus 5 (max) — 54.2%
  9. Claude Opus 5 (xhigh) — 53.3%
  10. Claude Opus 5 (high) — 52.7%

事实知识准确率关注模型给出完全正确答案的比例。它不等于“没有幻觉”:一个模型如果在不确定时选择不答,准确回答数量可能减少,但错误断言也可能减少。

无错误断言率排行榜

  1. MiniCPM5-1B — 99.1%
  2. G9v3-3B — 87.9%
  3. Command A+ — 85.9%
  4. G9v3-39A5B — 85.3%
  5. Grok 4.3 (medium) — 84.0%
  6. MiniMax-M3 — 83.9%
  7. Grok 4.3 (low) — 83.5%
  8. MiniCPM5-1B — 81.3%
  9. Qwen3.7 Max — 77.1%
  10. MiMo-V2.5-Pro — 75.5%

无错误断言率把正确回答与谨慎不答都视为没有作出错误事实断言。它更接近高风险场景对“不要瞎猜”的要求,但不代表模型回答了所有问题。

综合能力高也不等于事实永远正确

当前综合智力靠前的候选:

  1. Claude Opus 5 (max) — 60.7
  2. Claude Opus 5 (xhigh) — 60.1
  3. Claude Fable 5 (with fallback) — 59.9
  4. GPT-5.6 Sol (max) — 58.9
  5. Claude Opus 5 (high) — 58.9

综合智力衡量复杂任务能力,知识可靠性关注事实问答中的准确与克制。一个模型可能擅长推理、编程和长流程任务,但仍会在陌生事实、时效性信息或来源不足时出错。

不同场景怎样降低错误风险

  • 普通问答: 要求区分事实、推断与不确定内容,并允许明确回答“不知道”。
  • 企业知识库: 检索只能提供材料,仍要验证引用是否真的支持结论。
  • 研究与媒体: 保留来源、日期和原文位置,对关键数字做独立复核。
  • 客服与业务规则: 将关键政策写成可验证约束,禁止模型凭常识补全。
  • 医疗、法律和财务: 模型输出不能替代专业判断,高风险结论必须由合格人员复核。

接入搜索或检索增强并不会自动消除幻觉。模型仍可能引用错段落、混合多个来源、误读数字,或在材料没有答案时继续生成。验证流程应检查“答案是否正确”和“证据是否支持答案”两件事。

一套可执行的可靠性测试

  1. 从真实业务中收集有明确答案、无答案、答案过时和问题含歧义的样本。
  2. 给所有候选相同资料、相同提示词和相同工具权限。
  3. 分别记录正确、错误、无依据断言、谨慎不答和引用不匹配。
  4. 对高风险问题设置必须引用、必须确认或必须转人工的规则。
  5. 定期加入新问题复测,避免模型只适应一套固定题目。

最重要的业务指标通常不是“回答了多少”,而是“有多少答案可以安全使用”。在允许不答的场景中,可靠的拒答可能比流畅但错误的答案更有价值。

继续阅读