知识可靠性

AI 模型幻觉率对比:知识准确性与可靠性怎么看

哪个 AI 模型更少产生幻觉?分别比较知识可靠性、事实知识准确率与无错误断言率,解释低幻觉不等于高准确,并提供问答、检索和企业知识库场景的验证方法。

Keygate 编辑团队8 分钟读完数据更新于 2026年9月17日 22:12

快速结论

30 秒先看结论

先看关键结论,再结合任务、预算和等待时间做选择。

OpenAIGPT-6 Astra (high)43.7
综合观察知识准确性与避免错误断言的能力
ClaudeClaude Fable 5.1 (max with fallback)67.2%
回答正确的比例,不包含谨慎不答的价值
openbmb 品牌标识MiniCPM5-1B (Non-reasoning)99.1%
正确回答或谨慎不答,均优于自信地给出错误事实
ClaudeClaude Fable 5.1 (max with fallback)53.4
总体能力与知识可靠性是不同维度
AI 模型幻觉率对比:知识准确性与可靠性怎么看信息图

选型对照

知识可靠性前列模型

按知识可靠性排列,同时展示事实准确率、无错误断言率和综合智力;低幻觉与高准确不是同一个结论。

知识可靠性

43.7

事实准确率

61.1%

无错误断言率

55.2%

综合智力

51.0

知识可靠性

43.4

事实准确率

61.9%

无错误断言率

51.7%

综合智力

52.5

知识可靠性

43.4

事实准确率

62.6%

无错误断言率

48.7%

综合智力

52.8

知识可靠性

42.2

事实准确率

60.6%

无错误断言率

53.5%

综合智力

49.7

数据更新于 2026年9月17日 22:12;本文分别比较知识可靠性、事实知识准确率和无错误断言率。三项指标含义不同,不能把任一项直接扩写成所有场景下的“幻觉率”。

哪个 AI 模型更少产生幻觉

当前知识可靠性排名前三的候选是 GPT-6 Astra (high)Claude Fable 5.1 (max with fallback)GPT-6 Astra (xhigh)。这项结果适合筛选事实问答候选,但不能保证模型在你的企业资料、最新事件、专业领域或检索流程中同样可靠。

“少说错话”包含两种不同能力:知道正确答案,以及不知道时避免自信地编造。只看准确率会忽略谨慎不答,只看非幻觉率又可能奖励过度保守,因此需要把两项放在一起。

知识可靠性排行榜

  1. GPT-6 Astra (high) — 43.7
  2. Claude Fable 5.1 (max with fallback) — 43.5
  3. GPT-6 Astra (xhigh) — 43.4
  4. GPT-6 Astra (max) — 43.4
  5. Claude Fable 5.1 (xhigh with fallback) — 42.4
  6. GPT-6 Astra (medium) — 42.2
  7. Claude Fable 5.1 (high with fallback) — 40.8
  8. GPT-6 Astra (low) — 40.5
  9. Claude Fable 5.1 (medium with fallback) — 37.6
  10. Claude Opus 5 (max) — 37.1

查看完整知识可靠性图表 · 了解评测方法

知识可靠性综合观察事实知识准确性与避免错误断言的能力,适合快速判断模型在知识问答中的整体取舍。

事实知识准确率排行榜

  1. Claude Fable 5.1 (max with fallback) — 67.2%
  2. Claude Fable 5.1 (xhigh with fallback) — 66.2%
  3. Claude Fable 5.1 (high with fallback) — 64.9%
  4. Claude Fable 5.1 (medium with fallback) — 63.1%
  5. GPT-6 Astra (max) — 62.6%
  6. GPT-6 Astra (xhigh) — 61.9%
  7. GPT-6 Astra (high) — 61.1%
  8. Claude Opus 5 (max) — 60.9%
  9. GPT-6 Astra (medium) — 60.6%
  10. Claude Fable 5.1 (low with fallback) — 60.2%

事实知识准确率关注模型给出完全正确答案的比例。它不等于“没有幻觉”:一个模型如果在不确定时选择不答,准确回答数量可能减少,但错误断言也可能减少。

无错误断言率排行榜

  1. MiniCPM5-1B (Non-reasoning) — 99.1%
  2. G9v3-3B — 88.3%
  3. G9v3-39A5B — 87.0%
  4. Command A+ — 85.8%
  5. LFM2.5-2.6B — 84.0%
  6. MiniCPM5-1B — 83.0%
  7. Qwen3.8 27B — 81.9%
  8. MiniMax-M3 — 81.6%
  9. Quasar 438B (max) — 78.6%
  10. MiniCPM5-2B — 78.1%

无错误断言率把正确回答与谨慎不答都视为没有作出错误事实断言。它更接近高风险场景对“不要瞎猜”的要求,但不代表模型回答了所有问题。

综合能力高也不等于事实永远正确

当前综合智力靠前的候选:

  1. Claude Fable 5.1 (max with fallback) — 53.4
  2. Claude Fable 5.1 (xhigh with fallback) — 53.2
  3. GPT-6 Astra (max) — 52.8
  4. GPT-6 Astra (xhigh) — 52.5
  5. Claude Fable 5.1 (high with fallback) — 51.2

综合智力衡量复杂任务能力,知识可靠性关注事实问答中的准确与克制。一个模型可能擅长推理、编程和长流程任务,但仍会在陌生事实、时效性信息或来源不足时出错。

不同场景怎样降低错误风险

  • 普通问答: 要求区分事实、推断与不确定内容,并允许明确回答“不知道”。
  • 企业知识库: 检索只能提供材料,仍要验证引用是否真的支持结论。
  • 研究与媒体: 保留来源、日期和原文位置,对关键数字做独立复核。
  • 客服与业务规则: 将关键政策写成可验证约束,禁止模型凭常识补全。
  • 医疗、法律和财务: 模型输出不能替代专业判断,高风险结论必须由合格人员复核。

接入搜索或检索增强并不会自动消除幻觉。模型仍可能引用错段落、混合多个来源、误读数字,或在材料没有答案时继续生成。验证流程应检查“答案是否正确”和“证据是否支持答案”两件事。

一套可执行的可靠性测试

  1. 从真实业务中收集有明确答案、无答案、答案过时和问题含歧义的样本。
  2. 给所有候选相同资料、相同提示词和相同工具权限。
  3. 分别记录正确、错误、无依据断言、谨慎不答和引用不匹配。
  4. 对高风险问题设置必须引用、必须确认或必须转人工的规则。
  5. 定期加入新问题复测,避免模型只适应一套固定题目。

最重要的业务指标通常不是“回答了多少”,而是“有多少答案可以安全使用”。在允许不答的场景中,可靠的拒答可能比流畅但错误的答案更有价值。

继续阅读