AI 模型幻觉率对比:知识准确性与可靠性怎么看
哪个 AI 模型更少产生幻觉?分别比较知识可靠性、事实知识准确率与无错误断言率,解释低幻觉不等于高准确,并提供问答、检索和企业知识库场景的验证方法。
快速结论
30 秒先看结论
先看关键结论,再结合任务、预算和等待时间做选择。

选型对照
知识可靠性前列模型
按知识可靠性排列,同时展示事实准确率、无错误断言率和综合智力;低幻觉与高准确不是同一个结论。
知识可靠性
40.1
事实准确率
61.4%
无错误断言率
45.1%
综合智力
59.9
知识可靠性
32.9
事实准确率
55.3%
无错误断言率
50.1%
综合智力
46.5
知识可靠性
31.3
事实准确率
54.2%
无错误断言率
49.9%
综合智力
60.7
知识可靠性
29.8
事实准确率
53.3%
无错误断言率
49.8%
综合智力
60.1
知识可靠性
28.1
事实准确率
52.7%
无错误断言率
48.1%
综合智力
58.9
知识可靠性
26.4
事实准确率
52.0%
无错误断言率
46.5%
综合智力
53.8
数据更新于 2026年8月3日 20:42;本文分别比较知识可靠性、事实知识准确率和无错误断言率。三项指标含义不同,不能把任一项直接扩写成所有场景下的“幻觉率”。
哪个 AI 模型更少产生幻觉
当前知识可靠性排名前三的候选是 Claude Fable 5 (with fallback)、Gemini 3.1 Pro Preview、Claude Opus 5 (max)。这项结果适合筛选事实问答候选,但不能保证模型在你的企业资料、最新事件、专业领域或检索流程中同样可靠。
“少说错话”包含两种不同能力:知道正确答案,以及不知道时避免自信地编造。只看准确率会忽略谨慎不答,只看非幻觉率又可能奖励过度保守,因此需要把两项放在一起。
知识可靠性排行榜
- Claude Fable 5 (with fallback) — 40.1
- Gemini 3.1 Pro Preview — 32.9
- Claude Opus 5 (max) — 31.3
- Claude Opus 5 (xhigh) — 29.8
- Claude Opus 5 (high) — 28.1
- Grok 4.5 (high) — 26.4
- Claude Opus 5 (medium) — 25.6
- Gemini 3.6 Flash — 23.5
- Claude Opus 5 (low) — 23.2
- Gemini 3.5 Flash — 22.7
知识可靠性综合观察事实知识准确性与避免错误断言的能力,适合快速判断模型在知识问答中的整体取舍。
事实知识准确率排行榜
- Claude Fable 5 (with fallback) — 61.4%
- GPT-5.6 Sol (max) — 58.5%
- GPT-5.6 Sol (xhigh) — 58.0%
- GPT-5.6 Sol (high) — 57.3%
- GPT-5.6 Sol (medium) — 56.7%
- GPT-5.6 Sol (low) — 56.4%
- Gemini 3.1 Pro Preview — 55.3%
- Claude Opus 5 (max) — 54.2%
- Claude Opus 5 (xhigh) — 53.3%
- Claude Opus 5 (high) — 52.7%
事实知识准确率关注模型给出完全正确答案的比例。它不等于“没有幻觉”:一个模型如果在不确定时选择不答,准确回答数量可能减少,但错误断言也可能减少。
无错误断言率排行榜
- MiniCPM5-1B — 99.1%
- G9v3-3B — 87.9%
- Command A+ — 85.9%
- G9v3-39A5B — 85.3%
- Grok 4.3 (medium) — 84.0%
- MiniMax-M3 — 83.9%
- Grok 4.3 (low) — 83.5%
- MiniCPM5-1B — 81.3%
- Qwen3.7 Max — 77.1%
- MiMo-V2.5-Pro — 75.5%
无错误断言率把正确回答与谨慎不答都视为没有作出错误事实断言。它更接近高风险场景对“不要瞎猜”的要求,但不代表模型回答了所有问题。
综合能力高也不等于事实永远正确
当前综合智力靠前的候选:
- Claude Opus 5 (max) — 60.7
- Claude Opus 5 (xhigh) — 60.1
- Claude Fable 5 (with fallback) — 59.9
- GPT-5.6 Sol (max) — 58.9
- Claude Opus 5 (high) — 58.9
综合智力衡量复杂任务能力,知识可靠性关注事实问答中的准确与克制。一个模型可能擅长推理、编程和长流程任务,但仍会在陌生事实、时效性信息或来源不足时出错。
不同场景怎样降低错误风险
- 普通问答: 要求区分事实、推断与不确定内容,并允许明确回答“不知道”。
- 企业知识库: 检索只能提供材料,仍要验证引用是否真的支持结论。
- 研究与媒体: 保留来源、日期和原文位置,对关键数字做独立复核。
- 客服与业务规则: 将关键政策写成可验证约束,禁止模型凭常识补全。
- 医疗、法律和财务: 模型输出不能替代专业判断,高风险结论必须由合格人员复核。
接入搜索或检索增强并不会自动消除幻觉。模型仍可能引用错段落、混合多个来源、误读数字,或在材料没有答案时继续生成。验证流程应检查“答案是否正确”和“证据是否支持答案”两件事。
一套可执行的可靠性测试
- 从真实业务中收集有明确答案、无答案、答案过时和问题含歧义的样本。
- 给所有候选相同资料、相同提示词和相同工具权限。
- 分别记录正确、错误、无依据断言、谨慎不答和引用不匹配。
- 对高风险问题设置必须引用、必须确认或必须转人工的规则。
- 定期加入新问题复测,避免模型只适应一套固定题目。
最重要的业务指标通常不是“回答了多少”,而是“有多少答案可以安全使用”。在允许不答的场景中,可靠的拒答可能比流畅但错误的答案更有价值。