AI 模型幻觉率对比:知识准确性与可靠性怎么看
哪个 AI 模型更少产生幻觉?分别比较知识可靠性、事实知识准确率与无错误断言率,解释低幻觉不等于高准确,并提供问答、检索和企业知识库场景的验证方法。
快速结论
30 秒先看结论
先看关键结论,再结合任务、预算和等待时间做选择。

选型对照
知识可靠性前列模型
按知识可靠性排列,同时展示事实准确率、无错误断言率和综合智力;低幻觉与高准确不是同一个结论。
知识可靠性
43.7
事实准确率
61.1%
无错误断言率
55.2%
综合智力
51.0
知识可靠性
43.5
事实准确率
67.2%
无错误断言率
27.4%
综合智力
53.4
知识可靠性
43.4
事实准确率
61.9%
无错误断言率
51.7%
综合智力
52.5
知识可靠性
43.4
事实准确率
62.6%
无错误断言率
48.7%
综合智力
52.8
知识可靠性
42.4
事实准确率
66.2%
无错误断言率
29.5%
综合智力
53.2
知识可靠性
42.2
事实准确率
60.6%
无错误断言率
53.5%
综合智力
49.7
数据更新于 2026年9月17日 22:12;本文分别比较知识可靠性、事实知识准确率和无错误断言率。三项指标含义不同,不能把任一项直接扩写成所有场景下的“幻觉率”。
哪个 AI 模型更少产生幻觉
当前知识可靠性排名前三的候选是 GPT-6 Astra (high)、Claude Fable 5.1 (max with fallback)、GPT-6 Astra (xhigh)。这项结果适合筛选事实问答候选,但不能保证模型在你的企业资料、最新事件、专业领域或检索流程中同样可靠。
“少说错话”包含两种不同能力:知道正确答案,以及不知道时避免自信地编造。只看准确率会忽略谨慎不答,只看非幻觉率又可能奖励过度保守,因此需要把两项放在一起。
知识可靠性排行榜
- GPT-6 Astra (high) — 43.7
- Claude Fable 5.1 (max with fallback) — 43.5
- GPT-6 Astra (xhigh) — 43.4
- GPT-6 Astra (max) — 43.4
- Claude Fable 5.1 (xhigh with fallback) — 42.4
- GPT-6 Astra (medium) — 42.2
- Claude Fable 5.1 (high with fallback) — 40.8
- GPT-6 Astra (low) — 40.5
- Claude Fable 5.1 (medium with fallback) — 37.6
- Claude Opus 5 (max) — 37.1
知识可靠性综合观察事实知识准确性与避免错误断言的能力,适合快速判断模型在知识问答中的整体取舍。
事实知识准确率排行榜
- Claude Fable 5.1 (max with fallback) — 67.2%
- Claude Fable 5.1 (xhigh with fallback) — 66.2%
- Claude Fable 5.1 (high with fallback) — 64.9%
- Claude Fable 5.1 (medium with fallback) — 63.1%
- GPT-6 Astra (max) — 62.6%
- GPT-6 Astra (xhigh) — 61.9%
- GPT-6 Astra (high) — 61.1%
- Claude Opus 5 (max) — 60.9%
- GPT-6 Astra (medium) — 60.6%
- Claude Fable 5.1 (low with fallback) — 60.2%
事实知识准确率关注模型给出完全正确答案的比例。它不等于“没有幻觉”:一个模型如果在不确定时选择不答,准确回答数量可能减少,但错误断言也可能减少。
无错误断言率排行榜
- MiniCPM5-1B (Non-reasoning) — 99.1%
- G9v3-3B — 88.3%
- G9v3-39A5B — 87.0%
- Command A+ — 85.8%
- LFM2.5-2.6B — 84.0%
- MiniCPM5-1B — 83.0%
- Qwen3.8 27B — 81.9%
- MiniMax-M3 — 81.6%
- Quasar 438B (max) — 78.6%
- MiniCPM5-2B — 78.1%
无错误断言率把正确回答与谨慎不答都视为没有作出错误事实断言。它更接近高风险场景对“不要瞎猜”的要求,但不代表模型回答了所有问题。
综合能力高也不等于事实永远正确
当前综合智力靠前的候选:
- Claude Fable 5.1 (max with fallback) — 53.4
- Claude Fable 5.1 (xhigh with fallback) — 53.2
- GPT-6 Astra (max) — 52.8
- GPT-6 Astra (xhigh) — 52.5
- Claude Fable 5.1 (high with fallback) — 51.2
综合智力衡量复杂任务能力,知识可靠性关注事实问答中的准确与克制。一个模型可能擅长推理、编程和长流程任务,但仍会在陌生事实、时效性信息或来源不足时出错。
不同场景怎样降低错误风险
- 普通问答: 要求区分事实、推断与不确定内容,并允许明确回答“不知道”。
- 企业知识库: 检索只能提供材料,仍要验证引用是否真的支持结论。
- 研究与媒体: 保留来源、日期和原文位置,对关键数字做独立复核。
- 客服与业务规则: 将关键政策写成可验证约束,禁止模型凭常识补全。
- 医疗、法律和财务: 模型输出不能替代专业判断,高风险结论必须由合格人员复核。
接入搜索或检索增强并不会自动消除幻觉。模型仍可能引用错段落、混合多个来源、误读数字,或在材料没有答案时继续生成。验证流程应检查“答案是否正确”和“证据是否支持答案”两件事。
一套可执行的可靠性测试
- 从真实业务中收集有明确答案、无答案、答案过时和问题含歧义的样本。
- 给所有候选相同资料、相同提示词和相同工具权限。
- 分别记录正确、错误、无依据断言、谨慎不答和引用不匹配。
- 对高风险问题设置必须引用、必须确认或必须转人工的规则。
- 定期加入新问题复测,避免模型只适应一套固定题目。
最重要的业务指标通常不是“回答了多少”,而是“有多少答案可以安全使用”。在允许不答的场景中,可靠的拒答可能比流畅但错误的答案更有价值。