所有评测
推理与知识知识可靠性

知识准确性与非幻觉能力

同时衡量事实知识、知识边界识别与错误猜测,区分准确回答、拒答和幻觉。

知识可靠性指数-100 至 100数值越高越好

评测要点

评测设置一览

01
题目数量
6,000 题
02
主题数量
42 个
03
领域数量
6 个
04
指数范围
-100 至 100
05
重复次数
每题 1 次
06
零分含义
正确答案数与错误答案数相同

评测方法与研究依据

先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。

学术与任务背景

该维度使用固定事实问题、统一回答分类和同一计分公式,同时公开准确率、非幻觉率和综合指数,避免单一数字掩盖模型的拒答倾向。

评测背景

六个领域为商业、人文与社会科学、科学工程与数学、健康、法律和软件工程;题目由自动化问题生成流程构建,以扩大覆盖面并保持问题明确。

该评测奖励正确事实、惩罚错误猜测,并允许模型在不确定时拒答,以观察知识可靠性与校准能力。

这项能力测什么

  • 跨专业领域的事实回忆。
  • 识别自身知识边界并在不确定时克制回答。
  • 在准确率与错误猜测之间保持可靠校准。

当前榜单口径

  • 从 42 个经济相关主题中组织 6,000 道事实问题。
  • 回答结果区分正确、部分回答、错误与未作答。
  • 同一批结果用于计算指数、准确率和幻觉率。
  • 每道题独立运行 1 次。

任务如何完成

  • 逐题向模型提问,模型可以直接回答或明确表示不知道。
  • 将响应归类为正确、部分回答、错误或未作答。
  • 按统一定义汇总全体题目和各领域结果。

如何计分

  • 指数奖励正确答案、惩罚错误答案,拒答不受惩罚;范围为 -100 至 100。
  • 准确率为正确答案占全部 6,000 题的比例,不因模型拒答而改变分母。
  • 幻觉率 = 错误 /(错误 + 部分回答 + 未作答),越低越好。

结果怎么解读

  • 报告主指数、准确率和幻觉率。
  • 报告六大领域的指数,并提供按领域归一化的横向比较。
  • 报告输入、推理、答案 Token 及对应成本。

解读限制

  • 指数零分不等于零准确率,而是正确与错误数量相抵。
  • 自动化生成的题目集中于 42 个经济相关主题,并非无限领域知识普查。
  • 不同领域表现差异明显,总指数不能替代具体领域结果。

示例任务

异步模型中的单任务并发术语

询问在 Rust 2024 版异步模型中,单个任务内部的并发相对于任务之间并发所使用的标准术语。

成功条件

  • 给出与标准答案一致的术语。
  • 不以宽泛的线程并发概念替代目标术语。
  • 无法确定时可以明确拒答,避免错误猜测。