所有评测
推理与知识知识可靠性
知识准确性与非幻觉能力
同时衡量事实知识、知识边界识别与错误猜测,区分准确回答、拒答和幻觉。
知识可靠性指数-100 至 100数值越高越好
评测要点
评测设置一览
01
题目数量
6,000 题
02
主题数量
42 个
03
领域数量
6 个
04
指数范围
-100 至 100
05
重复次数
每题 1 次
06
零分含义
正确答案数与错误答案数相同
评测方法与研究依据
先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。
学术与任务背景
学术与任务背景
该维度使用固定事实问题、统一回答分类和同一计分公式,同时公开准确率、非幻觉率和综合指数,避免单一数字掩盖模型的拒答倾向。
评测背景
评测背景
六个领域为商业、人文与社会科学、科学工程与数学、健康、法律和软件工程;题目由自动化问题生成流程构建,以扩大覆盖面并保持问题明确。
该评测奖励正确事实、惩罚错误猜测,并允许模型在不确定时拒答,以观察知识可靠性与校准能力。
这项能力测什么
这项能力测什么
- 跨专业领域的事实回忆。
- 识别自身知识边界并在不确定时克制回答。
- 在准确率与错误猜测之间保持可靠校准。
当前榜单口径
当前榜单口径
- 从 42 个经济相关主题中组织 6,000 道事实问题。
- 回答结果区分正确、部分回答、错误与未作答。
- 同一批结果用于计算指数、准确率和幻觉率。
- 每道题独立运行 1 次。
任务如何完成
任务如何完成
- 逐题向模型提问,模型可以直接回答或明确表示不知道。
- 将响应归类为正确、部分回答、错误或未作答。
- 按统一定义汇总全体题目和各领域结果。
如何计分
如何计分
- 指数奖励正确答案、惩罚错误答案,拒答不受惩罚;范围为 -100 至 100。
- 准确率为正确答案占全部 6,000 题的比例,不因模型拒答而改变分母。
- 幻觉率 = 错误 /(错误 + 部分回答 + 未作答),越低越好。
结果怎么解读
结果怎么解读
- 报告主指数、准确率和幻觉率。
- 报告六大领域的指数,并提供按领域归一化的横向比较。
- 报告输入、推理、答案 Token 及对应成本。
解读限制
解读限制
- 指数零分不等于零准确率,而是正确与错误数量相抵。
- 自动化生成的题目集中于 42 个经济相关主题,并非无限领域知识普查。
- 不同领域表现差异明显,总指数不能替代具体领域结果。
示例任务
异步模型中的单任务并发术语
询问在 Rust 2024 版异步模型中,单个任务内部的并发相对于任务之间并发所使用的标准术语。
成功条件
- 给出与标准答案一致的术语。
- 不以宽泛的线程并发概念替代目标术语。
- 无法确定时可以明确拒答,避免错误猜测。