所有评测
推理与知识长上下文

长文档综合推理通过率

衡量模型从 10k 至 100k Token 的长文档中提取、连接并综合分散信息的能力。

任务通过率%数值越高越好

评测要点

评测设置一览

01
题目数量
100 题
02
重复次数
每题 3 次
03
文档长度
10k–100k Token
04
长度口径
cl100k_base 分词
05
题型
开放式答案
06
评分
逐题通过/未通过

评测方法与研究依据

先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。

学术与任务背景

该维度采用固定长文档、标准问题和一致的语义等价判分规则,重点检验跨段证据关联,而不是只测可容纳的上下文长度。

评测背景

题目覆盖学术论文、公司文件、政府咨询、法律文件、行业报告与营销材料等长文档类型。

每题要求跨多个分散段落进行多步推理与综合,目标是区分真实长文理解和简单信息抽取。

这项能力测什么

  • 在长文档中定位分散证据。
  • 连接跨章节、跨材料的信息并完成多步推理。
  • 生成明确、可核对的开放式答案。

当前榜单口径

  • 为每道题提供对应长文档集合,输入长度处于 10k 至 100k Token。
  • 保留文档的领域结构与格式,让模型在完整上下文中作答。
  • 每题配有标准答案,用于判断语义等价性。
  • 每道题独立运行 3 次。

任务如何完成

  • 模型阅读文档和问题,从不同位置提取相关信息。
  • 模型完成必要计算、排序或综合后提交一个开放式答案。
  • 判分模型比较提交答案与标准答案是否等价。

如何计分

  • 每题采用通过/未通过判定。
  • 答案被判定与标准答案等价时记为通过。
  • 最终成绩是 100 道题、每题 3 次运行的平均通过率。

结果怎么解读

  • 报告平均通过率及随发布日期的变化。
  • 报告完整评测的输入、推理和答案 Token 用量。
  • 报告完整评测成本,并按输入、推理和答案成本拆分。

解读限制

  • 开放式答案依赖语义等价判分模型的判断。
  • 文档范围集中在列出的专业材料类型,不能代表全部长上下文场景。
  • 大上下文窗口只表示容量,不保证在本评测中获得高分。

示例任务

公司文件中的权益差额

根据给定公司文件,找出两家主要公司的股东权益,并计算它们在 2023 年 6 月 30 日的差额,结果以千美元报告。

成功条件

  • 定位两家公司及正确报告日期。
  • 从分散文件中提取对应股东权益数值。
  • 完成差额计算并使用指定单位。