所有评测
智能体评测长流程知识工作
复杂知识工作综合评分
通过多周业务项目、数千份输入材料和 91 个交付任务,评估智能体完成复杂知识工作的正确性、分析质量与呈现质量。
知识工作综合评分Elo数值越高越好
评测要点
评测设置一览
01
正式项目
4 个
02
任务总数
91 个
03
每周任务
2–5 个
04
单任务上限
500 轮
05
运行次数
每任务 1 次
06
核心评分
Elo + 二元量表
评测方法与研究依据
先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。
学术与任务背景
学术与任务背景
该维度采用固定项目、统一隔离环境和一致评分规则,重点考察最终交付物,而不是模型在对话中的自我描述。
成对盲评、原子量表与置信区间共同用于降低单一评审和单一任务带来的偶然性。
评测背景
评测背景
评测把数据科学、产品管理、公司战略等工作组织为连贯的多周项目。任务共享组织背景与资料池,要求产出表格、演示文稿、备忘录等真实工作成果。
每个任务仍以单独运行完成,不继承模型在先前任务中的自有提交;后续任务可获得统一的基准文件,以维持项目连续性和横向可比性。
这项能力测什么
这项能力测什么
- 从大量混杂资料中发现要求、证据与跨文件冲突
- 完成长流程分析并生成可编辑的专业交付物
- 兼顾可验证正确性、分析严谨度和专业呈现
当前榜单口径
当前榜单口径
- 每周在隔离、无网络的沙箱中运行,只能访问共享资料和当周资料。
- 资料包含聊天记录、表格、PDF、访谈、市场研究、标准文档、董事会材料和邮件等真实、增强或合成内容。
- 提供代码执行、提交和放弃工具;支持视觉的模型还可查看图片。
任务如何完成
任务如何完成
- 智能体接收当前任务说明和可访问资料,在最多 500 轮内完成指定文件。
- 完成后提交摘要与交付文件的绝对路径;未提交的文件不参与评分。
- 每项任务分别接受二元量表检查,以及分析质量和呈现质量的盲配对比较。
如何计分
如何计分
- 量表检查为严格的通过/失败,不提供部分分;只依据提交成果中的证据判定。
- 分析质量比较更深入、结构更清晰且证据更充分的成果;呈现质量比较更专业的成果。
- 主指标把分析质量 Elo、呈现质量 Elo 和量表通过率转换后的 Elo 合并;Elo 与 95% 置信区间下限均不低于 0。
结果怎么解读
结果怎么解读
- 报告综合 Elo、量表通过率、分析质量 Elo 和呈现质量 Elo。
- 按 Excel、PowerPoint、PDF、Word 与其他文件类型拆分表现。
- 同时报告每任务成本、工具调用、资料探索覆盖率和发布日期关系。
解读限制
解读限制
- 四个正式项目的完整任务与资料不公开;第五个公开场景只用于说明结构,不计入正式成绩。
- 任务独立运行,因此不测量模型跨周记忆自身成果的能力。
- 评分包含模型评审,虽采用平衡抽样与盲化,仍可能存在判断不确定性。
示例任务
尽职调查:市场结构图
智能体从一周的尽调资料池中筛选相关文件,完成市场结构分析,并提交规定名称的 PDF 与源文件。
成功条件
- 交付物覆盖任务量表要求并引用具体证据
- 分析结构完整、结论受到材料支持
- 最终成果达到专业汇报所需的呈现质量