所有评测
智能体评测经济价值任务
真实职业任务综合表现
让智能体完成 44 种职业、9 个主要行业中的 220 项真实专业任务,以盲配对比较形成锚定人类专家基线的 Elo。
职业任务相对表现分Elo数值越高越好
评测要点
评测设置一览
01
任务数量
220 个
02
职业数量
44 种
03
行业数量
9 个
04
单任务上限
250 轮
05
人类基线
Elo 1000
06
指数权重
20%
评测方法与研究依据
先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。
学术与任务背景
学术与任务背景
公开职业任务研究由模型研究人员与具有行业经验的专业人士共同构建,职业分类覆盖多个主要行业与岗位。
当前榜单记录使用固定任务、统一沙箱和匿名盲配对规则,重点比较可交付成果的质量,而不是模型对自身能力的描述。
评测背景
评测背景
任务由具有行业经验的专业人士设计,要求生成文档、幻灯片、图表、示意图和电子表格等完整工作成果,而不是回答简短问题。
当前版本扩充了沙箱依赖、修正少量环境与提示问题、把轮数上限提高至 250,并以三位评审组成的评审池替代单一评审。
这项能力测什么
这项能力测什么
- 把复杂职业要求转化为可交付文件
- 结合参考文件、网页检索、计算和视觉信息完成任务
- 在长流程中规划、检查并提交多个成果文件
当前榜单口径
当前榜单口径
- 每项任务初始化新的隔离 Linux 沙箱,放入对应参考文件和文档处理、科学计算与排版工具。
- 智能体可使用网页获取、网页搜索、图片查看、代码执行、完成提交和放弃任务六类工具。
- 部分无法正常打开的办公文件仅修复缺失元数据或关系项,不改变正文、幻灯片内容与版式。
任务如何完成
任务如何完成
- 智能体在最多 250 轮内读取材料、生成一个或多个文件,并通过完成工具提交。
- 上下文使用超过 70% 时先总结当前状态,再压缩早期历史并继续任务。
- 同一任务的两份匿名提交进入盲配对;先平衡抽样,再优先比较 Elo 接近的模型。
如何计分
如何计分
- 每次比较由三位评审组成的评审池中抽取一位,选择较优提交或判为平局。
- 所有配对结果用 Bradley–Terry 最大似然模型拟合;平局各计半胜,置信区间使用 sandwich estimator。
- Elo 锚定人类专家成果为 1000;模型加入综合指数时会冻结当时的 Elo,再使用 clamp((Elo - 500) / 2000) 归一化。
结果怎么解读
结果怎么解读
- 报告 Elo、95% 置信区间及代表性任务提交。
- 展示每任务成本、总成本、输出 token、平均轮数和发布日期关系。
- 保留匿名配对结果用于解释 Elo 的相对差异。
解读限制
解读限制
- 每个任务只运行一次,单次沙箱或生成波动会直接进入结果。
- Elo 是相对指标,会随比较池与新增提交变化。
- 模型评审能够处理复杂文件,但仍存在评审偏差和不确定性。
示例任务
巡演乐队舞台布置图
作为巡演音视频技术人员,根据五位乐手的麦克风、返听、乐器、DI 盒和输入输出需求,制作一页横向 PDF 舞台图。
成功条件
- 舞台正面位于页面底部,成员与设备位置清晰
- 所有麦克风、返听、IEM 分线、功放和 DI 盒均有图标与标签
- 顶部包含按舞台位置对应编号的输入与输出列表