所有评测
智能体评测终端任务
高难度终端任务
在隔离终端环境中执行高难度软件工程、系统管理、数据处理、模型训练和游戏任务,以自动化测试验证最终结果。
平均任务成功率%数值越高越好
评测要点
评测设置一览
01
测试规模
Hard 子集 44 项任务
02
重复次数
每项 3 次
03
交互上限
每次最多 100 个执行回合
04
资源上限
每项 7,200 秒、每次 100 万输入 Token
评测方法与研究依据
先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。
学术与任务背景
学术与任务背景
公开终端任务框架由 Laude Institute、斯坦福大学研究人员与开源社区共同建设,并为每项任务配置机器可执行验证。
该历史高难子集使用固定快照和统一运行条件,适合观察模型在复杂终端任务中的完成能力。
评测背景
评测背景
该评测面向真实终端使用模式,任务包括编译代码、训练模型、配置服务器、调试系统、数据处理和游戏操作,结果由任务自带的验证脚本程序化检查。
当前 Hard 配置基于 2025 年 8 月 14 日的固定快照;少量存在外部依赖问题的任务被排除,因此实际评测 44 项。
这项能力测什么
这项能力测什么
- 理解开放式目标并在终端中规划多步操作。
- 完成软件工程、系统管理、模型训练与数据处理任务。
- 根据运行反馈定位错误并把环境推进到可验证的最终状态。
当前榜单口径
当前榜单口径
- 每项任务在隔离的容器化终端环境中运行,并使用统一的终端智能体运行器。
- 每项任务附带专用测试套件,模型不能直接改写最终判定规则。
- 每项运行 3 次;单次最多 100 个执行回合、7,200 秒和 100 万累计输入 Token。
任务如何完成
任务如何完成
- 模型读取任务说明,在终端中检查环境、执行命令、修改文件并验证中间结果。
- 运行在完成、达到回合上限或超时后结束,再执行该任务的验证测试。
- 对同一任务重复 3 次,并汇总三次首轮任务尝试的结果。
如何计分
如何计分
- 只有任务测试套件中的全部测试均通过时,该次运行才记为成功,否则记为失败。
- 每项采用 pass@1,最终分数为 44 项任务各 3 次运行结果的总体平均。
结果怎么解读
结果怎么解读
- 主指标为平均任务通过率百分比。
- 同时报告可见答案 Token 与可获得的推理 Token 用量。
- 按模型发布日期展示分数,辅助区分能力提升与发布时间差异。
解读限制
解读限制
- 固定快照与被排除任务限制了结果对完整任务库的代表性。
- 回合、超时和输入 Token 上限主要截断陷入循环的运行,但仍可能影响极长任务。
- 该历史 Hard 配置已经被更新版本替代,适合用于历史横向比较。
示例任务
离线缓存模型
在默认缓存位置准备指定基础模型及其分词器,使后续航班离线环境仍能直接加载。
成功条件
- 模型文件和分词器文件都已完整缓存。
- 两者均能在 local_files_only=True 的离线模式下成功加载。