所有评测
智能体评测终端智能体
终端环境任务成功率
在真实终端环境中检验智能体完成软件工程、系统管理、数据处理、模型训练与安全任务的能力。
任务成功率%数值越高越好
评测要点
评测设置一览
01
任务数量
89 项
02
任务领域
软件工程、系统管理、数据处理、模型训练、安全
03
重复次数
每项任务 3 次
04
执行环境
隔离的真实终端沙箱
05
主指标
3 次重复的平均 pass@1
评测方法与研究依据
先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。
学术与任务背景
学术与任务背景
公开任务框架由 Laude Institute、斯坦福大学研究人员与开源社区共同维护,任务包含人工解法和机器可执行验证。
当前榜单记录采用 89 项经校验任务、统一隔离终端环境和三次重复运行,以机器可执行测试判定是否完整完成。
评测背景
评测背景
v2.1 是对 v2.0 的核验刷新,保留 89 项人工策划任务,并修补容器环境与任务说明问题;约十余项任务修正了依赖缺失或说明与测试不一致的情况。
每项任务都有独立环境、人工解法与完整验证套件,结果强调是否真正完成终端任务,而不是只评判文字回答。
这项能力测什么
这项能力测什么
- 在命令行中规划并执行多步骤操作。
- 调试软件、系统服务、数据流程与安全配置。
- 根据验证反馈修复环境并交付可运行结果。
当前榜单口径
当前榜单口径
- 为每项任务启动隔离沙箱,并载入该任务的唯一终端环境。
- 任务随附机器可执行的验证套件;智能体通过终端执行框架与环境交互。
- 每个模型对每项任务运行 3 次。
任务如何完成
任务如何完成
- 向智能体提供任务说明和终端访问权限。
- 智能体在环境内创建、修改、运行并排查所需资源。
- 任务结束后运行随题验证套件,记录本次是否通过。
如何计分
如何计分
- 单次运行由验证套件给出通过或未通过。
- 每项任务取 3 次重复的 pass@1,再对全部 89 项任务求平均。
- 主成绩以百分比报告,数值越高表示完成任务的稳定性越强。
结果怎么解读
结果怎么解读
- 报告 pass@1 总分及随发布日期的变化。
- 报告每任务平均输出 Token,并拆分推理 Token 与答案 Token。
- 报告每任务成本和加权平均解码时间;时间不包含首 Token 等待与额外开销。
解读限制
解读限制
- 结果只覆盖这 89 项终端任务,不等同于所有软件工程或运维工作。
- 通过与否依赖随题验证套件能够观察到的最终状态。
- v2.1 修复了旧版环境与说明问题,跨版本比较时应区分任务版本。
示例任务
多分支 HTTPS 部署
配置一个支持密码登录的 Git SSH 服务,把 main 与 dev 两个分支分别部署到根路径和 /dev 路径,并使用自签名证书;每次推送都由 post-receive 钩子触发部署。
成功条件
- SSH 服务接受指定密码并允许克隆和推送。
- 两个分支分别在对应 HTTPS 路径返回预期页面内容。
- 推送后 3 秒内完成部署。