所有评测
编程评测代码执行
新题编程能力
持续使用三个主流编程竞赛平台的新题,检验 Python 代码生成及在隐藏测试下解决算法问题的能力。
代码通过率%数值越高越好
评测要点
评测设置一览
01
当前题量
315 道代码题
02
重复次数
每题 3 次
03
输出形式
可执行 Python 代码
04
运行环境
Ubuntu 22.04 LTS、Python 3.12
评测方法与研究依据
先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。
学术与任务背景
学术与任务背景
公开研究由加州大学伯克利分校、MIT、康奈尔大学等团队参与,并发表于 ICLR。
题目持续取自新发布的主流编程竞赛问题,用执行测试而不是文字评审判断代码是否真正可用。
评测背景
评测背景
静态代码基准可能被训练数据覆盖,该评测持续收集新发布的竞赛编程问题,以降低题目污染并保持难度更新。
完整框架覆盖代码生成、自我修复、代码执行和测试输出预测;当前配置使用 315 道代码生成题进行统一比较。
这项能力测什么
这项能力测什么
- 理解算法题、约束、输入输出和已有函数签名。
- 生成可执行 Python 解法并处理隐藏边界条件。
- 将推理落实为能通过全部单元测试的程序。
当前榜单口径
当前榜单口径
- 运行 315 道 Python 代码生成题,每题重复 3 次。
- 代码在 Ubuntu 22.04 LTS、Python 3.12 环境中执行。
- 沿用题目提示格式,但不应用额外的通用或模型定制系统提示。
任务如何完成
任务如何完成
- 有起始代码时,模型按指定函数头补全解法;无起始代码时,从标准输入读取并写入标准输出。
- 只从 python 代码围栏中提取程序,然后在隔离环境执行隐藏单元测试。
- 每题重复 3 次并记录每次首次生成代码是否通过全部测试。
如何计分
如何计分
- 一次生成只有通过该题全部单元测试才计为成功,采用 pass@1。
- 最终分数为 315 道题、每题 3 次运行的平均通过率。
结果怎么解读
结果怎么解读
- 主指标为代码执行 pass@1 百分比。
- 同时报告输入、推理、答案 Token,评测成本与每任务用时。
- 结合模型发布日期呈现分数,以观察新题上的能力变化。
解读限制
解读限制
- 当前配置只运行 Python 代码生成子集,不能代表完整软件工程能力。
- 全部测试必须通过的二元评分不区分接近正确与完全错误。
- 持续加入新题可降低已知污染风险,但不能证明训练数据绝对未覆盖。
示例任务
判断矩形角点是否可达
给定矩形右上角坐标和若干圆形障碍,判断能否从左下角走到右上角,路径不得接触或进入圆,也不得接触矩形的其他边界。
成功条件
- 样例 xCorner=3、yCorner=4、circles=[[2,1,1]] 返回 true。
- 程序处理最多 1,000 个圆及坐标上限 10^9,并通过全部隐藏测试。