所有评测
编程评测科学编程
科研编程任务通过率
以真实科研问题检验科学知识、推理与代码合成能力,答案由可执行测试验证。
科研子任务通过率%数值越高越好
评测要点
评测设置一览
01
主问题
80 个
02
评测子问题
288 个测试子问题
03
完整题库
338 个子问题,另含 50 个验证子问题
04
学科数量
16 个
05
重复次数
每个测试子问题 3 次
06
验证方式
科研人员标注的测试用例
评测方法与研究依据
先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。
学术与任务背景
学术与任务背景
公开研究由伊利诺伊大学厄巴纳-香槟分校、阿贡国家实验室、卡内基梅隆大学、MIT、哈佛大学、斯坦福大学、普林斯顿大学等多家机构的科研人员参与。
该公开题集入选 NeurIPS 数据集与基准研究方向,问题和参考实现均由对应科学领域的研究人员策划或核验。
评测背景
评测背景
80 个真实实验室问题来自数学、物理、化学、生物与材料科学等 16 个自然科学子领域,并自然拆分为多个子问题。
任务不只要求写代码,还要求回忆科学知识、完成推理并把研究问题转化为可执行实现。
这项能力测什么
这项能力测什么
- 把科学公式和领域约束转化为程序。
- 分解复杂科研问题并逐步实现子函数。
- 通过数值与结构测试验证科研代码。
当前榜单口径
当前榜单口径
- 评测使用 288 个测试子问题,不包含另外 50 个验证子问题。
- 每题提供函数要求、输入输出约束与测试用例;部分题目还提供可选科学背景说明。
- 参考实现和测试由科研人员标注。
- 每个测试子问题独立运行 3 次。
任务如何完成
任务如何完成
- 模型根据主问题与当前子问题生成指定函数代码。
- 按子问题顺序组合必要的中间函数和最终计算。
- 运行随题测试用例,验证数值、形状与返回结构。
如何计分
如何计分
- 子问题代码通过全部指定测试时记为通过。
- 主成绩按 288 个测试子问题、每个子问题 3 次运行的平均通过比例报告。
- 机器执行测试决定结果,不以代码风格或文字解释打分。
结果怎么解读
结果怎么解读
- 报告测试子问题通过率及随发布日期的变化。
- 报告完整评测的输入、推理和答案 Token。
- 报告完整评测成本并拆分输入、推理与答案成本。
解读限制
解读限制
- 当前口径只使用 288 个测试子问题,不计入 50 个验证子问题。
- 可执行测试强调可验证科研代码,不能覆盖实验设计和现实实验操作。
- 是否提供可选科学背景会改变模型获得的信息,比较时需保持设置一致。
示例任务
周期体系的 Ewald 求和
实现周期体系能量计算,将问题拆为求 alpha、生成晶格坐标、构造粒子距离以及计算实空间和倒空间项等函数。
成功条件
- 函数签名和数组形状符合题目约束。
- 多个晶格、原子电荷与坐标样例均通过数值近似测试。
- 组合后的函数返回正确总能量。