所有评测
编程评测科学编程

科研编程任务通过率

以真实科研问题检验科学知识、推理与代码合成能力,答案由可执行测试验证。

科研子任务通过率%数值越高越好

评测要点

评测设置一览

01
主问题
80 个
02
评测子问题
288 个测试子问题
03
完整题库
338 个子问题,另含 50 个验证子问题
04
学科数量
16 个
05
重复次数
每个测试子问题 3 次
06
验证方式
科研人员标注的测试用例

评测方法与研究依据

先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。

学术与任务背景

公开研究由伊利诺伊大学厄巴纳-香槟分校、阿贡国家实验室、卡内基梅隆大学、MIT、哈佛大学、斯坦福大学、普林斯顿大学等多家机构的科研人员参与。

该公开题集入选 NeurIPS 数据集与基准研究方向,问题和参考实现均由对应科学领域的研究人员策划或核验。

评测背景

80 个真实实验室问题来自数学、物理、化学、生物与材料科学等 16 个自然科学子领域,并自然拆分为多个子问题。

任务不只要求写代码,还要求回忆科学知识、完成推理并把研究问题转化为可执行实现。

这项能力测什么

  • 把科学公式和领域约束转化为程序。
  • 分解复杂科研问题并逐步实现子函数。
  • 通过数值与结构测试验证科研代码。

当前榜单口径

  • 评测使用 288 个测试子问题,不包含另外 50 个验证子问题。
  • 每题提供函数要求、输入输出约束与测试用例;部分题目还提供可选科学背景说明。
  • 参考实现和测试由科研人员标注。
  • 每个测试子问题独立运行 3 次。

任务如何完成

  • 模型根据主问题与当前子问题生成指定函数代码。
  • 按子问题顺序组合必要的中间函数和最终计算。
  • 运行随题测试用例,验证数值、形状与返回结构。

如何计分

  • 子问题代码通过全部指定测试时记为通过。
  • 主成绩按 288 个测试子问题、每个子问题 3 次运行的平均通过比例报告。
  • 机器执行测试决定结果,不以代码风格或文字解释打分。

结果怎么解读

  • 报告测试子问题通过率及随发布日期的变化。
  • 报告完整评测的输入、推理和答案 Token。
  • 报告完整评测成本并拆分输入、推理与答案成本。

解读限制

  • 当前口径只使用 288 个测试子问题,不计入 50 个验证子问题。
  • 可执行测试强调可验证科研代码,不能覆盖实验设计和现实实验操作。
  • 是否提供可选科学背景会改变模型获得的信息,比较时需保持设置一致。

示例任务

周期体系的 Ewald 求和

实现周期体系能量计算,将问题拆为求 alpha、生成晶格坐标、构造粒子距离以及计算实空间和倒空间项等函数。

成功条件

  • 函数签名和数组形状符合题目约束。
  • 多个晶格、原子电荷与坐标样例均通过数值近似测试。
  • 组合后的函数返回正确总能量。