所有评测
推理与知识竞赛数学

邀请赛数学推理

使用 2025 年两套邀请赛的全部 30 道题,检验代数、几何、数论和组合数学中的高难度推理与精确整数作答。

十次运行平均正确率%数值越高越好

评测要点

评测设置一览

01
题目数量
30 题
02
领域
代数、几何、数论、组合
03
答案格式
000–999 的整数表示
04
重复次数
每题 10 次

评测方法与研究依据

先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。

学术与任务背景

题目来自美国数学协会组织的邀请赛,覆盖代数、几何、数论和组合数学,并使用可核验的三位整数答案。

当前榜单记录使用固定年份的全部题目、十次重复和统一答案核对规则,用于观察高难度数学推理的稳定性。

评测背景

该竞赛面向高中数学拔尖学生,题目要求在没有选择项的情况下完成高难度计算与数学洞察。

2025 配置包含两套试卷的全部 30 道题,答案以严格的三位整数格式提交。

这项能力测什么

  • 完成奥林匹克级代数、几何、数论和组合推理。
  • 逐步推导并控制复杂计算的准确性。
  • 从完整推理中提炼严格的整数最终答案。

当前榜单口径

  • 运行 2025 年两套试卷共 30 道题,每题重复 10 次。
  • 提示要求逐步求解,并把最终答案放入 LaTeX 的 boxed 标记中。
  • 答案先由脚本和符号归一化检查,必要时再使用等价性判定作为后备。

任务如何完成

  • 逐题提交原始数学问题,模型生成推导并在 boxed 中给出最终答案。
  • 提取数值答案并做符号归一化,再与标准整数答案比较。
  • 脚本无法稳定判定时,只检查两个答案是否等价;每题共运行 10 次。

如何计分

  • 每次回答按首答是否正确记为 pass@1,不因后续修正追加尝试。
  • 最终分数汇总 30 道题各 10 次运行的正确比例。

结果怎么解读

  • 主指标为重复运行后的平均正确率。
  • 同时报告输入、推理、答案 Token 与评测成本。

解读限制

  • 固定年份只有 30 道题,单题波动会明显影响总分。
  • 严格数值格式可能让数学思路正确但最终表达不合规的回答失分。
  • 重复 10 次用于观察输出方差,不能代表更长时间或其他年份的竞赛表现。

示例任务

进位制整除问题

求所有大于 9 的整数进位制 b,使以 b 为底的两位数 17 能整除两位数 97,并计算所有这类 b 的和。

成功条件

  • 给出可核对的逐步数学推导。
  • 最终结果是有效整数,并放在 boxed 标记中。