所有评测
推理与知识竞赛数学
邀请赛数学推理
使用 2025 年两套邀请赛的全部 30 道题,检验代数、几何、数论和组合数学中的高难度推理与精确整数作答。
十次运行平均正确率%数值越高越好
评测要点
评测设置一览
01
题目数量
30 题
02
领域
代数、几何、数论、组合
03
答案格式
000–999 的整数表示
04
重复次数
每题 10 次
评测方法与研究依据
先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。
学术与任务背景
学术与任务背景
题目来自美国数学协会组织的邀请赛,覆盖代数、几何、数论和组合数学,并使用可核验的三位整数答案。
当前榜单记录使用固定年份的全部题目、十次重复和统一答案核对规则,用于观察高难度数学推理的稳定性。
评测背景
评测背景
该竞赛面向高中数学拔尖学生,题目要求在没有选择项的情况下完成高难度计算与数学洞察。
2025 配置包含两套试卷的全部 30 道题,答案以严格的三位整数格式提交。
这项能力测什么
这项能力测什么
- 完成奥林匹克级代数、几何、数论和组合推理。
- 逐步推导并控制复杂计算的准确性。
- 从完整推理中提炼严格的整数最终答案。
当前榜单口径
当前榜单口径
- 运行 2025 年两套试卷共 30 道题,每题重复 10 次。
- 提示要求逐步求解,并把最终答案放入 LaTeX 的 boxed 标记中。
- 答案先由脚本和符号归一化检查,必要时再使用等价性判定作为后备。
任务如何完成
任务如何完成
- 逐题提交原始数学问题,模型生成推导并在 boxed 中给出最终答案。
- 提取数值答案并做符号归一化,再与标准整数答案比较。
- 脚本无法稳定判定时,只检查两个答案是否等价;每题共运行 10 次。
如何计分
如何计分
- 每次回答按首答是否正确记为 pass@1,不因后续修正追加尝试。
- 最终分数汇总 30 道题各 10 次运行的正确比例。
结果怎么解读
结果怎么解读
- 主指标为重复运行后的平均正确率。
- 同时报告输入、推理、答案 Token 与评测成本。
解读限制
解读限制
- 固定年份只有 30 道题,单题波动会明显影响总分。
- 严格数值格式可能让数学思路正确但最终表达不合规的回答失分。
- 重复 10 次用于观察输出方差,不能代表更长时间或其他年份的竞赛表现。
示例任务
进位制整除问题
求所有大于 9 的整数进位制 b,使以 b 为底的两位数 17 能整除两位数 97,并计算所有这类 b 的和。
成功条件
- 给出可核对的逐步数学推导。
- 最终结果是有效整数,并放在 boxed 标记中。