Keygate 评测体系

AI 模型评测

按测试对象、任务设置、计分方式与结果解释,完整拆解每项指标。

综合指标

综合智力指数

把智能体、编程、科学推理与通用能力九项评测合成为 0–100 分,用于观察模型的整体能力,而不是用单一题型代替综合判断。

综合智力指数查看方法
开放性

模型开放性指数

从模型可获得性、许可条件、训练数据透明度和方法透明度衡量开放程度,并统一换算为 0–100 分。

开放性指数查看方法
长流程知识工作

Briefcase

通过多周业务项目、数千份输入材料和 91 个交付任务,评估智能体完成复杂知识工作的正确性、分析质量与呈现质量。

Briefcase Elo查看方法
经济价值任务

GDPval v2

让智能体完成 44 种职业、9 个主要行业中的 220 项真实专业任务,以盲配对比较形成锚定人类专家基线的 Elo。

GDPval v2 Elo查看方法
专业服务

APEX-Agents

在投资银行、管理咨询和公司法律环境中测试长流程、跨应用专业任务;只有全部量表项目满足时,一次运行才算成功。

APEX-Agents Pass@1查看方法
SaaS 工作流

AutomationBench

在模拟 SaaS 环境中测试跨应用工作流自动化,以完成目标且不破坏业务护栏后的目标完成比例作为主分数。

AutomationBench Score查看方法
法律工作

Harvey LAB

用 120 项真实法律工作测试智能体读取案件材料并制作法律交付物的能力,以全通过率和逐项标准通过率报告结果。

Harvey LAB 全通过率查看方法
企业运营

EnterpriseOps-Gym

让智能体在可重置的企业系统中执行有状态、多步骤工作流,并以最终数据库状态的严格验证结果评估任务是否真正完成。

严格任务成功率查看方法
银行智能体

τ³-Banking

在约 700 份互相关联的银行政策中检索依据,并通过多步骤工具调用完成可验证的客户支持工作流。

τ³-Banking Pass@1查看方法
终端智能体

Terminal-Bench v2.1

在真实终端环境中检验智能体完成软件工程、系统管理、数据处理、模型训练与安全任务的能力。

pass@1查看方法
长上下文

长上下文推理(LCR)

衡量模型从 10k 至 100k Token 的长文档中提取、连接并综合分散信息的能力。

平均通过率查看方法
知识可靠性

Omniscience

同时衡量事实知识、知识边界识别与错误猜测,区分准确回答、拒答和幻觉。

Omniscience 指数查看方法
科学编程

SciCode

以真实科研问题检验科学知识、推理与代码合成能力,答案由可执行测试验证。

测试子问题通过率查看方法
前沿学术

Humanity's Last Exam

以专家核验的前沿学术问题检验数学、自然科学与人文学科中的高难度闭合式推理。

pass@1 正确率查看方法
研究级物理

CritPt

用未公开的研究级物理问题检验完整科研推理,并以抗猜测、机器可验证的答案格式评分。

完整挑战正确率查看方法
研究生科学

GPQA Diamond

使用最困难的研究生级物理、生物和化学选择题检验真正的科学推理,而非检索技巧。

选择题正确率查看方法
IT 运维

ITBench

在离线 Kubernetes 事故快照中定位导致故障的实体,评估智能体的站点可靠性工程根因分析能力。

完整召回下平均精确率查看方法
多模态理解

MMMU-Pro

通过更难猜测的十选一问题和视觉输入,检验模型跨学科整合图像与文本信息的能力。

多模态正确率查看方法
单轮指令

IFBench

通过 58 类全新、可验证的域外约束,检验模型能否在单轮回答中精确满足计数、格式和句子变换等输出要求。

提示级准确率查看方法
终端任务

Terminal-Bench Hard

在隔离终端环境中执行高难度软件工程、系统管理、数据处理、模型训练和游戏任务,以自动化测试验证最终结果。

平均 pass@1查看方法
双控制

τ²-Bench Telecom

在电信技术支持场景中分别模拟客服智能体与用户,让双方共同改变共享状态,检验规划、工具使用、沟通和用户引导。

任务通过率查看方法
多学科

MMLU-Pro

以 12,032 道、14 个学科领域的十选一研究生级问题,检验高级知识、理解与更深层推理。

pass@1 正确率查看方法
代码执行

LiveCodeBench

持续使用三个主流编程竞赛平台的新题,检验 Python 代码生成及在隐藏测试下解决算法问题的能力。

代码通过率查看方法
历史数学

MATH-500

以 500 道高中竞赛级数学题测试逐步推理和精确作答,覆盖代数、几何、数论、预备微积分与概率。

答案正确率查看方法
竞赛数学

AIME 2025

使用 2025 年两套邀请赛的全部 30 道题,检验代数、几何、数论和组合数学中的高难度推理与精确整数作答。

10 次重复 pass@1查看方法
17 种语言

Global-MMLU-Lite

用约 6,000 道四选一题衡量 17 种语言中的知识与推理,并同时报告总体平均和逐语言成绩。

多语言平均正确率查看方法