模型能力评测方法

AI 模型评测

Keygate 以统一口径呈现并解释模型能力结果,帮助你了解每项能力测什么、如何计分,以及怎样结合具体任务使用这些结果。

综合指标

综合智力指数

把智能体、编程、科学推理与通用能力九项评测合成为 0–100 分,用于观察模型的整体能力,而不是用单一题型代替综合判断。

综合智力指数查看方法
开放性

模型开放性指数

从模型可获得性、许可条件、训练数据透明度和方法透明度衡量开放程度,并统一换算为 0–100 分。

开放性指数查看方法
长流程知识工作

复杂知识工作综合评分

通过多周业务项目、数千份输入材料和 91 个交付任务,评估智能体完成复杂知识工作的正确性、分析质量与呈现质量。

知识工作综合评分查看方法
经济价值任务

真实职业任务综合表现

让智能体完成 44 种职业、9 个主要行业中的 220 项真实专业任务,以盲配对比较形成锚定人类专家基线的 Elo。

职业任务相对表现分查看方法
专业服务

专业服务任务成功率

在投资银行、管理咨询和公司法律环境中测试长流程、跨应用专业任务;只有全部量表项目满足时,一次运行才算成功。

任务成功率查看方法
SaaS 工作流

跨应用工作流完成度

在模拟 SaaS 环境中测试跨应用工作流自动化,以完成目标且不破坏业务护栏后的目标完成比例作为主分数。

安全约束下任务完成度查看方法
法律工作

法律交付标准通过率

用 120 项真实法律工作测试智能体读取案件材料并制作法律交付物的能力,以全通过率和逐项标准通过率报告结果。

交付标准通过率查看方法
企业运营

企业流程任务成功率

让智能体在可重置的企业系统中执行有状态、多步骤工作流,并以最终数据库状态的严格验证结果评估任务是否真正完成。

严格任务成功率查看方法
银行智能体

银行客服任务成功率

在约 700 份互相关联的银行政策中检索依据,并通过多步骤工具调用完成可验证的客户支持工作流。

五次运行平均成功率查看方法
终端智能体

终端环境任务成功率

在真实终端环境中检验智能体完成软件工程、系统管理、数据处理、模型训练与安全任务的能力。

任务成功率查看方法
长上下文

长文档综合推理通过率

衡量模型从 10k 至 100k Token 的长文档中提取、连接并综合分散信息的能力。

任务通过率查看方法
知识可靠性

知识准确性与非幻觉能力

同时衡量事实知识、知识边界识别与错误猜测,区分准确回答、拒答和幻觉。

知识可靠性指数查看方法
科学编程

科研编程任务通过率

以真实科研问题检验科学知识、推理与代码合成能力,答案由可执行测试验证。

科研子任务通过率查看方法
前沿学术

专家级跨学科问答准确率

以专家核验的前沿学术问题检验数学、自然科学与人文学科中的高难度闭合式推理。

问答准确率查看方法
研究级物理

研究级物理推理准确率

用未公开的研究级物理问题检验完整科研推理,并以抗猜测、机器可验证的答案格式评分。

推理准确率查看方法
研究生科学

研究生级科学问答准确率

使用最困难的研究生级物理、生物和化学选择题检验真正的科学推理,而非检索技巧。

科学问答正确率查看方法
IT 运维

IT 故障根因识别精度

在离线 Kubernetes 事故快照中定位导致故障的实体,评估智能体的站点可靠性工程根因分析能力。

完整召回下平均精确率查看方法
多模态理解

多学科图文理解准确率

通过更难猜测的十选一问题和视觉输入,检验模型跨学科整合图像与文本信息的能力。

图文问答正确率查看方法
单轮指令

精确指令遵循率

通过 58 类全新、可验证的域外约束,检验模型能否在单轮回答中精确满足计数、格式和句子变换等输出要求。

提示级准确率查看方法
终端任务

高难度终端任务

在隔离终端环境中执行高难度软件工程、系统管理、数据处理、模型训练和游戏任务,以自动化测试验证最终结果。

平均任务成功率查看方法
双控制

电信客服协同任务

在电信技术支持场景中分别模拟客服智能体与用户,让双方共同改变共享状态,检验规划、工具使用、沟通和用户引导。

任务通过率查看方法
多学科

高难度多学科推理

以 12,032 道、14 个学科领域的十选一研究生级问题,检验高级知识、理解与更深层推理。

单次作答正确率查看方法
代码执行

新题编程能力

持续使用三个主流编程竞赛平台的新题,检验 Python 代码生成及在隐藏测试下解决算法问题的能力。

代码通过率查看方法
历史数学

竞赛数学推理

以 500 道高中竞赛级数学题测试逐步推理和精确作答,覆盖代数、几何、数论、预备微积分与概率。

答案正确率查看方法
竞赛数学

邀请赛数学推理

使用 2025 年两套邀请赛的全部 30 道题,检验代数、几何、数论和组合数学中的高难度推理与精确整数作答。

十次运行平均正确率查看方法
17 种语言

多语言知识推理

用约 6,000 道四选一题衡量 17 种语言中的知识与推理,并同时报告总体平均和逐语言成绩。

多语言平均正确率查看方法