AI 大模型测评与排行榜, 一眼选出最适合你的模型
用中文直观比较 ChatGPT、Claude、Gemini、DeepSeek 等主流 AI 模型的智力、速度、价格与真实表现,覆盖文本、图像、视频和语音,选模型不再靠广告和猜测。
榜单速览
当前领先模型
快速查看智力、速度与成本领先模型。
输出速度
12 个模型单任务成本
12 个模型覆盖主流 AI 模型生态
从 590 款模型中自由选择,把不同厂商放进同一套对比。
01 · 智力
智力
综合比较智力、编程与智能体能力;数值越高越好。
默认展示主流模型,可搜索添加更多型号
02 · 智力明细
智力明细
查看 18 项细分评测,仅展示已有结果。
真实职业任务综合表现
完成跨行业真实职业任务并提交完整工作成果
银行客服任务成功率
检索银行政策并正确完成多步骤客户服务操作
终端环境任务成功率
在真实终端环境中完成软件、系统与数据任务
科研编程任务通过率
把科学知识、推理过程转化为可运行研究代码
专家级跨学科问答准确率
解决数学、科学与人文领域的专家级封闭问题
研究生级科学问答准确率
回答物理、生物与化学领域的研究生级难题
研究级物理推理准确率
解决接近真实科研尺度的现代物理问题
事实知识准确率
在全部事实问题中给出完全正确答案的比例
无错误断言率
给出正确答案或谨慎不答、没有作出错误事实断言的比例
长文档综合推理通过率
在超长材料中跨段提取、关联并综合证据
复杂知识工作综合评分
综合衡量长流程知识工作的完成度、分析质量与呈现质量
跨应用工作流完成度
跨多个业务应用完成目标,并避免违反安全与业务规则
法律交付标准通过率
衡量法律交付物满足各项实质标准的比例
企业流程任务成功率
在有状态企业系统中完成多步骤业务流程
精确指令遵循率
同时满足格式、数量、词语与字符等可验证要求
专业服务任务成功率
完成投行、咨询与公司法律的长流程专业任务
IT 故障根因识别精度
在完整找回真正根因的前提下,尽量减少错误根因判断
多学科图文理解准确率
结合图像与文字解决大学及专家级学科问题
03 · 专业知识工作
专业知识工作能力
比较复杂、长周期专业任务的总体 Elo、评分项通过率、分析质量和呈现质量。
默认展示主流模型,可搜索添加更多型号
04 · 全知指数
全知指数
同时看模型回答知识问题的准确性与避免幻觉的能力。
默认展示主流模型,可搜索添加更多型号
05 · 开放性
开放性
比较模型可获得性、训练数据与方法透明度;指数越高,开放程度越高。
人工分析开放指数:组成部分
开放性指数各组成部分对基础分的贡献,最高 18 分(分数越高表示越开放)。
推理模型以灯泡图标标示
06 · 智力对照
智力指数对照
对照智力与成本、速度和价格,快速权衡性能与投入。
默认展示主流模型,可搜索添加更多型号
07 · Token 用量
Token 用量
比较每项任务的回答与推理 Token 用量。
默认展示主流模型,可搜索添加更多型号
推理模型以灯泡图标标示
08 · 价格与成本
价格与成本
比较单任务成本、整套评测成本与 API 单价。
默认展示主流模型,可搜索添加更多型号
推理模型以灯泡图标标示
09 · 上下文窗口
上下文窗口
模型一次请求可处理的最大上下文长度,单位为 tokens。
默认展示主流模型,可搜索添加更多型号
10 · 速度
速度
比较输出速度与单任务耗时。
默认展示主流模型,可搜索添加更多型号
11 · 延迟
首个回答 token 延迟
从请求开始到首个回答 token 的时间,拆分为输入处理与推理等待。
默认展示主流模型,可搜索添加更多型号
推理模型以灯泡图标标示
12 · 端到端响应时间
端到端响应时间
一次完整响应的输入处理、推理和输出耗时。
默认展示主流模型,可搜索添加更多型号
推理模型以灯泡图标标示
13 · 模型规模
模型规模
比较模型总参数与推理时实际激活参数,单位为十亿参数。
默认展示主流模型,可搜索添加更多型号
关于 AI 模型选择的常见问题
帮助你更快看懂榜单、比较候选型号,并做出适合自己场景的选择。
