国产 AI 大模型排行榜:能力、编程、速度与成本怎么选
国产 AI 大模型哪个好?按持续更新的综合智力数据排列当前候选型号,并结合编程、速度、上下文、开放权重与任务成本,帮助个人、开发者和团队缩小范围。
快速结论
30 秒先看结论
先看关键结论,再结合任务、预算和等待时间做选择。

选型对照
国产模型综合智力前列型号
仅比较当前活跃且已识别为国产厂商的模型;排名按综合智力排列,并同时展示编程、速度和任务成本。
综合智力
57.1
编程指数
76.2
输出速度
34.9 t/s
单任务成本
$0.86
综合智力
51.1
编程指数
68.8
输出速度
179.4 t/s
单任务成本
$0.59
综合智力
49.9
编程指数
69.1
输出速度
122.7 t/s
单任务成本
$0.027
综合智力
46.6
编程指数
72.0
输出速度
33.5 t/s
单任务成本
$0.24
综合智力
46.0
编程指数
66.0
输出速度
206.4 t/s
单任务成本
$1.28
综合智力
44.4
编程指数
58.6
输出速度
82.2 t/s
单任务成本
$0.14
数据更新于 2026年8月3日 20:42;榜单只使用当前活跃且已识别为国产厂商的模型,并按已有综合智力数据排序。
国产 AI 大模型怎么选
当前国产候选中,综合智力排名前三的是 Kimi K3 (max)、GLM-5.2 (max)、DeepSeek V4 Flash 0731 (max)。这份榜单适合先把范围缩小,但“国产模型哪个好”仍要结合编程、速度、上下文、开放权重状态和任务成本回答。
当前纳入比较的厂商为:Alibaba、Baidu、ByteDance Seed、China Mobile、DeepSeek、InclusionAI、Kimi、LongCat、MiniMax、OpenBMB、StepFun、Tencent、Xiaomi、Z AI。页面会根据当前候选型号自动更新,不固定指定某个型号长期代表一个厂商。
国产 AI 大模型综合智力前十
- Kimi K3 (max) — 57.1
- GLM-5.2 (max) — 51.1
- DeepSeek V4 Flash 0731 (max) — 49.9
- Kimi K3 (low) — 46.6
- Qwen3.7 Max — 46.0
- MiniMax-M3 — 44.4
- DeepSeek V4 Pro (max) — 44.3
- DeepSeek V4 Pro (high) — 43.1
- MiMo-V2.5-Pro — 42.2
- Kimi K2.7 Code — 41.9
综合智力适合判断复杂推理与通用任务能力,不等于中文专项成绩,也不保证每一种业务任务都领先。
国产编程模型前列候选
- Kimi K3 (max) — 76.2
- Kimi K3 (low) — 72.0
- DeepSeek V4 Flash 0731 (max) — 69.1
- GLM-5.2 (max) — 68.8
- Qwen3.7 Max — 66.0
写代码时要把编程指数与智能体指数分开看:前者更接近代码任务能力,后者更适合判断多步骤规划、工具调用和连续执行。
输出速度较快的国产候选
- Step 3.7 Flash — 389.4 token/秒
- Qwen3.5 Omni Flash — 235.4 token/秒
- Qwen3.7 Max — 206.4 token/秒
- Qwen3 Next 80B A3B — 203.2 token/秒
- GLM-5.2 (max) — 179.4 token/秒
输出速度代表开始生成后的持续速度。面向用户的实时产品还要检查首 token 延迟,不能只看每秒 token 数。
单任务成本较低的国产候选
- MiMo-V2.5 — $0.010
- DeepSeek V4 Flash 0731 (max) — $0.027
- MiMo-V2.5-Pro — $0.034
- Hy3 — $0.036
- DeepSeek V4 Pro (high) — $0.043
单任务成本用于比较完成同一套任务的调用支出,和每百万 token 的公开单价不是一回事。正确顺序是先设能力底线,再在合格候选中压低成本。
需要开放权重时看哪些型号
以下候选的开放权重状态来自当前型号数据,并按综合智力排序:
- Kimi K3 (max) — 57.1
- GLM-5.2 (max) — 51.1
- DeepSeek V4 Flash 0731 (max) — 49.9
- Kimi K3 (low) — 46.6
- MiniMax-M3 — 44.4
开放权重不自动等于可以不受限制地商用或部署。具体许可证、硬件需求、量化版本和运维成本需要在选定型号后继续核对。
个人、开发者和团队的选择顺序
- 中文问答和内容工作:先从综合智力前列中保留候选,再用真实中文材料验收。
- 软件开发与智能体:重点查看编程指数、智能体指数和上下文窗口。
- 高频 API 产品:设定能力与延迟底线后,再比较单任务成本。
- 私有部署:先确认开放权重与许可证,再评估硬件、吞吐和维护成本。
榜单不能替代业务验收。最有效的做法是选出少量候选,用相同提示词、相同材料和相同评分标准跑一轮短名单验证。