国产模型

国产 AI 大模型排行榜:能力、编程、速度与成本怎么选

国产 AI 大模型哪个好?按持续更新的综合智力数据排列当前候选型号,并结合编程、速度、上下文、开放权重与任务成本,帮助个人、开发者和团队缩小范围。

Keygate 编辑团队6 分钟读完数据更新于 2026年8月3日 20:42

快速结论

30 秒先看结论

先看关键结论,再结合任务、预算和等待时间做选择。

MoonshotAIKimi K3 (max)57.1
复杂任务先用综合能力缩小候选范围
MoonshotAIKimi K3 (max)76.2
代码与智能体任务需要单独检查编程能力
StepfunStep 3.7 Flash389.4 token/秒
反映模型开始输出后的持续生成速度
XiaomiMiMoMiMo-V2.5$0.010
应在满足能力要求后再比较成本
国产 AI 大模型排行榜:能力、编程、速度与成本怎么选信息图

选型对照

国产模型综合智力前列型号

仅比较当前活跃且已识别为国产厂商的模型;排名按综合智力排列,并同时展示编程、速度和任务成本。

01MoonshotAIKimi K3 (max)

综合智力

57.1

编程指数

76.2

输出速度

34.9 t/s

单任务成本

$0.86

综合智力

51.1

编程指数

68.8

输出速度

179.4 t/s

单任务成本

$0.59

04MoonshotAIKimi K3 (low)

综合智力

46.6

编程指数

72.0

输出速度

33.5 t/s

单任务成本

$0.24

05AlibabaCloudQwen3.7 Max

综合智力

46.0

编程指数

66.0

输出速度

206.4 t/s

单任务成本

$1.28

06MinimaxMiniMax-M3

综合智力

44.4

编程指数

58.6

输出速度

82.2 t/s

单任务成本

$0.14

数据更新于 2026年8月3日 20:42;榜单只使用当前活跃且已识别为国产厂商的模型,并按已有综合智力数据排序。

国产 AI 大模型怎么选

当前国产候选中,综合智力排名前三的是 Kimi K3 (max)GLM-5.2 (max)DeepSeek V4 Flash 0731 (max)。这份榜单适合先把范围缩小,但“国产模型哪个好”仍要结合编程、速度、上下文、开放权重状态和任务成本回答。

当前纳入比较的厂商为:Alibaba、Baidu、ByteDance Seed、China Mobile、DeepSeek、InclusionAI、Kimi、LongCat、MiniMax、OpenBMB、StepFun、Tencent、Xiaomi、Z AI。页面会根据当前候选型号自动更新,不固定指定某个型号长期代表一个厂商。

国产 AI 大模型综合智力前十

  1. Kimi K3 (max) — 57.1
  2. GLM-5.2 (max) — 51.1
  3. DeepSeek V4 Flash 0731 (max) — 49.9
  4. Kimi K3 (low) — 46.6
  5. Qwen3.7 Max — 46.0
  6. MiniMax-M3 — 44.4
  7. DeepSeek V4 Pro (max) — 44.3
  8. DeepSeek V4 Pro (high) — 43.1
  9. MiMo-V2.5-Pro — 42.2
  10. Kimi K2.7 Code — 41.9

综合智力适合判断复杂推理与通用任务能力,不等于中文专项成绩,也不保证每一种业务任务都领先。

国产编程模型前列候选

  1. Kimi K3 (max) — 76.2
  2. Kimi K3 (low) — 72.0
  3. DeepSeek V4 Flash 0731 (max) — 69.1
  4. GLM-5.2 (max) — 68.8
  5. Qwen3.7 Max — 66.0

写代码时要把编程指数与智能体指数分开看:前者更接近代码任务能力,后者更适合判断多步骤规划、工具调用和连续执行。

输出速度较快的国产候选

  1. Step 3.7 Flash — 389.4 token/秒
  2. Qwen3.5 Omni Flash — 235.4 token/秒
  3. Qwen3.7 Max — 206.4 token/秒
  4. Qwen3 Next 80B A3B — 203.2 token/秒
  5. GLM-5.2 (max) — 179.4 token/秒

输出速度代表开始生成后的持续速度。面向用户的实时产品还要检查首 token 延迟,不能只看每秒 token 数。

单任务成本较低的国产候选

  1. MiMo-V2.5 — $0.010
  2. DeepSeek V4 Flash 0731 (max) — $0.027
  3. MiMo-V2.5-Pro — $0.034
  4. Hy3 — $0.036
  5. DeepSeek V4 Pro (high) — $0.043

单任务成本用于比较完成同一套任务的调用支出,和每百万 token 的公开单价不是一回事。正确顺序是先设能力底线,再在合格候选中压低成本。

需要开放权重时看哪些型号

以下候选的开放权重状态来自当前型号数据,并按综合智力排序:

  1. Kimi K3 (max) — 57.1
  2. GLM-5.2 (max) — 51.1
  3. DeepSeek V4 Flash 0731 (max) — 49.9
  4. Kimi K3 (low) — 46.6
  5. MiniMax-M3 — 44.4

开放权重不自动等于可以不受限制地商用或部署。具体许可证、硬件需求、量化版本和运维成本需要在选定型号后继续核对。

个人、开发者和团队的选择顺序

  1. 中文问答和内容工作:先从综合智力前列中保留候选,再用真实中文材料验收。
  2. 软件开发与智能体:重点查看编程指数、智能体指数和上下文窗口。
  3. 高频 API 产品:设定能力与延迟底线后,再比较单任务成本。
  4. 私有部署:先确认开放权重与许可证,再评估硬件、吞吐和维护成本。

榜单不能替代业务验收。最有效的做法是选出少量候选,用相同提示词、相同材料和相同评分标准跑一轮短名单验证。

打开模型对比工具 · 查看完整模型目录

继续阅读