国产模型

国产 AI 大模型排行榜:能力、编程、速度与成本怎么选

国产 AI 大模型哪个好?按持续更新的综合智力数据排列当前候选型号,并结合编程、速度、上下文、开放权重与任务成本,帮助个人、开发者和团队缩小范围。

Keygate 编辑团队6 分钟读完数据更新于 2026年9月18日 07:58

快速结论

30 秒先看结论

先看关键结论,再结合任务、预算和等待时间做选择。

AlibabaCloudQwen3.8 Max (0902)45.4
复杂任务先用综合能力缩小候选范围
AntGroupLing 3.0 Flash317.2 token/秒
反映模型开始输出后的持续生成速度
AntGroupLing 3.0 Tiny$0.000
应在满足能力要求后再比较成本
国产 AI 大模型排行榜:能力、编程、速度与成本怎么选信息图

选型对照

国产模型综合智力前列型号

仅比较当前活跃且已识别为国产厂商的模型;排名按综合智力排列,并同时展示编程、速度和任务成本。

01AlibabaCloudQwen3.8 Max (0902)

综合智力

45.4

编程指数

暂无数据

输出速度

39.6 t/s

单任务成本

$5.41

综合智力

44.9

编程指数

暂无数据

输出速度

63.4 t/s

单任务成本

$2.01

03MoonshotAIKimi K3 (max)

综合智力

43.8

编程指数

暂无数据

输出速度

36.0 t/s

单任务成本

$2.00

综合智力

41.9

编程指数

暂无数据

输出速度

113.1 t/s

单任务成本

$0.25

05AlibabaCloudQwen3.8 2.4T A95B

综合智力

40.0

编程指数

暂无数据

输出速度

39.5 t/s

单任务成本

$2.16

06AlibabaCloudQwen3.8-Flash-Next

综合智力

39.9

编程指数

暂无数据

输出速度

51.0 t/s

单任务成本

$0.37

数据更新于 2026年9月18日 07:58;榜单只使用当前活跃且已识别为国产厂商的模型,并按已有综合智力数据排序。

国产 AI 大模型怎么选

当前国产候选中,综合智力排名前三的是 Qwen3.8 Max (0902)GLM-5.3 (max)Kimi K3 (max)。这份榜单适合先把范围缩小,但“国产模型哪个好”仍要结合编程、速度、上下文、开放权重状态和任务成本回答。

当前纳入比较的厂商为:Alibaba、Baidu、ByteDance Seed、China Mobile、DeepSeek、InclusionAI、Kimi、LongCat、MiniMax、OpenBMB、StepFun、Tencent、Xiaomi、Z AI。页面会根据当前候选型号自动更新,不固定指定某个型号长期代表一个厂商。

国产 AI 大模型综合智力前十

  1. Qwen3.8 Max (0902) — 45.4
  2. GLM-5.3 (max) — 44.9
  3. Kimi K3 (max) — 43.8
  4. GLM-5.3-Flash — 41.9
  5. Qwen3.8 2.4T A95B — 40.0
  6. Qwen3.8-Flash-Next — 39.9
  7. DeepSeek V4.1 Flash (max) — 39.5
  8. DeepSeek V4 Pro 0813 (max) — 36.3
  9. DeepSeek V4 Flash Vision (max) — 35.0
  10. Qwen3.8 27B (xhigh) — 33.9

综合智力适合判断复杂推理与通用任务能力,不等于中文专项成绩,也不保证每一种业务任务都领先。

国产编程模型前列候选

当前暂无可用数据。

写代码时要把编程指数与智能体指数分开看:前者更接近代码任务能力,后者更适合判断多步骤规划、工具调用和连续执行。

输出速度较快的国产候选

  1. Ling 3.0 Flash — 317.2 token/秒
  2. Qwen3.5 Omni Flash — 219.9 token/秒
  3. DeepSeek V4 Flash Vision (max) — 213.6 token/秒
  4. DeepSeek V4.1 Flash (max) — 207.6 token/秒
  5. Qwen3 Next 80B A3B (Reasoning) — 198.1 token/秒

输出速度代表开始生成后的持续速度。面向用户的实时产品还要检查首 token 延迟,不能只看每秒 token 数。

单任务成本较低的国产候选

  1. Ling 3.0 Tiny — $0.000
  2. MiMo-V2.5 — $0.019
  3. Ling 3.0 Flash — $0.034
  4. MiMo-V2.5-Pro — $0.054
  5. LongCat 2.0 — $0.059

单任务成本用于比较完成同一套任务的调用支出,和每百万 token 的公开单价不是一回事。正确顺序是先设能力底线,再在合格候选中压低成本。

需要开放权重时看哪些型号

以下候选的开放权重状态来自当前型号数据,并按综合智力排序:

  1. GLM-5.3 (max) — 44.9
  2. Kimi K3 (max) — 43.8
  3. GLM-5.3-Flash — 41.9
  4. Qwen3.8 2.4T A95B — 40.0
  5. Qwen3.8-Flash-Next — 39.9

开放权重不自动等于可以不受限制地商用或部署。具体许可证、硬件需求、量化版本和运维成本需要在选定型号后继续核对。

个人、开发者和团队的选择顺序

  1. 中文问答和内容工作:先从综合智力前列中保留候选,再用真实中文材料验收。
  2. 软件开发与智能体:重点查看编程指数、智能体指数和上下文窗口。
  3. 高频 API 产品:设定能力与延迟底线后,再比较单任务成本。
  4. 私有部署:先确认开放权重与许可证,再评估硬件、吞吐和维护成本。

榜单不能替代业务验收。最有效的做法是选出少量候选,用相同提示词、相同材料和相同评分标准跑一轮短名单验证。

打开模型对比工具 · 查看完整模型目录

继续阅读