国产 AI 大模型排行榜:能力、编程、速度与成本怎么选
国产 AI 大模型哪个好?按持续更新的综合智力数据排列当前候选型号,并结合编程、速度、上下文、开放权重与任务成本,帮助个人、开发者和团队缩小范围。
快速结论
30 秒先看结论
先看关键结论,再结合任务、预算和等待时间做选择。

选型对照
国产模型综合智力前列型号
仅比较当前活跃且已识别为国产厂商的模型;排名按综合智力排列,并同时展示编程、速度和任务成本。
综合智力
45.4
编程指数
暂无数据
输出速度
39.6 t/s
单任务成本
$5.41
综合智力
44.9
编程指数
暂无数据
输出速度
63.4 t/s
单任务成本
$2.01
综合智力
43.8
编程指数
暂无数据
输出速度
36.0 t/s
单任务成本
$2.00
综合智力
41.9
编程指数
暂无数据
输出速度
113.1 t/s
单任务成本
$0.25
综合智力
40.0
编程指数
暂无数据
输出速度
39.5 t/s
单任务成本
$2.16
综合智力
39.9
编程指数
暂无数据
输出速度
51.0 t/s
单任务成本
$0.37
数据更新于 2026年9月18日 07:58;榜单只使用当前活跃且已识别为国产厂商的模型,并按已有综合智力数据排序。
国产 AI 大模型怎么选
当前国产候选中,综合智力排名前三的是 Qwen3.8 Max (0902)、GLM-5.3 (max)、Kimi K3 (max)。这份榜单适合先把范围缩小,但“国产模型哪个好”仍要结合编程、速度、上下文、开放权重状态和任务成本回答。
当前纳入比较的厂商为:Alibaba、Baidu、ByteDance Seed、China Mobile、DeepSeek、InclusionAI、Kimi、LongCat、MiniMax、OpenBMB、StepFun、Tencent、Xiaomi、Z AI。页面会根据当前候选型号自动更新,不固定指定某个型号长期代表一个厂商。
国产 AI 大模型综合智力前十
- Qwen3.8 Max (0902) — 45.4
- GLM-5.3 (max) — 44.9
- Kimi K3 (max) — 43.8
- GLM-5.3-Flash — 41.9
- Qwen3.8 2.4T A95B — 40.0
- Qwen3.8-Flash-Next — 39.9
- DeepSeek V4.1 Flash (max) — 39.5
- DeepSeek V4 Pro 0813 (max) — 36.3
- DeepSeek V4 Flash Vision (max) — 35.0
- Qwen3.8 27B (xhigh) — 33.9
综合智力适合判断复杂推理与通用任务能力,不等于中文专项成绩,也不保证每一种业务任务都领先。
国产编程模型前列候选
当前暂无可用数据。
写代码时要把编程指数与智能体指数分开看:前者更接近代码任务能力,后者更适合判断多步骤规划、工具调用和连续执行。
输出速度较快的国产候选
- Ling 3.0 Flash — 317.2 token/秒
- Qwen3.5 Omni Flash — 219.9 token/秒
- DeepSeek V4 Flash Vision (max) — 213.6 token/秒
- DeepSeek V4.1 Flash (max) — 207.6 token/秒
- Qwen3 Next 80B A3B (Reasoning) — 198.1 token/秒
输出速度代表开始生成后的持续速度。面向用户的实时产品还要检查首 token 延迟,不能只看每秒 token 数。
单任务成本较低的国产候选
- Ling 3.0 Tiny — $0.000
- MiMo-V2.5 — $0.019
- Ling 3.0 Flash — $0.034
- MiMo-V2.5-Pro — $0.054
- LongCat 2.0 — $0.059
单任务成本用于比较完成同一套任务的调用支出,和每百万 token 的公开单价不是一回事。正确顺序是先设能力底线,再在合格候选中压低成本。
需要开放权重时看哪些型号
以下候选的开放权重状态来自当前型号数据,并按综合智力排序:
- GLM-5.3 (max) — 44.9
- Kimi K3 (max) — 43.8
- GLM-5.3-Flash — 41.9
- Qwen3.8 2.4T A95B — 40.0
- Qwen3.8-Flash-Next — 39.9
开放权重不自动等于可以不受限制地商用或部署。具体许可证、硬件需求、量化版本和运维成本需要在选定型号后继续核对。
个人、开发者和团队的选择顺序
- 中文问答和内容工作:先从综合智力前列中保留候选,再用真实中文材料验收。
- 软件开发与智能体:重点查看编程指数、智能体指数和上下文窗口。
- 高频 API 产品:设定能力与延迟底线后,再比较单任务成本。
- 私有部署:先确认开放权重与许可证,再评估硬件、吞吐和维护成本。
榜单不能替代业务验收。最有效的做法是选出少量候选,用相同提示词、相同材料和相同评分标准跑一轮短名单验证。