开源大模型排行榜:能力、开放性与部署选型指南
开源大模型哪个好?先区分开放权重与真正开源,再按当前模型的综合智力、编程、开放性、参数规模、速度和任务成本缩小候选,并说明部署前还要核对哪些条件。
快速结论
30 秒先看结论
先看关键结论,再结合任务、预算和等待时间做选择。

选型对照
开放权重模型综合智力前列型号
按综合智力排列,并同时展示编程、开放性、上下文和任务成本;开放权重不自动等于完全开源或无限制商用。
综合智力
57.1
编程指数
76.2
开放性指数
38.9
上下文
1,048,576 token
任务成本
$0.86
综合智力
51.1
编程指数
68.8
开放性指数
44.4
上下文
1,000,000 token
任务成本
$0.59
综合智力
49.9
编程指数
69.1
开放性指数
暂无数据
上下文
1,000,000 token
任务成本
$0.027
综合智力
46.6
编程指数
72.0
开放性指数
暂无数据
上下文
1,048,576 token
任务成本
$0.24
综合智力
44.4
编程指数
58.6
开放性指数
33.3
上下文
1,000,000 token
任务成本
$0.14
综合智力
44.3
编程指数
59.4
开放性指数
50.0
上下文
1,000,000 token
任务成本
$0.048
数据更新于 2026年8月3日 20:42;本文先筛选当前标记为开放权重的活跃型号,再按各项可用指标排列。开放权重不自动等于完整开源、免费商用或适合本地部署。
开源大模型排行榜应该先看什么
用户常把“可以下载权重”的模型统称为开源大模型。严格来说,开放权重、开源代码、公开训练数据和允许商业使用是不同条件。本文沿用常见搜索说法,但排名范围以当前开放权重标记为准。
当前开放权重候选中,综合智力排名前三的是 Kimi K3 (max)、GLM-5.2 (max)、DeepSeek V4 Flash 0731 (max)。它们适合进入能力短名单;是否能部署、能否商用、需要多少硬件,还要逐个核对具体版本和许可证。
开放权重模型综合智力前十
- Kimi K3 (max) — 57.1
- GLM-5.2 (max) — 51.1
- DeepSeek V4 Flash 0731 (max) — 49.9
- Kimi K3 (low) — 46.6
- MiniMax-M3 — 44.4
- DeepSeek V4 Pro (max) — 44.3
- DeepSeek V4 Pro (high) — 43.1
- MiMo-V2.5-Pro — 42.2
- Kimi K2.7 Code — 41.9
- Hy3 — 41.2
综合智力用于缩小通用复杂任务的候选范围,不代表某个量化版本、微调版本或本地推理框架会得到相同结果。部署后的精度、速度和成本会受到权重精度、上下文长度、批处理、硬件与推理引擎影响。
编程任务看哪些开放模型
- Kimi K3 (max) — 76.2
- Kimi K3 (low) — 72.0
- DeepSeek V4 Flash 0731 (max) — 69.1
- GLM-5.2 (max) — 68.8
- Kimi K2.7 Code — 60.8
代码生成之外,开发智能体还要检查工具调用、多步骤执行、上下文窗口和失败恢复。准备本地部署时,应使用将要上线的权重版本和推理配置复测,不能把托管服务结果直接当成本地结果。
开放性指数不是许可证结论
- Olmo 3 7B Think — 88.9
- Olmo 3.1 32B Think — 88.9
- Apertus 70B Instruct — 88.9
- K2 Think V2 — 88.9
- Apertus 8B Instruct — 88.9
开放性指数综合观察模型可获得性以及方法、训练数据和后训练信息的透明度。它帮助比较开放程度,但不替你解释许可证,也不保证训练数据完整公开。具体计算方式可查看模型开放性指数方法。
公开服务速度不能直接代表本地速度
- LFM2.5-VL-1.6B — 427.5 token/秒
- Step 3.7 Flash — 389.4 token/秒
- HyperNova 60B 2605 — 384.8 token/秒
- LFM2.5-8B-A1B — 337.3 token/秒
- Nemotron 3 Nano Omni 30B A3B Reasoning — 316.9 token/秒
这里的速度用于比较当前可用服务表现。本地部署速度取决于 GPU、显存、量化、并发、上下文和推理框架。相同权重在不同硬件上的吞吐与延迟可能差异很大,因此不能用公开服务速度承诺自部署性能。
什么时候开放权重更有价值
- 需要在自有环境运行,并能承担部署、监控和升级工作。
- 需要控制推理配置、量化方式、微调流程或模型版本。
- 调用规模足够大,有必要比较托管 API 与自建资源的总成本。
- 数据处理和网络边界要求无法由现有托管方案满足。
- 团队能持续处理安全更新、许可证变化、性能回归和模型替换。
如果只是低频调用,托管 API 可能更省时间;如果缺少运维能力,下载权重也不会自动带来更低总成本。
部署前必须逐项核对
- 许可证: 商用、再分发、衍生模型和使用范围是否符合业务。
- 具体权重: 基础版、指令版、推理版和量化版不能混为同一个型号。
- 硬件预算: 显存、并发、上下文长度、吞吐和高可用需要一起估算。
- 能力回归: 用实际部署版本跑同一套任务,不沿用其他服务商的成绩。
- 安全与维护: 明确访问控制、日志、更新、回退和模型下线计划。
“开源大模型哪个好”最终不是单纯排名题,而是能力、控制权、许可证、硬件和长期维护能力的共同选择。