开放权重

开源大模型排行榜:能力、开放性与部署选型指南

开源大模型哪个好?先区分开放权重与真正开源,再按当前模型的综合智力、编程、开放性、参数规模、速度和任务成本缩小候选,并说明部署前还要核对哪些条件。

Keygate 编辑团队6 分钟读完数据更新于 2026年8月3日 20:42

快速结论

30 秒先看结论

先看关键结论,再结合任务、预算和等待时间做选择。

MoonshotAIKimi K3 (max)57.1
仅在当前标记为开放权重的活跃型号中比较
MoonshotAIKimi K3 (max)76.2
开发任务需要单独检查代码能力
Ai2Olmo 3 7B Think88.9
综合考虑可获得性与方法、数据透明度
LiquidLFM2.5-VL-1.6B427.5 token/秒
公开服务速度不等于自部署硬件上的吞吐
开源大模型排行榜:能力、开放性与部署选型指南信息图

选型对照

开放权重模型综合智力前列型号

按综合智力排列,并同时展示编程、开放性、上下文和任务成本;开放权重不自动等于完全开源或无限制商用。

01MoonshotAIKimi K3 (max)

综合智力

57.1

编程指数

76.2

开放性指数

38.9

上下文

1,048,576 token

任务成本

$0.86

综合智力

51.1

编程指数

68.8

开放性指数

44.4

上下文

1,000,000 token

任务成本

$0.59

04MoonshotAIKimi K3 (low)

综合智力

46.6

编程指数

72.0

开放性指数

暂无数据

上下文

1,048,576 token

任务成本

$0.24

05MinimaxMiniMax-M3

综合智力

44.4

编程指数

58.6

开放性指数

33.3

上下文

1,000,000 token

任务成本

$0.14

综合智力

44.3

编程指数

59.4

开放性指数

50.0

上下文

1,000,000 token

任务成本

$0.048

数据更新于 2026年8月3日 20:42;本文先筛选当前标记为开放权重的活跃型号,再按各项可用指标排列。开放权重不自动等于完整开源、免费商用或适合本地部署。

开源大模型排行榜应该先看什么

用户常把“可以下载权重”的模型统称为开源大模型。严格来说,开放权重、开源代码、公开训练数据和允许商业使用是不同条件。本文沿用常见搜索说法,但排名范围以当前开放权重标记为准。

当前开放权重候选中,综合智力排名前三的是 Kimi K3 (max)GLM-5.2 (max)DeepSeek V4 Flash 0731 (max)。它们适合进入能力短名单;是否能部署、能否商用、需要多少硬件,还要逐个核对具体版本和许可证。

开放权重模型综合智力前十

  1. Kimi K3 (max) — 57.1
  2. GLM-5.2 (max) — 51.1
  3. DeepSeek V4 Flash 0731 (max) — 49.9
  4. Kimi K3 (low) — 46.6
  5. MiniMax-M3 — 44.4
  6. DeepSeek V4 Pro (max) — 44.3
  7. DeepSeek V4 Pro (high) — 43.1
  8. MiMo-V2.5-Pro — 42.2
  9. Kimi K2.7 Code — 41.9
  10. Hy3 — 41.2

查看完整模型目录 · 把候选加入模型对比

综合智力用于缩小通用复杂任务的候选范围,不代表某个量化版本、微调版本或本地推理框架会得到相同结果。部署后的精度、速度和成本会受到权重精度、上下文长度、批处理、硬件与推理引擎影响。

编程任务看哪些开放模型

  1. Kimi K3 (max) — 76.2
  2. Kimi K3 (low) — 72.0
  3. DeepSeek V4 Flash 0731 (max) — 69.1
  4. GLM-5.2 (max) — 68.8
  5. Kimi K2.7 Code — 60.8

代码生成之外,开发智能体还要检查工具调用、多步骤执行、上下文窗口和失败恢复。准备本地部署时,应使用将要上线的权重版本和推理配置复测,不能把托管服务结果直接当成本地结果。

开放性指数不是许可证结论

  1. Olmo 3 7B Think — 88.9
  2. Olmo 3.1 32B Think — 88.9
  3. Apertus 70B Instruct — 88.9
  4. K2 Think V2 — 88.9
  5. Apertus 8B Instruct — 88.9

开放性指数综合观察模型可获得性以及方法、训练数据和后训练信息的透明度。它帮助比较开放程度,但不替你解释许可证,也不保证训练数据完整公开。具体计算方式可查看模型开放性指数方法

公开服务速度不能直接代表本地速度

  1. LFM2.5-VL-1.6B — 427.5 token/秒
  2. Step 3.7 Flash — 389.4 token/秒
  3. HyperNova 60B 2605 — 384.8 token/秒
  4. LFM2.5-8B-A1B — 337.3 token/秒
  5. Nemotron 3 Nano Omni 30B A3B Reasoning — 316.9 token/秒

这里的速度用于比较当前可用服务表现。本地部署速度取决于 GPU、显存、量化、并发、上下文和推理框架。相同权重在不同硬件上的吞吐与延迟可能差异很大,因此不能用公开服务速度承诺自部署性能。

什么时候开放权重更有价值

  • 需要在自有环境运行,并能承担部署、监控和升级工作。
  • 需要控制推理配置、量化方式、微调流程或模型版本。
  • 调用规模足够大,有必要比较托管 API 与自建资源的总成本。
  • 数据处理和网络边界要求无法由现有托管方案满足。
  • 团队能持续处理安全更新、许可证变化、性能回归和模型替换。

如果只是低频调用,托管 API 可能更省时间;如果缺少运维能力,下载权重也不会自动带来更低总成本。

部署前必须逐项核对

  1. 许可证: 商用、再分发、衍生模型和使用范围是否符合业务。
  2. 具体权重: 基础版、指令版、推理版和量化版不能混为同一个型号。
  3. 硬件预算: 显存、并发、上下文长度、吞吐和高可用需要一起估算。
  4. 能力回归: 用实际部署版本跑同一套任务,不沿用其他服务商的成绩。
  5. 安全与维护: 明确访问控制、日志、更新、回退和模型下线计划。

“开源大模型哪个好”最终不是单纯排名题,而是能力、控制权、许可证、硬件和长期维护能力的共同选择。

继续阅读