开放权重

开源大模型排行榜:能力、开放性与部署选型指南

开源大模型哪个好?先区分开放权重与真正开源,再按当前模型的综合智力、编程、开放性、参数规模、速度和任务成本缩小候选,并说明部署前还要核对哪些条件。

Keygate 编辑团队6 分钟读完数据更新于 2026年9月17日 22:12

快速结论

30 秒先看结论

先看关键结论,再结合任务、预算和等待时间做选择。

Z.aiGLM-5.3 (max)44.9
仅在当前标记为开放权重的活跃型号中比较
Ai2Olmo 3 7B Think88.9
综合考虑可获得性与方法、数据透明度
AntGroupLing 3.0 Flash339.4 token/秒
公开服务速度不等于自部署硬件上的吞吐
开源大模型排行榜:能力、开放性与部署选型指南信息图

选型对照

开放权重模型综合智力前列型号

按综合智力排列,并同时展示编程、开放性、上下文和任务成本;开放权重不自动等于完全开源或无限制商用。

综合智力

44.9

编程指数

暂无数据

开放性指数

33.3

上下文

1,000,000 token

任务成本

$2.01

02MoonshotAIKimi K3 (max)

综合智力

43.8

编程指数

暂无数据

开放性指数

38.9

上下文

1,048,576 token

任务成本

$2.00

综合智力

41.9

编程指数

暂无数据

开放性指数

44.4

上下文

1,000,000 token

任务成本

$0.25

04AlibabaCloudQwen3.8 2.4T A95B

综合智力

40.0

编程指数

暂无数据

开放性指数

27.8

上下文

983,616 token

任务成本

$2.16

05AlibabaCloudQwen3.8-Flash-Next

综合智力

39.9

编程指数

暂无数据

开放性指数

38.9

上下文

256,000 token

任务成本

$0.37

综合智力

39.5

编程指数

暂无数据

开放性指数

暂无数据

上下文

1,000,000 token

任务成本

$0.27

数据更新于 2026年9月17日 22:12;本文先筛选当前标记为开放权重的活跃型号,再按各项可用指标排列。开放权重不自动等于完整开源、免费商用或适合本地部署。

开源大模型排行榜应该先看什么

用户常把“可以下载权重”的模型统称为开源大模型。严格来说,开放权重、开源代码、公开训练数据和允许商业使用是不同条件。本文沿用常见搜索说法,但排名范围以当前开放权重标记为准。

当前开放权重候选中,综合智力排名前三的是 GLM-5.3 (max)Kimi K3 (max)GLM-5.3-Flash。它们适合进入能力短名单;是否能部署、能否商用、需要多少硬件,还要逐个核对具体版本和许可证。

开放权重模型综合智力前十

  1. GLM-5.3 (max) — 44.9
  2. Kimi K3 (max) — 43.8
  3. GLM-5.3-Flash — 41.9
  4. Qwen3.8 2.4T A95B — 40.0
  5. Qwen3.8-Flash-Next — 39.9
  6. DeepSeek V4.1 Flash (max) — 39.5
  7. DeepSeek V4 Pro 0813 (max) — 36.3
  8. Qwen3.8 27B (xhigh) — 33.9
  9. Motif 3 — 33.6
  10. K2 Horizon 375B A23B — 30.8

查看完整模型目录 · 把候选加入模型对比

综合智力用于缩小通用复杂任务的候选范围,不代表某个量化版本、微调版本或本地推理框架会得到相同结果。部署后的精度、速度和成本会受到权重精度、上下文长度、批处理、硬件与推理引擎影响。

编程任务看哪些开放模型

当前暂无可用数据。

代码生成之外,开发智能体还要检查工具调用、多步骤执行、上下文窗口和失败恢复。准备本地部署时,应使用将要上线的权重版本和推理配置复测,不能把托管服务结果直接当成本地结果。

开放性指数不是许可证结论

  1. Olmo 3 7B Think — 88.9
  2. Olmo 3.1 32B Think — 88.9
  3. Apertus 70B Instruct — 88.9
  4. K2 Think V2 — 88.9
  5. Apertus 8B Instruct — 88.9

开放性指数综合观察模型可获得性以及方法、训练数据和后训练信息的透明度。它帮助比较开放程度,但不替你解释许可证,也不保证训练数据完整公开。具体计算方式可查看模型开放性指数方法

公开服务速度不能直接代表本地速度

  1. Ling 3.0 Flash — 339.4 token/秒
  2. Trinity Large Thinking — 311.5 token/秒
  3. Nemotron 3.5 Lightning — 292.6 token/秒
  4. gpt-oss-20b (low) — 249.9 token/秒
  5. Command A+ — 247.0 token/秒

这里的速度用于比较当前可用服务表现。本地部署速度取决于 GPU、显存、量化、并发、上下文和推理框架。相同权重在不同硬件上的吞吐与延迟可能差异很大,因此不能用公开服务速度承诺自部署性能。

什么时候开放权重更有价值

  • 需要在自有环境运行,并能承担部署、监控和升级工作。
  • 需要控制推理配置、量化方式、微调流程或模型版本。
  • 调用规模足够大,有必要比较托管 API 与自建资源的总成本。
  • 数据处理和网络边界要求无法由现有托管方案满足。
  • 团队能持续处理安全更新、许可证变化、性能回归和模型替换。

如果只是低频调用,托管 API 可能更省时间;如果缺少运维能力,下载权重也不会自动带来更低总成本。

部署前必须逐项核对

  1. 许可证: 商用、再分发、衍生模型和使用范围是否符合业务。
  2. 具体权重: 基础版、指令版、推理版和量化版不能混为同一个型号。
  3. 硬件预算: 显存、并发、上下文长度、吞吐和高可用需要一起估算。
  4. 能力回归: 用实际部署版本跑同一套任务,不沿用其他服务商的成绩。
  5. 安全与维护: 明确访问控制、日志、更新、回退和模型下线计划。

“开源大模型哪个好”最终不是单纯排名题,而是能力、控制权、许可证、硬件和长期维护能力的共同选择。

继续阅读