综合榜单

AI 大模型排行榜:智力、速度与成本怎么选

AI 大模型怎么选?用持续更新的智力、编程、速度、延迟和任务成本数据,直接看当前领先型号,并按你的真实使用场景缩小范围。

Keygate 编辑团队6 分钟读完数据更新于 2026年9月13日 17:45

快速结论

30 秒先看结论

先看关键结论,再结合任务、预算和等待时间做选择。

ClaudeClaude Fable 5.1 (max with fallback)53.4
复杂任务先看这一项
GoogleGemini 3.5 Flash-Lite366.6 token/秒
反映开始输出后的持续生成速度
MetaMuse Glimmer (high)$0.055
在满足能力要求后再比较成本
AI 大模型排行榜:智力、速度与成本怎么选信息图

选型对照

综合智力前列模型怎么取舍

排名只回答单项高低;把能力、速度和成本放在一起,才更接近真实选型。

综合智力

52.8

编程指数

暂无数据

输出速度

60.4 t/s

单任务成本

$3.26

综合智力

50.7

编程指数

暂无数据

输出速度

52.7 t/s

单任务成本

$5.86

综合智力

48.2

编程指数

暂无数据

输出速度

243.3 t/s

单任务成本

$1.60

综合智力

47.1

编程指数

暂无数据

输出速度

59.6 t/s

单任务成本

$1.99

数据更新于 2026年9月13日 17:45;榜单按有对应测评数据的主流型号排序。

结论先看

当前主流候选模型中,综合智力排名前三的是 Claude Fable 5.1 (max with fallback)GPT-6 Astra (max)Claude Opus 5 (max)。综合排名适合快速缩小范围,但最终选择还要同时看编程、速度、延迟、成本和上下文。

先别急着追第一名

选模型更像选车,而不是只看一次百公里加速。你需要先回答四个问题:它能不能完成你的任务、用户要等多久、一次任务实际花多少钱、输入内容会不会超过上下文窗口。任何一个硬条件不满足,单项第一都没有意义。

  • 个人日常使用: 先从综合智力前列中选,再比较响应速度和使用成本。
  • 开发与自动化: 把编程指数和智能体指数放在综合智力之前看。
  • 面向客户的产品: 首 token 延迟决定“多久有反应”,输出速度决定“后面读起来顺不顺”。
  • 大批量 API 调用: 先设能力底线,再在合格型号里压低单任务成本。

综合智力前十

  1. Claude Fable 5.1 (max with fallback) — 53.4
  2. GPT-6 Astra (max) — 52.8
  3. Claude Opus 5 (max) — 50.7
  4. Claude Fable 5 (with fallback) — 49.7
  5. Muse Spark 1.3 (max) — 48.2
  6. GPT-5.6 Sol (max) — 47.1
  7. GLM-5.3 (max) — 44.9
  8. Grok 4.6 (high) — 44.4
  9. Kimi K3 (max) — 43.8
  10. GPT-5.6 Terra (max) — 42.3

查看完整智力图表 · 把任意模型加入对比

速度最快的主流模型

输出速度代表模型开始持续输出后每秒生成的 token 数。它不等于首次响应延迟,也不代表能力一定更强。

  1. Gemini 3.5 Flash-Lite — 366.6 token/秒
  2. Gemini 3.8 Flash (high) — 274.9 token/秒
  3. Muse Spark 1.3 (max) — 243.3 token/秒
  4. DeepSeek V4.1 Flash (max) — 218.7 token/秒
  5. gpt-oss-120b (high) — 211.8 token/秒

查看完整速度与延迟数据

单任务成本较低的主流模型

单任务成本衡量模型完成同一套任务时产生的实际调用成本,和公开 API 单价不是同一回事。

  1. Muse Glimmer (high) — $0.055
  2. gpt-oss-120b (high) — $0.11
  3. Gemini 3.5 Flash-Lite — $0.12
  4. GPT-5.6 Luna (max) — $0.18
  5. GLM-5.3-Flash — $0.25

查看价格与成本图表

应该重点看哪些指标

  • 日常问答与内容工作: 先看综合智力,再看速度和价格。
  • 软件开发: 重点看编程指数与智能体指数,然后比较任务成本。
  • 高频 API 调用: 同时看输入价格、输出价格、单任务成本和延迟。
  • 长文档处理: 先确认上下文窗口,再比较能力与成本。

排行榜回答“谁在某个指标上更高”,不直接替你决定“谁最适合”。你可以进入模型对比工具,把候选型号放进同一组数据中检查。

三分钟做出第一轮选择

第一步,从与你任务最相关的榜单里保留 3–5 个型号;第二步,删除上下文、速度或能力达不到底线的型号;第三步,再比较单任务成本,而不是只比较每百万 token 的标价。这样得到的是一份可以试用的候选清单,而不是一串看完仍不知道怎么选的排名。

如果两个型号非常接近,不需要强行判断谁“绝对更好”。更实用的做法是把它们加入对比页,明确你愿意用多少成本换取多少能力或速度。

继续阅读