速度与延迟

大模型速度排行榜:输出速度、首字延迟与总响应时间

大模型哪个响应最快?分别比较持续输出速度、首字延迟和端到端响应时间,解释三项指标的区别,并结合能力与成本为聊天、实时应用和批处理任务筛选候选。

Keygate 编辑团队8 分钟读完数据更新于 2026年9月18日 17:31

快速结论

30 秒先看结论

先看关键结论,再结合任务、预算和等待时间做选择。

celeris 品牌标识Celeris-11423.4 token/秒
表示开始生成后的持续输出速度
CohereNorth Mini Code0.38 秒
表示用户从发送请求到看到首个 token 的等待时间
celeris 品牌标识Celeris-10.94 秒
表示从请求开始到完整回答结束的时间
MistralDevstral 2$0.000
速度之外还要确认能力与实际调用成本
大模型速度排行榜:输出速度、首字延迟与总响应时间信息图

选型对照

持续输出速度前列模型

按每秒输出 token 数排列,并同时列出首字延迟、总响应时间、综合智力和任务成本,避免把单一速度指标当成完整体验。

输出速度

1423.4 t/s

首字延迟

0.59 秒

总响应时间

0.94 秒

综合智力

6.3

任务成本

$0.050

02InceptionMercury 2

输出速度

479.6 t/s

首字延迟

5.57 秒

总响应时间

6.61 秒

综合智力

11.5

任务成本

$0.073

输出速度

358.0 t/s

首字延迟

9.11 秒

总响应时间

10.51 秒

综合智力

22.7

任务成本

$0.12

04AntGroupLing 3.0 Flash

输出速度

310.2 t/s

首字延迟

2.50 秒

总响应时间

10.56 秒

综合智力

20.6

任务成本

$0.034

输出速度

309.2 t/s

首字延迟

1.08 秒

总响应时间

9.17 秒

综合智力

10.9

任务成本

$0.35

输出速度

292.5 t/s

首字延迟

15.12 秒

总响应时间

16.83 秒

综合智力

41.2

任务成本

$1.24

数据更新于 2026年9月18日 17:31;输出速度、首字延迟和总响应时间分别排序。三项指标含义不同,不能合并成一个未经说明的“最快”结论。

大模型哪个响应最快

如果你关心模型开始输出后生成得多快,当前输出速度前三是 Celeris-1Mercury 2Gemini 3.5 Flash-Lite。如果你关心点击发送后多久看到第一个字,应看首 token 延迟;如果你关心完整任务多久结束,则要看端到端响应时间。

同一个型号可能在其中一项很快、另一项一般。聊天产品、代码助手和后台批处理对“快”的定义也不相同。

持续输出速度排行榜

  1. Celeris-1 — 1423.4 token/秒
  2. Mercury 2 — 479.6 token/秒
  3. Gemini 3.5 Flash-Lite — 358.0 token/秒
  4. Ling 3.0 Flash — 310.2 token/秒
  5. Trinity Large Thinking — 309.2 token/秒
  6. Gemini 3.8 Flash (high) — 292.5 token/秒
  7. Nemotron 3.5 Lightning — 287.5 token/秒
  8. Nova Micro — 276.3 token/秒
  9. Command A+ — 236.6 token/秒
  10. gpt-oss-20b (low) — 225.4 token/秒

持续输出速度表示模型已经开始生成后,每秒输出多少 token。它直接影响长回答、代码生成和流式输出的阅读节奏,但不包含请求发出后的首次等待。

查看完整输出速度图表

首字延迟排行榜

  1. North Mini Code — 0.38 秒
  2. Granite 4.2 3B — 0.39 秒
  3. Command A+ — 0.42 秒
  4. Celeris-1 — 0.59 秒
  5. Nemotron 3.5 Lightning — 0.62 秒
  6. Ministral 3 3B — 0.64 秒
  7. Claude 4.5 Haiku (Non-reasoning) — 0.67 秒
  8. Granite 4.2 8B — 0.68 秒
  9. Qwen3.5 9B (Non-reasoning) — 0.74 秒
  10. Gemma 4 E4B (Non-reasoning) — 0.75 秒

首 token 延迟是从发送请求到收到第一个 token 的时间。搜索框、客服、聊天和实时助手通常对这项指标更敏感,因为用户会把“迟迟没有反应”理解为卡住。

查看首字延迟图表

总响应时间排行榜

  1. Celeris-1 — 0.94 秒
  2. Nova Micro — 2.69 秒
  3. Ministral 3 3B — 2.90 秒
  4. Mistral Small 4 (Non-reasoning) — 3.94 秒
  5. Nemotron 3 Nano (Non-reasoning) — 4.18 秒
  6. NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) — 4.25 秒
  7. Qwen3.5 Omni Flash — 4.29 秒
  8. Nova 2.0 Lite (Non-reasoning) — 4.42 秒
  9. Qwen3 Next 80B A3B — 4.95 秒
  10. Llama 4 Maverick — 5.22 秒

端到端响应时间从请求开始算到完整回答结束。它同时受到首字延迟、推理过程、输出长度和持续输出速度影响,更接近“这次任务多久完成”。

查看总响应时间图表

为什么最快不一定最好用

模型速度只能说明等待体验,不能说明答案是否正确、任务是否完成或输出是否值得保留。当前综合智力靠前的候选为:

  1. Claude Fable 5.1 (max with fallback) — 53.4
  2. Claude Fable 5.1 (xhigh with fallback) — 53.2
  3. GPT-6 Astra (max) — 52.8
  4. GPT-6 Astra (xhigh) — 52.5
  5. Claude Fable 5.1 (high with fallback) — 51.2

真实产品通常需要设置能力底线,再在合格模型中比较速度。如果速度更快但错误率更高、需要频繁重试,最终完成时间和总成本反而可能更差。

按产品场景选择速度指标

  • 聊天与客服: 首字延迟决定是否“立即有回应”,输出速度决定后续是否流畅,两项都要看。
  • 代码助手: 短补全更重视首字延迟;生成完整文件或长解释时,持续输出速度影响更大。
  • 智能体工作流: 端到端时间、工具调用等待和重试次数共同决定任务完成速度。
  • 后台批处理: 用户不直接等待时,可以降低首字延迟权重,更重视总完成时间、吞吐与成本。
  • 长推理任务: 较长等待可能来自更复杂的推理过程,不能只按速度删除高能力候选。

一套可复用的速度验收方法

  1. 使用与你线上请求相同的输入长度、输出上限和推理设置。
  2. 分开记录首 token、持续输出、完整响应和失败重试,不只记录平均值。
  3. 对每个候选重复测试,观察高峰时段和较慢请求,而不是只看最快一次。
  4. 同时记录答案是否合格;不合格的快速回答不算有效完成。
  5. 把最终可用结果的时间与成本作为业务指标,再决定主模型和回退模型。

页面中的榜单用于快速筛选。接入前还需确认具体 API 供应方式、地区、并发、速率限制和流式返回行为,因为这些产品条件会影响真实延迟。

继续阅读