大模型速度排行榜:输出速度、首字延迟与总响应时间
大模型哪个响应最快?分别比较持续输出速度、首字延迟和端到端响应时间,解释三项指标的区别,并结合能力与成本为聊天、实时应用和批处理任务筛选候选。
快速结论
30 秒先看结论
先看关键结论,再结合任务、预算和等待时间做选择。

选型对照
持续输出速度前列模型
按每秒输出 token 数排列,并同时列出首字延迟、总响应时间、综合智力和任务成本,避免把单一速度指标当成完整体验。
输出速度
1423.4 t/s
首字延迟
0.59 秒
总响应时间
0.94 秒
综合智力
6.3
任务成本
$0.050
输出速度
479.6 t/s
首字延迟
5.57 秒
总响应时间
6.61 秒
综合智力
11.5
任务成本
$0.073
输出速度
358.0 t/s
首字延迟
9.11 秒
总响应时间
10.51 秒
综合智力
22.7
任务成本
$0.12
输出速度
310.2 t/s
首字延迟
2.50 秒
总响应时间
10.56 秒
综合智力
20.6
任务成本
$0.034
输出速度
309.2 t/s
首字延迟
1.08 秒
总响应时间
9.17 秒
综合智力
10.9
任务成本
$0.35
输出速度
292.5 t/s
首字延迟
15.12 秒
总响应时间
16.83 秒
综合智力
41.2
任务成本
$1.24
数据更新于 2026年9月18日 17:31;输出速度、首字延迟和总响应时间分别排序。三项指标含义不同,不能合并成一个未经说明的“最快”结论。
大模型哪个响应最快
如果你关心模型开始输出后生成得多快,当前输出速度前三是 Celeris-1、Mercury 2、Gemini 3.5 Flash-Lite。如果你关心点击发送后多久看到第一个字,应看首 token 延迟;如果你关心完整任务多久结束,则要看端到端响应时间。
同一个型号可能在其中一项很快、另一项一般。聊天产品、代码助手和后台批处理对“快”的定义也不相同。
持续输出速度排行榜
- Celeris-1 — 1423.4 token/秒
- Mercury 2 — 479.6 token/秒
- Gemini 3.5 Flash-Lite — 358.0 token/秒
- Ling 3.0 Flash — 310.2 token/秒
- Trinity Large Thinking — 309.2 token/秒
- Gemini 3.8 Flash (high) — 292.5 token/秒
- Nemotron 3.5 Lightning — 287.5 token/秒
- Nova Micro — 276.3 token/秒
- Command A+ — 236.6 token/秒
- gpt-oss-20b (low) — 225.4 token/秒
持续输出速度表示模型已经开始生成后,每秒输出多少 token。它直接影响长回答、代码生成和流式输出的阅读节奏,但不包含请求发出后的首次等待。
首字延迟排行榜
- North Mini Code — 0.38 秒
- Granite 4.2 3B — 0.39 秒
- Command A+ — 0.42 秒
- Celeris-1 — 0.59 秒
- Nemotron 3.5 Lightning — 0.62 秒
- Ministral 3 3B — 0.64 秒
- Claude 4.5 Haiku (Non-reasoning) — 0.67 秒
- Granite 4.2 8B — 0.68 秒
- Qwen3.5 9B (Non-reasoning) — 0.74 秒
- Gemma 4 E4B (Non-reasoning) — 0.75 秒
首 token 延迟是从发送请求到收到第一个 token 的时间。搜索框、客服、聊天和实时助手通常对这项指标更敏感,因为用户会把“迟迟没有反应”理解为卡住。
总响应时间排行榜
- Celeris-1 — 0.94 秒
- Nova Micro — 2.69 秒
- Ministral 3 3B — 2.90 秒
- Mistral Small 4 (Non-reasoning) — 3.94 秒
- Nemotron 3 Nano (Non-reasoning) — 4.18 秒
- NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) — 4.25 秒
- Qwen3.5 Omni Flash — 4.29 秒
- Nova 2.0 Lite (Non-reasoning) — 4.42 秒
- Qwen3 Next 80B A3B — 4.95 秒
- Llama 4 Maverick — 5.22 秒
端到端响应时间从请求开始算到完整回答结束。它同时受到首字延迟、推理过程、输出长度和持续输出速度影响,更接近“这次任务多久完成”。
为什么最快不一定最好用
模型速度只能说明等待体验,不能说明答案是否正确、任务是否完成或输出是否值得保留。当前综合智力靠前的候选为:
- Claude Fable 5.1 (max with fallback) — 53.4
- Claude Fable 5.1 (xhigh with fallback) — 53.2
- GPT-6 Astra (max) — 52.8
- GPT-6 Astra (xhigh) — 52.5
- Claude Fable 5.1 (high with fallback) — 51.2
真实产品通常需要设置能力底线,再在合格模型中比较速度。如果速度更快但错误率更高、需要频繁重试,最终完成时间和总成本反而可能更差。
按产品场景选择速度指标
- 聊天与客服: 首字延迟决定是否“立即有回应”,输出速度决定后续是否流畅,两项都要看。
- 代码助手: 短补全更重视首字延迟;生成完整文件或长解释时,持续输出速度影响更大。
- 智能体工作流: 端到端时间、工具调用等待和重试次数共同决定任务完成速度。
- 后台批处理: 用户不直接等待时,可以降低首字延迟权重,更重视总完成时间、吞吐与成本。
- 长推理任务: 较长等待可能来自更复杂的推理过程,不能只按速度删除高能力候选。
一套可复用的速度验收方法
- 使用与你线上请求相同的输入长度、输出上限和推理设置。
- 分开记录首 token、持续输出、完整响应和失败重试,不只记录平均值。
- 对每个候选重复测试,观察高峰时段和较慢请求,而不是只看最快一次。
- 同时记录答案是否合格;不合格的快速回答不算有效完成。
- 把最终可用结果的时间与成本作为业务指标,再决定主模型和回退模型。
页面中的榜单用于快速筛选。接入前还需确认具体 API 供应方式、地区、并发、速率限制和流式返回行为,因为这些产品条件会影响真实延迟。