AI 模型价格对比:API 单价与任务成本怎么看
AI 大模型 API 哪个更便宜?分清公开单价与完成一次任务的实际成本,再结合模型能力和速度,避免只看最低价格做决定。
快速结论
30 秒先看结论
先看关键结论,再结合任务、预算和等待时间做选择。

选型对照
低成本候选模型的完整取舍
先按单任务成本筛选,再同时检查能力、速度和公开 API 混合价格。
单任务成本
$0.055
混合 API 价
$0.25 / 1M
综合智力
18.1
输出速度
90.4 t/s
单任务成本
$0.11
混合 API 价
$0.18 / 1M
综合智力
12.3
输出速度
211.8 t/s
单任务成本
$0.12
混合 API 价
$0.33 / 1M
综合智力
22.7
输出速度
366.6 t/s
单任务成本
$0.18
混合 API 价
$0.17 / 1M
综合智力
37.5
输出速度
121.4 t/s
单任务成本
$0.25
混合 API 价
$0.098 / 1M
综合智力
41.9
输出速度
107.4 t/s
单任务成本
$0.27
混合 API 价
$0.18 / 1M
综合智力
39.5
输出速度
218.7 t/s
数据更新于 2026年9月13日 17:45。以下分别比较 API 单价、单任务成本、能力与速度。
最便宜的单价,未必带来最低账单
模型按 token 标价,但你的业务按“完成了多少次有效任务”产生价值。输出更长、推理 token 更多、需要重复调用或频繁重试,都会让实际成本偏离表面单价。因此本文把 API 单价和单任务成本拆开比较。
API 单价和任务成本不是一回事
API 单价告诉你每百万 token 的价格;单任务成本还会受到模型输出长度、推理 token、缓存使用和完成任务所需计算量影响。价格低的模型,完成同一任务时不一定成本最低。
单任务成本较低的主流模型
以下按单任务成本由低到高排列:
- Muse Glimmer (high) — $0.055
- gpt-oss-120b (high) — $0.11
- Gemini 3.5 Flash-Lite — $0.12
- GPT-5.6 Luna (max) — $0.18
- GLM-5.3-Flash — $0.25
- DeepSeek V4.1 Flash (max) — $0.27
- Mistral Medium 3.5 — $0.44
- MiniMax-M3 — $0.51
- Nemotron 3 Ultra — $0.58
- Inkling — $0.61
混合 API 单价较低的主流模型
以下使用当前数据中的混合输入输出价格,并按由低到高排列:
- GLM-5.3-Flash — $0.098 / 1M token
- GPT-5.6 Luna (max) — $0.17 / 1M token
- gpt-oss-120b (high) — $0.18 / 1M token
- DeepSeek V4.1 Flash (max) — $0.18 / 1M token
- MiniMax-M3 — $0.22 / 1M token
- Muse Glimmer (high) — $0.25 / 1M token
- Gemini 3.5 Flash-Lite — $0.33 / 1M token
- Qwen3.8 27B (xhigh) — $0.43 / 1M token
- Nemotron 3 Ultra — $0.52 / 1M token
- Gemini 3.8 Flash (high) — $0.58 / 1M token
正确的选型顺序
- 先确定任务必须达到的能力下限。
- 在达到能力下限的候选模型中比较单任务成本。
- 再检查速度、延迟和上下文是否满足产品体验。
- 最后用预期调用量估算月度预算。
只比较最低单价,容易忽略重试、长推理和输出长度带来的成本;只比较最高能力,又可能为日常任务支付不必要的费用。
用自己的调用量估算月预算
先记录一天大约会发起多少次任务,再用候选型号的单任务成本做第一轮估算;如果你的请求长度差异很大,再结合输入、输出和缓存价格做区间。这里最重要的不是得到一个看似精确的小数,而是确认调用量增加十倍时,哪个成本项会成为主要支出。
预算敏感的产品可以采用“两级模型”思路:常规任务从达到能力底线的低成本候选中选择,复杂任务再进入更高能力候选,并根据实际请求设定分流规则。
怎样判断性价比
先设定能力和速度底线,再在合格型号中比较 API 单价与单任务成本。
查看完整价格与成本图表 · 查看综合智力 · 开始模型对比