gpt-oss-120b (high)
gpt-oss-120b (high) 是 OpenAI 发布的推理型、开放权重 AI 模型,发布于 2025年8月5日。它可接收文本输入,可生成文本。上下文窗口为 131K Token。
OpenAI 是 GPT 系列模型的开发与发布方,产品覆盖通用推理、代码处理、多模态理解和智能体任务。
当前模型库还收录了 OpenAI 的另外 25 个型号,可在模型对比页按厂商筛选。
23.8
综合智力
综合推理、知识与复杂任务能力;在 255 款有该指标的模型中第 102 名
30.4
编程指数
代码生成与软件工程任务表现;在 132 款有该指标的模型中第 85 名
13.2
智能体指数
多步骤任务与工具使用表现;在 127 款有该指标的模型中第 72 名
273.3 Token/秒
输出速度
开始输出后的中位生成速度;在 162 款有该指标的模型中第 13 名
$0.061
单任务成本
完成一项统一智力评测任务的平均成本;在 94 款有该指标的模型中第 26 名
131K
上下文窗口
一次请求可处理的最大 Token 数
一眼看懂
这款模型该怎么看
先确认任务类型,再比较对应能力、响应速度和使用成本。单项分数接近时,不必把很小的差距当成绝对胜负。
基于 264 款文本模型比较
选型时重点查看
- 01通用推理和复杂任务先看综合智力(当前第 102/255),不要只凭厂商品牌判断。
- 02代码生成和软件工程任务重点看编程指数(当前第 85/132)。
- 03需要多步骤执行或工具协作时,重点看智能体指数(当前第 72/127)。
- 04重视对话流畅度时,同时看首 Token 延迟 0.88 秒和输出速度 273.3 Token/秒。
- 05处理长文档或大型代码库时,确认 131K 上下文是否覆盖你的实际输入。
关键指标
按用途查看模型表现
查看能力、速度、成本、上下文和模型规格。
01 · Capability
能力表现
判断复杂任务、编程、知识准确性与专业任务能力。
23.8
综合智力
综合推理、知识与复杂任务能力,越高越好
30.4
编程指数
代码生成与软件工程任务表现,越高越好
13.2
智能体指数
多步骤任务与工具使用表现,越高越好
-50.1
全知指数
知识回答准确性与避免幻觉的综合表现,越高越好
0.2%
知识准确率
知识问题回答正确率,越高越好
0.9%
幻觉率
知识题中产生错误事实的比例,越低越好
7
专业任务 Elo
复杂、长周期专业任务的综合表现
38.9
开放性指数
模型可获得性与方法透明度的综合指标
02 · Response
响应体验
区分多久开始回答、开始后答多快,以及整次任务耗时。
273.3 Token/秒
输出速度
开始输出后每秒生成的 Token 中位数
0.88 秒
首 Token 延迟
从发出请求到第一个 Token 的中位等待时间
8.19 秒
首个答案 Token
从发出请求到开始输出最终答案的时间
10.02 秒
端到端时间
完成一次统一评测任务的中位总时间
49.9–1,499.1 Token/秒
速度区间
第 5 至第 95 百分位输出速度
03 · Price
价格与成本
区分公开 Token 价格和统一评测中的实际任务成本。
$0.061
单任务成本
完成一项统一智力评测任务的平均成本
$0.15
输入价格
每百万输入 Token 价格
$0.60
输出价格
每百万输出 Token 价格
$0.20
混合价格
按 7:2:1 输入、缓存与输出权重计算
$0.15
缓存读取
每百万缓存读取 Token 价格
04 · Specification
模型规格
查看上下文、参数和输入输出能力。
131K
上下文窗口
一次请求可处理的最大 Token 数
117.0B
总参数
模型总参数量,单位为十亿参数
5.1B
激活参数
推理时实际激活的参数量,单位为十亿参数
文本
输入能力
支持的输入类型
文本
输出能力
支持的输出类型
推理模型
模型类型
是否属于推理模型
开放权重
权重状态
permissive
2025年8月5日
发布日期
模型发布时间