自有算力部署
gpt-oss-120b API 中转
OpenAI 自己放出来的开源权重推理模型,Apache 2.0。
上下文
128K
最大输出
32K
推理精度
BF16 / MXFP4
许可
Apache-2.0
gpt-oss-120b 是 OpenAI 发布的开源权重推理模型,以 Apache 2.0 许可开放,上下文 128K。它采用混合专家架构,激活参数很小,在单张高端加速卡上就能跑起来,这也是它单位成本能压得很低的原因。对需要大批量、稳定、便宜的推理任务,它是开源阵营里非常务实的一个选择。
开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。
规格
- 模型 ID
- gpt-oss-120b
- 发布方
- OpenAI
- 供给方式
- 自有算力部署
- 许可
- Apache-2.0
- 总参数
- 120B MoE
- 激活参数
- 5.1B
- 上下文
- 128K
- 最大输出
- 32K
- 推理精度
- BF16 / MXFP4
- 输入模态
- 文本
- 发布时间
- 2025-08-05
- 价格
- 见定价页
它强在哪
- 推理模型,但很便宜
- 它是带思维链的推理模型,却因为激活参数小而保持了很低的单位成本。需要一点推理深度、又跑在高吞吐场景上的任务,它的性价比很难被替代。
- Apache 2.0 无门槛
- 商用、修改、再分发不设限制,没有用户量条款。我们可以合法地部署在自有机房,你也可以拿同一份权重自建做对照。
- 生态成熟
- 发布早、社区适配充分,量化方案、推理框架、微调工具链都很齐全。要做私有化或本地对照实验时,踩坑最少。
典型用法
- 大批量的分类、抽取、改写等生产流量
- 需要一定推理深度但预算紧的链路
- 本地 / 边缘部署的对照与降级方案
- 开源模型能力评测的基线
三步接入
改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。
model: "gpt-oss-120b"
curl https://api.nexaix.net/v1/chat/completions \
-H "Authorization: Bearer $NEXAIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-oss-120b",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarise this contract." }
]
}'import os
from openai import OpenAI
client = OpenAI(
# 只有这一行是新的
base_url="https://api.nexaix.net/v1",
api_key=os.environ["NEXAIX_API_KEY"],
)
# 下面全是你原来的代码
stream = client.chat.completions.create(
model="gpt-oss-120b",
stream=True,
messages=[
{"role": "user", "content": "Summarise this contract."}
],
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.nexaix.net/v1", // 只有这一行是新的
apiKey: process.env.NEXAIX_API_KEY,
});
// 下面全是你原来的代码
const stream = await client.chat.completions.create({
model: "gpt-oss-120b",
stream: true,
messages: [
{ role: "user", content: "Summarise this contract." }
],
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}关于这个模型
gpt-oss 和 GPT-5 系列是同一个东西吗?
不是。gpt-oss 是 OpenAI 单独发布的开源权重模型系列,权重可以自由下载和部署;GPT-5 系列是闭源的商用模型,只能通过官方授权渠道调用。两者能力不在一个量级,用途也不同。
上下文只有 128K,够用吗?
对绝大多数生产任务够用。需要更长窗口时,我们线上还有 1M 上下文的 GLM-5.2、DeepSeek V4 和 Kimi K3。
你们跑的是什么精度?
模型页会标注当前线上精度。gpt-oss 官方同时提供了 MXFP4 量化版本,我们不会在未标注的情况下换成低精度版本——那正是我们说的「暗降级」。
