官方授权渠道
GPT-5.6 Luna API 中转
GPT-5.6 里最快最便宜的一档,窗口一点没缩。
上下文
1.05M
最大输出
128K
推理精度
Vendor-managed
许可
Proprietary
GPT-5.6 Luna 是三档中最快、最便宜的一档,为高并发工作负载设计,官方定价为每百万 token 输入 1 美元、输出 6 美元。它与 Sol、Terra 共用 1,050,000 token 上下文、128,000 最大输出与同一知识截止,支持文本与图像输入。换句话说,便宜的代价是推理强度而不是窗口——批量处理长文档时不必为此换模型。
闭源模型,通过厂商官方商用授权渠道提供。有合同、有发票、可审计——不是号池,也不是逆向的客户端协议。
规格
- 模型 ID
- gpt-5.6-luna
- 发布方
- OpenAI
- 供给方式
- 官方授权渠道
- 许可
- Proprietary
- 上下文
- 1.05M
- 最大输出
- 128K
- 推理精度
- Vendor-managed
- 输入模态
- 文本 · 图像
- 发布时间
- 2026-07-09
- 价格
- 见定价页
它强在哪
- 官方定价是 Sol 的五分之一
- 输入 1 美元、输出 6 美元每百万 token。对以量取胜的链路,这个价差通常比任何微调都更能改变单位经济。
- 长窗口原样保留
- 105 万上下文与 128K 输出和顶配档完全一致。这在便宜档里并不常见——很多厂商的低价档是靠砍窗口换来的。
- 高并发场景的默认选择
- 明确面向 high-volume 工作负载。前置分类、批量清洗、客服首答这类请求量大而单条难度低的场景最适合它。
典型用法
- 高并发的分类、抽取、清洗与打标
- 客服与对话产品的前置链路
- 大批量长文档的规模化摘要
- 多档路由方案里的成本底座
三步接入
改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。
model: "gpt-5.6-luna"
curl https://api.nexaix.net/v1/chat/completions \
-H "Authorization: Bearer $NEXAIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-luna",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarise this contract." }
]
}'import os
from openai import OpenAI
client = OpenAI(
# 只有这一行是新的
base_url="https://api.nexaix.net/v1",
api_key=os.environ["NEXAIX_API_KEY"],
)
# 下面全是你原来的代码
stream = client.chat.completions.create(
model="gpt-5.6-luna",
stream=True,
messages=[
{"role": "user", "content": "Summarise this contract."}
],
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.nexaix.net/v1", // 只有这一行是新的
apiKey: process.env.NEXAIX_API_KEY,
});
// 下面全是你原来的代码
const stream = await client.chat.completions.create({
model: "gpt-5.6-luna",
stream: true,
messages: [
{ role: "user", content: "Summarise this contract." }
],
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}关于这个模型
Luna 够用吗?
取决于任务分层。大量生产请求本身是简单确定的,用 Luna 承接能把总成本压下一个量级;把实测不达标的那部分升到 Terra 或 Sol 即可。先用你自己的 eval 量一遍,再决定阈值。
Luna 的速度优势有多大?
它是三档里最快的一档。具体延迟取决于输入长度、输出长度和当时负载,建议用你真实的请求长度实测,而不是看宣传数字。
满载时会被降级到别的模型吗?
不会。满载时我们返回标准 429 并带上重试建议,由你决定排队、退避还是切档。静默换模型是我们明确不做的事。
