跳到主要内容

新用户注册即送测试额度,够跑完一整套 eval

官方授权渠道

GPT-5.6 Luna API 中转

GPT-5.6 里最快最便宜的一档,窗口一点没缩。

  • 上下文

    1.05M

  • 最大输出

    128K

  • 推理精度

    Vendor-managed

  • 许可

    Proprietary

GPT-5.6 Luna 是三档中最快、最便宜的一档,为高并发工作负载设计,官方定价为每百万 token 输入 1 美元、输出 6 美元。它与 Sol、Terra 共用 1,050,000 token 上下文、128,000 最大输出与同一知识截止,支持文本与图像输入。换句话说,便宜的代价是推理强度而不是窗口——批量处理长文档时不必为此换模型。

闭源模型,通过厂商官方商用授权渠道提供。有合同、有发票、可审计——不是号池,也不是逆向的客户端协议。

规格

模型 ID
gpt-5.6-luna
发布方
OpenAI
供给方式
官方授权渠道
许可
Proprietary
上下文
1.05M
最大输出
128K
推理精度
Vendor-managed
输入模态
文本 · 图像
发布时间
2026-07-09

它强在哪

官方定价是 Sol 的五分之一
输入 1 美元、输出 6 美元每百万 token。对以量取胜的链路,这个价差通常比任何微调都更能改变单位经济。
长窗口原样保留
105 万上下文与 128K 输出和顶配档完全一致。这在便宜档里并不常见——很多厂商的低价档是靠砍窗口换来的。
高并发场景的默认选择
明确面向 high-volume 工作负载。前置分类、批量清洗、客服首答这类请求量大而单条难度低的场景最适合它。

典型用法

  • 高并发的分类、抽取、清洗与打标
  • 客服与对话产品的前置链路
  • 大批量长文档的规模化摘要
  • 多档路由方案里的成本底座

三步接入

改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。

model: "gpt-5.6-luna"

curl https://api.nexaix.net/v1/chat/completions \
  -H "Authorization: Bearer $NEXAIX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-luna",
    "stream": true,
    "messages": [
      { "role": "user", "content": "Summarise this contract." }
    ]
  }'

关于这个模型

Luna 够用吗?

取决于任务分层。大量生产请求本身是简单确定的,用 Luna 承接能把总成本压下一个量级;把实测不达标的那部分升到 Terra 或 Sol 即可。先用你自己的 eval 量一遍,再决定阈值。

Luna 的速度优势有多大?

它是三档里最快的一档。具体延迟取决于输入长度、输出长度和当时负载,建议用你真实的请求长度实测,而不是看宣传数字。

满载时会被降级到别的模型吗?

不会。满载时我们返回标准 429 并带上重试建议,由你决定排队、退避还是切档。静默换模型是我们明确不做的事。

也看看这些

用你自己的题目跑一遍

注册领测试额度,把你真实的 eval 在这个模型上跑一遍,再决定要不要交生产流量。