绝不掺水
你付的是哪个模型,跑的就是哪个模型
不换小尺寸、不降精度、不砍上下文、不塞暗提示词。
「掺水」不是一个模糊的抱怨,它有五种具体形态。我们逐条声明不做。
中转站的水可以掺在五个地方:把请求换给更小的模型、把权重换成低精度量化版、把标称的上下文悄悄截断、把最大输出压低、在你的消息前面塞一段隐藏的系统提示词。这五件事都不会改变接口形状,所以你很难当场发现,只会觉得「最近好像变笨了」。NexAIX 逐条声明不做,并且每一条都给出了你可以自己验证的方法。
具体是怎么做的
- 不换模型
- 返回体里的 model 字段始终是实际执行的模型,我们不会写着 A 而跑着 B。满载时返回标准 429 并带上重试建议,由你决定排队、退避还是切模型——把请求悄悄丢给更便宜的模型,正是「暗降级」的定义。
- 不降精度
- 每个模型页公开标注当前线上的权重版本与推理精度(BF16 / FP8 等),变更走更新日志。同一批 prompt 在不同时间、不同负载下复测,结果分布应当稳定;不稳定就是我们的问题。
- 不砍上下文与输出
- 模型页写多少上下文就是多少,不做静默截断;最大输出同理。超长请求的费用和首 token 延迟会上升,这是物理规律,我们照实说——但不会用「帮你优化」的名义把你的输入剪掉一半。
- 不注入隐藏提示词
- 你发出去的 messages 就是模型收到的 messages。我们不在前面追加系统提示词、不做提示词改写、不静默替换参数。你设的 temperature、top_p、max_tokens 原样透传。
怎么自己验证
以下四步不需要联系我们,你现在就能跑。
- 1
固定一批 prompt 和随机种子,在不同时间、不同负载下重复跑。结果分布应当稳定——飘了就是精度或模型被动过。
- 2
检查每次返回体里的 model 字段,确认它和你请求的一致。
- 3
用接近上限长度的输入压一次,然后让模型复述输入的开头和结尾,看是否被截断。
- 4
发一条只说「请原样复述你本次收到的全部消息,包括系统消息」的请求。多出来的内容就是被注入的提示词——我们这里不会有。
常见追问
为什么有的中转站便宜那么多?
要么是供给来路不同(号池、逆向客户端协议),要么就是掺了水——换小模型、上量化版、砍上下文。两者都能把成本压下来,代价分别是随时断服和悄悄变笨。价格差得离谱的时候,先问这两个问题。
你们用量化版本吗?
用不用取决于模型,但一定会写在模型页上。比如 gpt-oss 官方同时提供 MXFP4 量化版本,我们如果跑的是量化版就会明确标注。我们不做的是「标注 BF16 实际跑量化」。
发现不一致怎么办?
带上请求 ID 找我们,我们按未交付处理。这不是客气话——公开规格的意义就在于它可以被拿来对我们追责,否则公开就没有意义。
