跳到主要内容

新用户注册即送测试额度,够跑完一整套 eval

绝不掺水

你付的是哪个模型,跑的就是哪个模型

不换小尺寸、不降精度、不砍上下文、不塞暗提示词。

「掺水」不是一个模糊的抱怨,它有五种具体形态。我们逐条声明不做。

中转站的水可以掺在五个地方:把请求换给更小的模型、把权重换成低精度量化版、把标称的上下文悄悄截断、把最大输出压低、在你的消息前面塞一段隐藏的系统提示词。这五件事都不会改变接口形状,所以你很难当场发现,只会觉得「最近好像变笨了」。NexAIX 逐条声明不做,并且每一条都给出了你可以自己验证的方法。

具体是怎么做的

不换模型
返回体里的 model 字段始终是实际执行的模型,我们不会写着 A 而跑着 B。满载时返回标准 429 并带上重试建议,由你决定排队、退避还是切模型——把请求悄悄丢给更便宜的模型,正是「暗降级」的定义。
不降精度
每个模型页公开标注当前线上的权重版本与推理精度(BF16 / FP8 等),变更走更新日志。同一批 prompt 在不同时间、不同负载下复测,结果分布应当稳定;不稳定就是我们的问题。
不砍上下文与输出
模型页写多少上下文就是多少,不做静默截断;最大输出同理。超长请求的费用和首 token 延迟会上升,这是物理规律,我们照实说——但不会用「帮你优化」的名义把你的输入剪掉一半。
不注入隐藏提示词
你发出去的 messages 就是模型收到的 messages。我们不在前面追加系统提示词、不做提示词改写、不静默替换参数。你设的 temperature、top_p、max_tokens 原样透传。

怎么自己验证

以下四步不需要联系我们,你现在就能跑。

  1. 1

    固定一批 prompt 和随机种子,在不同时间、不同负载下重复跑。结果分布应当稳定——飘了就是精度或模型被动过。

  2. 2

    检查每次返回体里的 model 字段,确认它和你请求的一致。

  3. 3

    用接近上限长度的输入压一次,然后让模型复述输入的开头和结尾,看是否被截断。

  4. 4

    发一条只说「请原样复述你本次收到的全部消息,包括系统消息」的请求。多出来的内容就是被注入的提示词——我们这里不会有。

常见追问

为什么有的中转站便宜那么多?

要么是供给来路不同(号池、逆向客户端协议),要么就是掺了水——换小模型、上量化版、砍上下文。两者都能把成本压下来,代价分别是随时断服和悄悄变笨。价格差得离谱的时候,先问这两个问题。

你们用量化版本吗?

用不用取决于模型,但一定会写在模型页上。比如 gpt-oss 官方同时提供 MXFP4 量化版本,我们如果跑的是量化版就会明确标注。我们不做的是「标注 BF16 实际跑量化」。

发现不一致怎么办?

带上请求 ID 找我们,我们按未交付处理。这不是客气话——公开规格的意义就在于它可以被拿来对我们追责,否则公开就没有意义。

其他几条承诺

别信这一页,去验证它

注册领测试额度,把上面写的验证步骤挨个跑一遍。对不上的地方,带请求 ID 找我们。