跳到主要内容

新用户注册即送测试额度,够跑完一整套 eval

超高速率

限速写在文档里,不是随缘

自有算力决定容量上限,配额和限速对你公开。

速率的前提是容量,容量的前提是那些卡真的是你自己的。

「不限速」是一句没有成本的宣传。真正决定你能跑多快的是三件事:供给方到底控制多少算力、限速规则是否公开、满载时会发生什么。转售第三方额度的中转站,这三件事都不在它自己手里——它的上限是别人给的,规则是随时变的,满载时最省事的做法就是把你的请求丢给更便宜的模型。我们的容量来自自有集群,所以这三件事都能对你写清楚。

具体是怎么做的

容量是我们自己的
开源权重部署在我们自建与自租的机房里,扩容是我们自己的采购决定,不需要等别人放额度。这也意味着不会因为别人的账号被封而集体断服。
限速明码标价
每把 Key 的 RPM、TPM 与并发上限写在文档里,是承诺而不是参考值。需要更高配额可以申请,我们按实际容量给答复,而不是先答应再限流。
满载返回 429,不静默排队
容量到顶时返回标准 429 并带上 Retry-After,你自己决定退避、排队还是切模型。把请求无限期挂起、或者偷偷丢给便宜模型,是我们明确不做的两件事。
流式优先,并且不粉饰延迟
全部模型支持流式输出,首 token 一出就开始回。但要说清楚:超长上下文的首 token 延迟会随输入长度线性上升,这是注意力计算的物理规律,任何宣称「百万上下文零延迟」的说法都不诚实。

怎么自己验证

以下四步不需要联系我们,你现在就能跑。

  1. 1

    文档里的限速数字是承诺。压到上限看它是否兑现——没兑现带请求 ID 找我们。

  2. 2

    用你真实的输入长度实测首 token 延迟,不要看平均值。1K 输入和 200K 输入的 TTFT 完全不是一回事。

  3. 3

    故意触发一次 429,检查返回头里是否带 Retry-After,以及重试后是否正常恢复。

  4. 4

    状态页有历史可用性记录。不要只看今天,翻一下过去几个月。

常见追问

为什么不直接说「不限速」?

因为那不可能是真的。任何服务都有容量上限,区别只在于上限是写出来的还是藏着的。藏着的那种,你会在流量最高的那天发现它。

并发上限能提吗?

能。告诉我们预计的 RPM / TPM 和业务形态,我们按实际容量评估后给答复和排期。给不了的时候我们会直说,而不是先答应再悄悄限流。

闭源模型的速率也由你们决定吗?

不完全。闭源模型走厂商官方商用授权渠道,最终容量受上游配额约束,我们能做的是把自己拿到的配额透明地分配给你,并在文档里写清楚。开源模型跑在我们自己的卡上,那部分容量完全由我们控制。

其他几条承诺

别信这一页,去验证它

注册领测试额度,把上面写的验证步骤挨个跑一遍。对不上的地方,带请求 ID 找我们。