DeepInfra 的 TTFT/吞吐/E2E 框架:如何用压测识别自有算力AI API 与中转站的性能掺水

同一个模型名,为什么你的首 Token 要多等几秒?2026 年 4 月,多家服务商针对 DeepSeek V4 Pro(1.6 万亿参数 MoE,支持 1M 上下文)的实测显示,TTFT 从低于 1 秒到数秒不等,输出吞吐从 30 到 160+ tok/s 不等。这并非模型本身的问题,而是算力架构与节点搭建的差异。如果你自建 Agent 或 RAG ...