跳到主要内容

新用户注册即送测试额度,够跑完一整套 eval

自有算力部署

DeepSeek V4 Flash API 中转

284B 总参数、每 token 只激活 13B,把单位成本压到最低的一档。

  • 上下文

    1M

  • 最大输出

    384K

  • 推理精度

    BF16

  • 许可

    MIT

DeepSeek V4 Flash 与 V4 Pro 同日发布,284B 总参数、每 token 激活 13B,同样支持 100 万 token 上下文与思考 / 非思考双模式,MIT 许可。它的定位很清楚:在保住 V4 代际能力的前提下,把每百万 token 的成本压到最低,用来承接大批量、对延迟和价格都敏感的生产流量。

开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。

规格

模型 ID
deepseek-v4-flash
发布方
DeepSeek
供给方式
自有算力部署
许可
MIT
总参数
284B MoE
激活参数
13B
上下文
1M
最大输出
384K
推理精度
BF16
输入模态
文本
发布时间
2026-04-24

它强在哪

激活参数只有 13B
稀疏激活让它在保持大模型知识量的同时,推理时只跑很小一部分网络。同样的算力可以吞下多得多的并发,这直接反映在单价和排队时间上。
长上下文没有缩水
Flash 不是把上下文砍掉换来的便宜,它同样是 100 万 token 窗口。批量处理长文档时不用为了省钱切换到窗口更小的模型。
适合做路由的底座
大多数请求其实不需要顶配推理。用 Flash 承接主流量、把判定为困难的请求升到 V4 Pro 或 Kimi K3,是我们见过性价比最好的组合之一。

典型用法

  • 大批量文本分类、抽取、清洗、打标
  • 高并发的对话与客服前置链路
  • 日志、评论、工单的规模化摘要
  • 多模型路由方案里的默认底座

三步接入

改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。

model: "deepseek-v4-flash"

curl https://api.nexaix.net/v1/chat/completions \
  -H "Authorization: Bearer $NEXAIX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "stream": true,
    "messages": [
      { "role": "user", "content": "Summarise this contract." }
    ]
  }'

关于这个模型

Flash 的输出质量比 Pro 差多少?

这取决于任务。简单抽取、分类、常规对话上差距很小;数学、复杂算法、跨文件推理上差距会明显拉开。别信任何一方的宣传数字,用你自己的 eval 跑一遍两个模型再决定分流阈值。

有速率限制吗?

每把 Key 有独立的限速与配额,具体数值写在文档里。满载时我们返回标准 429 并带上重试建议,不会把请求悄悄丢给别的模型。

可以和 V4 Pro 混用同一把 Key 吗?

可以。同一把 Key 可以访问你已开通的全部模型,只需在请求里改 model 字段。用量会按模型分别计费并在控制台分开列出。

也看看这些

用你自己的题目跑一遍

注册领测试额度,把你真实的 eval 在这个模型上跑一遍,再决定要不要交生产流量。