自有算力部署
DeepSeek V4 Flash API 中转
284B 总参数、每 token 只激活 13B,把单位成本压到最低的一档。
上下文
1M
最大输出
384K
推理精度
BF16
许可
MIT
DeepSeek V4 Flash 与 V4 Pro 同日发布,284B 总参数、每 token 激活 13B,同样支持 100 万 token 上下文与思考 / 非思考双模式,MIT 许可。它的定位很清楚:在保住 V4 代际能力的前提下,把每百万 token 的成本压到最低,用来承接大批量、对延迟和价格都敏感的生产流量。
开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。
规格
- 模型 ID
- deepseek-v4-flash
- 发布方
- DeepSeek
- 供给方式
- 自有算力部署
- 许可
- MIT
- 总参数
- 284B MoE
- 激活参数
- 13B
- 上下文
- 1M
- 最大输出
- 384K
- 推理精度
- BF16
- 输入模态
- 文本
- 发布时间
- 2026-04-24
- 价格
- 见定价页
它强在哪
- 激活参数只有 13B
- 稀疏激活让它在保持大模型知识量的同时,推理时只跑很小一部分网络。同样的算力可以吞下多得多的并发,这直接反映在单价和排队时间上。
- 长上下文没有缩水
- Flash 不是把上下文砍掉换来的便宜,它同样是 100 万 token 窗口。批量处理长文档时不用为了省钱切换到窗口更小的模型。
- 适合做路由的底座
- 大多数请求其实不需要顶配推理。用 Flash 承接主流量、把判定为困难的请求升到 V4 Pro 或 Kimi K3,是我们见过性价比最好的组合之一。
典型用法
- 大批量文本分类、抽取、清洗、打标
- 高并发的对话与客服前置链路
- 日志、评论、工单的规模化摘要
- 多模型路由方案里的默认底座
三步接入
改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。
model: "deepseek-v4-flash"
curl https://api.nexaix.net/v1/chat/completions \
-H "Authorization: Bearer $NEXAIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarise this contract." }
]
}'import os
from openai import OpenAI
client = OpenAI(
# 只有这一行是新的
base_url="https://api.nexaix.net/v1",
api_key=os.environ["NEXAIX_API_KEY"],
)
# 下面全是你原来的代码
stream = client.chat.completions.create(
model="deepseek-v4-flash",
stream=True,
messages=[
{"role": "user", "content": "Summarise this contract."}
],
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.nexaix.net/v1", // 只有这一行是新的
apiKey: process.env.NEXAIX_API_KEY,
});
// 下面全是你原来的代码
const stream = await client.chat.completions.create({
model: "deepseek-v4-flash",
stream: true,
messages: [
{ role: "user", content: "Summarise this contract." }
],
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}关于这个模型
Flash 的输出质量比 Pro 差多少?
这取决于任务。简单抽取、分类、常规对话上差距很小;数学、复杂算法、跨文件推理上差距会明显拉开。别信任何一方的宣传数字,用你自己的 eval 跑一遍两个模型再决定分流阈值。
有速率限制吗?
每把 Key 有独立的限速与配额,具体数值写在文档里。满载时我们返回标准 429 并带上重试建议,不会把请求悄悄丢给别的模型。
可以和 V4 Pro 混用同一把 Key 吗?
可以。同一把 Key 可以访问你已开通的全部模型,只需在请求里改 model 字段。用量会按模型分别计费并在控制台分开列出。
