自有算力部署
DeepSeek V4 Pro API 中转
1.6 万亿参数混合专家,思考与非思考双模式,MIT 许可。
上下文
1M
最大输出
384K
推理精度
BF16
许可
MIT
DeepSeek V4 Pro 是 DeepSeek 于 2026 年 4 月 24 日发布的开源权重旗舰,1.6T 参数的混合专家架构、每 token 激活 49B,上下文 100 万 token,单次最高输出 384K。它与同期发布的 V4 Flash 一样提供思考 / 非思考双模式,并以 MIT 许可发布。这是目前开源阵营里推理强度最高的一档,适合把最难的那部分任务交给它。
开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。
规格
- 模型 ID
- deepseek-v4-pro
- 发布方
- DeepSeek
- 供给方式
- 自有算力部署
- 许可
- MIT
- 总参数
- 1.6T MoE
- 激活参数
- 49B
- 上下文
- 1M
- 最大输出
- 384K
- 推理精度
- BF16
- 输入模态
- 文本
- 发布时间
- 2026-04-24
- 价格
- 见定价页
它强在哪
- 双模式,难题才开思考
- 同一个模型可以在非思考模式下快速回答,也可以打开思考模式做长链推理。你可以按任务难度切换,而不用为了少数难题给全部流量买单。
- 38 万 token 的输出上限
- 384K 的最大输出配合 1M 上下文,意味着「读一本书、写一本书」这种量级的任务可以一次跑完,中间不需要人工分段和状态管理。
- MIT 许可的最强开源推理
- 在 MIT 这种几乎无限制的许可下拿到这一档推理能力,是自建部署最划算的选择之一。我们把它跑在自有集群上,权重版本与精度公开。
典型用法
- 数学、算法、复杂逻辑推理等高难度任务
- 大型代码库的缺陷定位与跨文件重构
- 需要超长输出的报告、译稿、代码生成
- 把最难的一档请求从便宜模型上路由过来的兜底模型
三步接入
改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。
model: "deepseek-v4-pro"
curl https://api.nexaix.net/v1/chat/completions \
-H "Authorization: Bearer $NEXAIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarise this contract." }
]
}'import os
from openai import OpenAI
client = OpenAI(
# 只有这一行是新的
base_url="https://api.nexaix.net/v1",
api_key=os.environ["NEXAIX_API_KEY"],
)
# 下面全是你原来的代码
stream = client.chat.completions.create(
model="deepseek-v4-pro",
stream=True,
messages=[
{"role": "user", "content": "Summarise this contract."}
],
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.nexaix.net/v1", // 只有这一行是新的
apiKey: process.env.NEXAIX_API_KEY,
});
// 下面全是你原来的代码
const stream = await client.chat.completions.create({
model: "deepseek-v4-pro",
stream: true,
messages: [
{ role: "user", content: "Summarise this contract." }
],
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}关于这个模型
V4 Pro 和 V4 Flash 怎么选?
Pro 是 1.6T / 激活 49B,推理强度最高,适合难题和兜底;Flash 是 284B / 激活 13B,单位成本低得多,适合大批量生产流量。常见做法是 Flash 打底、Pro 兜底,用你自己的难度判定做路由。
思考模式会额外计费吗?
思考模式会产生思维链 token,这部分按输出计费。具体单价见定价页。建议只在确实需要长链推理的任务上打开。
DeepSeek V4 支持图片输入吗?
不支持。官方发布的 V4-Pro 与 V4-Flash 都是纯文本的混合专家语言模型,没有视觉或音频能力。需要多模态请用 Kimi K3 或 MiniMax M3。
