自有算力部署
MiniMax M3 API 中转
229.9B 混合专家,把前沿编码、百万上下文和原生多模态装进一个模型。
上下文
1M
最大输出
128K
推理精度
BF16
许可
Open weights
MiniMax M3 于 2026 年 6 月发布并开放权重,229.9B 参数的混合专家架构、256 个专家、每 token 激活 9.8B,上下文从 256K 扩展到 100 万 token。MiniMax 称它是首个同时具备前沿编码能力、百万上下文和原生多模态(文本、图像、视频输入)的开源权重模型。新的 MSA 稀疏注意力让它在 1M 上下文下相比上一代获得约 9.7 倍预填充与 15.6 倍解码提速。
开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。
规格
- 模型 ID
- minimax-m3
- 发布方
- MiniMax
- 供给方式
- 自有算力部署
- 许可
- Open weights
- 总参数
- 229.9B MoE
- 激活参数
- 9.8B / 256 experts
- 上下文
- 1M
- 最大输出
- 128K
- 推理精度
- BF16
- 输入模态
- 文本 · 图像 · 视频
- 发布时间
- 2026-06-01
- 价格
- 见定价页
它强在哪
- 视频也能直接读
- 文本、图像、视频输入都是基座能力。分析录屏、监控片段、产品演示视频这类任务不用先跑一套抽帧加描述的前处理管线。
- 长上下文的速度是重新设计过的
- MSA 稀疏注意力针对超长序列重做了注意力计算,官方给出的数据是 1M 上下文下预填充快约 9.7 倍、解码快约 15.6 倍。长文档场景里,这直接决定了体验能不能用。
- 开源权重里少见的均衡
- 编码、长上下文、多模态这三项通常要在不同模型之间取舍,M3 把它们放进了同一套权重。做多模态 Agent 时可以少维护一个模型。
典型用法
- 需要看图、看视频再决策的多模态智能体
- 带截图与录屏证据的自动化测试与质检
- 长视频 / 长会议的结构化摘要
- 编码 + 视觉混合的产品链路,减少模型数量
三步接入
改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。
model: "minimax-m3"
curl https://api.nexaix.net/v1/chat/completions \
-H "Authorization: Bearer $NEXAIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-m3",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarise this contract." }
]
}'import os
from openai import OpenAI
client = OpenAI(
# 只有这一行是新的
base_url="https://api.nexaix.net/v1",
api_key=os.environ["NEXAIX_API_KEY"],
)
# 下面全是你原来的代码
stream = client.chat.completions.create(
model="minimax-m3",
stream=True,
messages=[
{"role": "user", "content": "Summarise this contract."}
],
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.nexaix.net/v1", // 只有这一行是新的
apiKey: process.env.NEXAIX_API_KEY,
});
// 下面全是你原来的代码
const stream = await client.chat.completions.create({
model: "minimax-m3",
stream: true,
messages: [
{ role: "user", content: "Summarise this contract." }
],
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}关于这个模型
M3 的上下文到底是 512K 还是 1M?
官方口径是从 256K 扩展到 100 万 token,并保证最低 512K。我们在模型页标注当前线上实际开放的窗口,以那个数字为准。
视频输入怎么计费?
视频按抽帧后的图像 token 计入输入用量,帧率和分辨率会直接影响成本。接入文档里有推荐参数,建议先用一小段样本估算再上量。
和 Kimi K3 的多模态怎么选?
两者都是原生多模态。K3 参数量大得多,复杂推理更强;M3 激活参数只有 9.8B,单位成本低、长上下文吞吐快。视觉密集但推理不算极难的批量任务,M3 通常更划算。
