跳到主要内容

新用户注册即送测试额度,够跑完一整套 eval

自有算力部署

MiniMax M3 API 中转

229.9B 混合专家,把前沿编码、百万上下文和原生多模态装进一个模型。

  • 上下文

    1M

  • 最大输出

    128K

  • 推理精度

    BF16

  • 许可

    Open weights

MiniMax M3 于 2026 年 6 月发布并开放权重,229.9B 参数的混合专家架构、256 个专家、每 token 激活 9.8B,上下文从 256K 扩展到 100 万 token。MiniMax 称它是首个同时具备前沿编码能力、百万上下文和原生多模态(文本、图像、视频输入)的开源权重模型。新的 MSA 稀疏注意力让它在 1M 上下文下相比上一代获得约 9.7 倍预填充与 15.6 倍解码提速。

开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。

规格

模型 ID
minimax-m3
发布方
MiniMax
供给方式
自有算力部署
许可
Open weights
总参数
229.9B MoE
激活参数
9.8B / 256 experts
上下文
1M
最大输出
128K
推理精度
BF16
输入模态
文本 · 图像 · 视频
发布时间
2026-06-01

它强在哪

视频也能直接读
文本、图像、视频输入都是基座能力。分析录屏、监控片段、产品演示视频这类任务不用先跑一套抽帧加描述的前处理管线。
长上下文的速度是重新设计过的
MSA 稀疏注意力针对超长序列重做了注意力计算,官方给出的数据是 1M 上下文下预填充快约 9.7 倍、解码快约 15.6 倍。长文档场景里,这直接决定了体验能不能用。
开源权重里少见的均衡
编码、长上下文、多模态这三项通常要在不同模型之间取舍,M3 把它们放进了同一套权重。做多模态 Agent 时可以少维护一个模型。

典型用法

  • 需要看图、看视频再决策的多模态智能体
  • 带截图与录屏证据的自动化测试与质检
  • 长视频 / 长会议的结构化摘要
  • 编码 + 视觉混合的产品链路,减少模型数量

三步接入

改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。

model: "minimax-m3"

curl https://api.nexaix.net/v1/chat/completions \
  -H "Authorization: Bearer $NEXAIX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax-m3",
    "stream": true,
    "messages": [
      { "role": "user", "content": "Summarise this contract." }
    ]
  }'

关于这个模型

M3 的上下文到底是 512K 还是 1M?

官方口径是从 256K 扩展到 100 万 token,并保证最低 512K。我们在模型页标注当前线上实际开放的窗口,以那个数字为准。

视频输入怎么计费?

视频按抽帧后的图像 token 计入输入用量,帧率和分辨率会直接影响成本。接入文档里有推荐参数,建议先用一小段样本估算再上量。

和 Kimi K3 的多模态怎么选?

两者都是原生多模态。K3 参数量大得多,复杂推理更强;M3 激活参数只有 9.8B,单位成本低、长上下文吞吐快。视觉密集但推理不算极难的批量任务,M3 通常更划算。

也看看这些

用你自己的题目跑一遍

注册领测试额度,把你真实的 eval 在这个模型上跑一遍,再决定要不要交生产流量。