跳到主要内容

新用户注册即送测试额度,够跑完一整套 eval

自有算力部署

Kimi K3 API 中转

2.8T MoE、100 万 token 上下文,原生看得懂图和视频的旗舰模型。

  • 上下文

    1M

  • 最大输出

    1M

  • 推理精度

    BF16

  • 许可

    Open weights

Kimi K3 是 Moonshot AI 于 2026 年 7 月发布的旗舰模型,采用全新的混合专家架构,总参数约 2.8 万亿,推理时从 896 个专家中激活 16 个,上下文长度达到 100 万 token。它引入 Kimi Delta Attention 与注意力残差,在超长输入下把显存和计算压住;多模态能力写在基座里而不是外挂视觉层,因此读截图、读录屏、读仪表盘这类智能体任务表现稳定。NexAIX 把它部署在自有集群上,精度公开标注。

开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。

规格

模型 ID
kimi-k3
发布方
Moonshot AI
供给方式
自有算力部署
许可
Open weights
总参数
2.8T MoE
激活参数
16 / 896 experts
上下文
1M
最大输出
1M
推理精度
BF16
输入模态
文本 · 图像 · 视频
发布时间
2026-07-16

它强在哪

百万级上下文不掉链子
1M token 意味着整个代码仓库、上百页合同、几个月的会话记录可以一次性塞进去,不必再切片再拼接。Kimi Delta Attention 把长上下文的 KV 缓存压下来,长输入下的吞吐不会崩。
原生多模态,不是外挂
图像和视频理解是基座能力的一部分。让它看一张报错截图、一段操作录屏再决定下一步,比先 OCR 再喂文字要准得多,这正是 Agent 场景最吃的能力。
长程智能体任务
K3 面向长时间跨度的编码与智能体工作负载设计,多步骤规划、工具调用、失败重试这类链路上的稳定性明显好于上一代。

典型用法

  • 整仓库级别的代码理解、重构与迁移
  • 长合同、招股书、论文集的抽取与比对
  • 读截图 / 录屏的 GUI 智能体与自动化测试
  • 跨越数十轮、需要保留完整历史的客服与助理

三步接入

改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。

model: "kimi-k3"

curl https://api.nexaix.net/v1/chat/completions \
  -H "Authorization: Bearer $NEXAIX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "stream": true,
    "messages": [
      { "role": "user", "content": "Summarise this contract." }
    ]
  }'

关于这个模型

Kimi K3 的上下文真的能用满 100 万 token 吗?

能。我们不做上下文截断,也不在后台悄悄改小窗口。需要注意的是超长上下文的费用和首 token 延迟会随输入长度线性上升,建议先用真实长度的样本压测一遍再决定生产配置。

你们部署的 Kimi K3 和官方 App 里的是同一个模型吗?

我们部署的是官方发布的权重,精度按模型页标注执行,不做量化降配。官方 App 可能带有额外的产品层逻辑(联网、插件、系统提示词),这部分不属于模型本身,API 上不会有。

怎么调用多模态能力?

按 OpenAI 的多模态消息格式传入 image_url 或 base64 内容即可,字段与你现有代码一致。视频输入按抽帧后的图像序列传,具体上限见接入文档。

也看看这些

用你自己的题目跑一遍

注册领测试额度,把你真实的 eval 在这个模型上跑一遍,再决定要不要交生产流量。