自有算力部署
Kimi K3 API 中转
2.8T MoE、100 万 token 上下文,原生看得懂图和视频的旗舰模型。
上下文
1M
最大输出
1M
推理精度
BF16
许可
Open weights
Kimi K3 是 Moonshot AI 于 2026 年 7 月发布的旗舰模型,采用全新的混合专家架构,总参数约 2.8 万亿,推理时从 896 个专家中激活 16 个,上下文长度达到 100 万 token。它引入 Kimi Delta Attention 与注意力残差,在超长输入下把显存和计算压住;多模态能力写在基座里而不是外挂视觉层,因此读截图、读录屏、读仪表盘这类智能体任务表现稳定。NexAIX 把它部署在自有集群上,精度公开标注。
开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。
规格
- 模型 ID
- kimi-k3
- 发布方
- Moonshot AI
- 供给方式
- 自有算力部署
- 许可
- Open weights
- 总参数
- 2.8T MoE
- 激活参数
- 16 / 896 experts
- 上下文
- 1M
- 最大输出
- 1M
- 推理精度
- BF16
- 输入模态
- 文本 · 图像 · 视频
- 发布时间
- 2026-07-16
- 价格
- 见定价页
它强在哪
- 百万级上下文不掉链子
- 1M token 意味着整个代码仓库、上百页合同、几个月的会话记录可以一次性塞进去,不必再切片再拼接。Kimi Delta Attention 把长上下文的 KV 缓存压下来,长输入下的吞吐不会崩。
- 原生多模态,不是外挂
- 图像和视频理解是基座能力的一部分。让它看一张报错截图、一段操作录屏再决定下一步,比先 OCR 再喂文字要准得多,这正是 Agent 场景最吃的能力。
- 长程智能体任务
- K3 面向长时间跨度的编码与智能体工作负载设计,多步骤规划、工具调用、失败重试这类链路上的稳定性明显好于上一代。
典型用法
- 整仓库级别的代码理解、重构与迁移
- 长合同、招股书、论文集的抽取与比对
- 读截图 / 录屏的 GUI 智能体与自动化测试
- 跨越数十轮、需要保留完整历史的客服与助理
三步接入
改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。
model: "kimi-k3"
curl https://api.nexaix.net/v1/chat/completions \
-H "Authorization: Bearer $NEXAIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarise this contract." }
]
}'import os
from openai import OpenAI
client = OpenAI(
# 只有这一行是新的
base_url="https://api.nexaix.net/v1",
api_key=os.environ["NEXAIX_API_KEY"],
)
# 下面全是你原来的代码
stream = client.chat.completions.create(
model="kimi-k3",
stream=True,
messages=[
{"role": "user", "content": "Summarise this contract."}
],
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.nexaix.net/v1", // 只有这一行是新的
apiKey: process.env.NEXAIX_API_KEY,
});
// 下面全是你原来的代码
const stream = await client.chat.completions.create({
model: "kimi-k3",
stream: true,
messages: [
{ role: "user", content: "Summarise this contract." }
],
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}关于这个模型
Kimi K3 的上下文真的能用满 100 万 token 吗?
能。我们不做上下文截断,也不在后台悄悄改小窗口。需要注意的是超长上下文的费用和首 token 延迟会随输入长度线性上升,建议先用真实长度的样本压测一遍再决定生产配置。
你们部署的 Kimi K3 和官方 App 里的是同一个模型吗?
我们部署的是官方发布的权重,精度按模型页标注执行,不做量化降配。官方 App 可能带有额外的产品层逻辑(联网、插件、系统提示词),这部分不属于模型本身,API 上不会有。
怎么调用多模态能力?
按 OpenAI 的多模态消息格式传入 image_url 或 base64 内容即可,字段与你现有代码一致。视频输入按抽帧后的图像序列传,具体上限见接入文档。
