自有算力部署
Qwen3.6-35B-A3B API 中转
Apache 2.0,每 token 只激活 3B,专门为智能体编码调过。
上下文
128K
最大输出
32K
推理精度
BF16
许可
Apache-2.0
Qwen3.6-35B-A3B 是阿里 Qwen 团队 2026 年 4 月发布的混合专家模型,35B 总参数、每 token 激活约 3B,以 Apache 2.0 许可开放权重,明确面向智能体编码场景调优,并与开源终端智能体 OpenClaw 配合使用。稀疏激活让它的单位成本非常低,适合把编码类 Agent 的大量常规步骤交给它,只在关键节点升级到更大的模型。
开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。
规格
- 模型 ID
- qwen3.6-35b-a3b
- 发布方
- Alibaba Qwen
- 供给方式
- 自有算力部署
- 许可
- Apache-2.0
- 总参数
- 35B MoE
- 激活参数
- 3B
- 上下文
- 128K
- 最大输出
- 32K
- 推理精度
- BF16
- 输入模态
- 文本
- 发布时间
- 2026-04-01
- 价格
- 见定价页
它强在哪
- 激活 3B 的成本结构
- 推理时只跑约 3B 参数,单位成本远低于同代大模型。智能体链路里那些「读文件、列目录、跑一条命令」的常规步骤,用它承接最划算。
- Apache 2.0,最宽松的一档
- 商用、修改、再分发都没有额外限制,也没有用户量门槛。对需要私有化或二次微调的团队,法务成本最低。
- 为终端智能体调优
- 面向 agentic coding 明确调优,与 OpenClaw 这类开源终端智能体配合良好。工具调用格式稳定,是这类链路里最怕出错的一环。
典型用法
- 编码智能体里的高频常规步骤
- 成本敏感的批量代码审查与补丁生成
- 本地 / 私有环境的开发助手
- 多模型路由中的低成本第一跳
三步接入
改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。
model: "qwen3.6-35b-a3b"
curl https://api.nexaix.net/v1/chat/completions \
-H "Authorization: Bearer $NEXAIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-35b-a3b",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarise this contract." }
]
}'import os
from openai import OpenAI
client = OpenAI(
# 只有这一行是新的
base_url="https://api.nexaix.net/v1",
api_key=os.environ["NEXAIX_API_KEY"],
)
# 下面全是你原来的代码
stream = client.chat.completions.create(
model="qwen3.6-35b-a3b",
stream=True,
messages=[
{"role": "user", "content": "Summarise this contract."}
],
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.nexaix.net/v1", // 只有这一行是新的
apiKey: process.env.NEXAIX_API_KEY,
});
// 下面全是你原来的代码
const stream = await client.chat.completions.create({
model: "qwen3.6-35b-a3b",
stream: true,
messages: [
{ role: "user", content: "Summarise this contract." }
],
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}关于这个模型
35B 的模型够用吗?
取决于任务分层。作为独立的通用模型它显然不如 1T 级别的旗舰,但在智能体链路里,大部分步骤是简单确定的,用它承接能把总成本降一个量级。关键推理步骤再升级到 DeepSeek V4 Pro 或 Kimi K3。
上下文长度是多少?
128K。它通过 YaRN 扩展支持到这个长度。需要百万级上下文请用 GLM-5.2、DeepSeek V4 或 Kimi K3。
支持工具调用吗?
支持,按 OpenAI 的 tools / tool_calls 格式即可,与你现有代码一致。
