Kimi K3 发布 2026:月之暗面 3 万亿级开源旗舰全面解读
Kimi K3 这一周在国内 AI 开发者圈被反复讨论,核心原因只有一个:Moonshot AI 的旗舰模型即将成为全球首个开源的 3 万亿参数模型。官方 Kimi K3 quickstart 明确写到,完整模型权重将于 2026 年 7 月 27 日前 发布。叠加 1M token 上下文、原生视觉、工具调用、可配置的 reasoning_effort,这是 2026 年最重要的开源权重发布事件,没有之一。
本文按新闻解读角度拆解 Kimi K3 架构(KDA + Attention Residuals + 896 专家 MoE)、Kimi K3 API 定价(缓存命中 ¥2/M、未命中 ¥20/M、输出 ¥100/M)、Claude Code / Codex CLI / OpenCode / Hermes Agent 集成,以及一个重要勘误 — 之前的 Kimi K3 API 评测写 reasoning_effort 只支持 max,现在已扩展为 low / high / max 三档,API 已经更新。
需要逐项 benchmark 对比,可以看 Qwen3.8 vs Kimi K3 对比文;只看 API 用法细节,看 Kimi K3 API 完整评测。
2026-07-23 实查: 价格、能力、生态集成页面均来自 platform.kimi.com。开源权重发布日期与架构描述来自 Kimi K3 官方 quickstart。
为什么 Kimi K3 突然成为 2026 年最火的开源故事
Moonshot 的这次发布释放了三个只有十倍预算的实验室才会同时给出的信号:
- 规模: 2.8 万亿总参数的稀疏 MoE 架构 — 有史以来最大的开源权重模型。
- 发布窗口: 完整权重在 2026 年 7 月 27 日前 开源,距离公告不到两周。
- 生态就绪: 首日就同步上线 Claude Code、Codex CLI、OpenCode、Hermes Agent、OpenClaw、Kimi Code CLI 六大框架的官方集成指南。
对一家中国 AI 公司来说,这种生态覆盖密度非常罕见。Moonshot 卖的不是一份 checkpoint,而是把 Kimi K3 定位为"中文推理默认引擎"——专门给那些在简体中文场景下水土不服的西方编程 Agent 用。
如果追踪开源模型尺寸榜,Kimi 在过去 12 个月里有 9 个月占据尺寸上限。K3 把这一纪录再往上推了 40%,并附带了关于"为什么稀疏大模型在长程任务上胜过稠密模型"的架构论证。
2.8T 架构: KDA、Attention Residuals、896 专家 MoE
Kimi K3 基于 Moonshot 团队首次完整披露的两项架构创新:
- Kimi Delta Attention (KDA) — 混合线性注意力变体,在不付出二次方注意力代价的前提下,让信息在更长序列中持续流动。
- Attention Residuals (AttnRes) — 一条残差通道,让更深的 KDA 层堆叠在网络变深时仍然可训练。
叠加扩展后的 Mixture-of-Experts 设计 — 896 个专家、每 token 激活 16 个,由 Moonshot 自家的 Stable LatentMoE 框架稳定训练。官方称 K3 相比 K2 的训练算力效率提升约 2.5 倍。具体数字要等技术报告随权重一起发布,但定性结论是 K3 在每个 FLOP 上能换到明显更多的能力。
| 组件 | Kimi K2 | Kimi K3 |
|---|---|---|
| 总参数量 | 约 1T | 2.8T |
| 注意力机制 | 标准 + MoBA 稀疏 | KDA + Attention Residuals |
| MoE 专家数 | 384 | 896 (每 token 激活 16 个) |
| 上下文窗口 | 256K | 1,048,576 (1M) |
| 原生视觉 | 部分模型支持 | 文本 + 图像 + 视频 |
想了解 Moonshot 上一代 MoBA 混合块注意力 的更多技术细节,可以看官方 MoBA 技术 changelog — KDA 的前置工作就来自这篇论文。
Kimi K3 编程: 为什么它是真正的长程 Agent 模型
K3 主打两类工作: 长程编程会话和端到端知识工作。官方 quickstart 写得很明确: K3 可以在极少人工监督下持续完成长时间工程任务,理解和操作大型代码库,并协调使用终端工具。这不是聊天机器人的定位 — 这是为了与 Claude Code、Codex CLI、Gemini CLI 直接竞争。
三个具体能力让这个定位立得住:
- 视觉反馈回路。 K3 接受截图和视频输入,所以它能驱动前端、游戏开发、CAD 等"验证器是渲染画面"的开发流程。
- 工具调用纪律。 K3 完整支持
tool_choice(强制调用控制)、动态加载工具(通过空 content 的system消息声明工具子集),以及标准 tool_call / tool_result 协议。 - 稳定的推理。 K3 始终开启思考,但
reasoning_effort可调 — Agent 可以在便宜的探索步骤用low,最终综合步骤再切回max,不丢思维链保证。
如果你正把 K3 与 Claude Sonnet 4.5 或 GPT-5 在长程编程上做对比,记得 K3 的缓存命中输入价是同档最低的(¥2/M),所以系统提示和工具目录每轮重复的 Agent 受益最明显。具体经济性后面定价章节有详细测算。
1M 上下文、原生视觉、工具调用栈
Kimi K3 的1,048,576 token 上下文窗口是发布时就亮出的数字,但围绕它的生态已经成熟。三类能力现在能协同工作,而过去需要分别打补丁:
| 能力 | Kimi K3 详情 | 实际使用注意 |
|---|---|---|
| 上下文窗口 | 1,048,576 tokens | 与发布时一致;缓存阈值现已明确文档化 |
| 自动上下文缓存 | prompt > 256 tokens 时启用 | 重复发送长 system prompt 即可命中;无需 cache ID 或 TTL |
| 视觉 (图像) | base64 或 ms://<file-id> |
公网图片 URL 不支持;content 必须是对象数组 |
| 视频输入 | 支持 | 通过 Files API 以 file-extract 用途上传;用 ms:// 引用 |
| 工具调用 | 标准 + tool_choice |
首轮 tool_choice: "required" 强制至少调用一次 |
| 动态加载工具 | 通过空 content 的 system 消息注入 |
服务端不持久化声明;每次请求都要重发 |
| 结构化输出 | json_schema + strict: true |
只解析 message.content,不要解析 reasoning_content |
| 联网搜索 | 暂停 / 升级中 | 官方文档明确不建议生产使用 |
特别要说一下缓存阈值: 只有 prompt 超过 256 tokens 时,新请求才能命中前缀缓存。低于 256 tokens 的请求不会被缓存(直接丢弃),所以一连串短 Agent 调用享受不到缓存红利。知识库问答、仓库级重构、多文档摘要这类长上下文工作流,自动缓存就是白嫖的省钱工具。
reasoning_effort: 这条 API 变更值得重新读一遍
本站之前的 Kimi K3 API 评测把 reasoning_effort 描述为"只支持 max"。这已经不准了。当前 quickstart 列出了三个独立档位:
low— 最小化推理;最便宜、最快high— 均衡推理max— 默认;最深的推理链
Kimi K3 始终思考,所以不能彻底关闭 — 但便宜的分类、路由、摘要步骤可以用 low,最终综合再用 max。其他几个关键采样默认值已固定: temperature=1.0、top_p=0.95、n=1、penalty 全为 0;官方建议不要显式传入。
流式响应携带两个 delta — reasoning_content 和 content,可以分别渲染到不同 UI 轨道上。多轮对话时必须原样回传完整 assistant message(包括 reasoning_content),否则上下文连贯性会断。
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
# 便宜的推理用于路由步骤
cheap = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[{"role": "user", "content": "给这个工单分类: 退货 物流慢"}],
)
# 最深推理用于最终综合
final = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="max",
messages=[
{"role": "user", "content": f"起草一份回复: {cheap.choices[0].message.content}"},
],
)
print(final.choices[0].message.content)
Kimi K3 定价 + 7 月 16 日 — 8 月 12 日限时充值活动
官方 K3 定价表 列出了三档 CNY 计费项(每 1M tokens):
| 项目 | 价格(每 1M tokens) | 美元等价(¥7.20) |
|---|---|---|
| 缓存命中输入 | ¥2.00 | ~$0.28 |
| 缓存未命中输入 | ¥20.00 | ~$2.78 |
| 输出 | ¥100.00 | ~$13.89 |
美元按 ¥7.20 = $1 的快照汇率换算,会随汇率波动。以 CNY 数字为准。
最大的预算陷阱: 输出价是未命中输入的 5 倍。一个编程 Agent 每 100K 缓存前缀产生 30K tokens 代码 + 推理,账单里大约 60% 来自输出。缓存前缀、缩短工具结果回显、别把整个文件回传给模型。
Kimi K3 发布限时充值活动时间是 2026-07-16 00:00 至 2026-08-12 23:59 (UTC+8)。每个组织可以领取一张赠券,按活动期内首日最高单笔充值金额阶梯:
| 充值金额 (CNY) | 赠送代金券 | 实际折扣 |
|---|---|---|
| ¥99 – ¥499 | 10% | 9.1 折 |
| ¥500 – ¥1,999 | 20% | 8.3 折 |
| ¥2,000 – ¥4,999 | 25% | 8 折 |
| ≥ ¥5,000 | 30% | 7.7 折 |
代金券有效期 90 天,单张上限 ¥20,000,消费时优先扣除。本活动仅限 API 开放平台,不含 Kimi 客户端和 Kimi Code。新用户 ¥15 注册代金券 不能用于 K3,首次调用 K3 前必须先完成充值(最低 ¥10)。
生态集成: Claude Code、Codex、OpenCode、Hermes Agent
K3 这次发布最不寻常的是集成覆盖面。Moonshot 在发布后几天内就为六大主流 Agent 框架提供了一手接入指南:
- Claude Code — Anthropic 的 Claude Code CLI 直接接入 Kimi K3 作为模型后端。
- Codex CLI — OpenAI Codex CLI 官方接入
api.moonshot.cn的配置指南。 - OpenCode — 中国区 Kimi 平台内置认证流程,K3 全部 reasoning 档位可用。
- Hermes Agent — Hermes Agent 运行时内启用 K3 的文本、图像、视频理解。
- OpenClaw 与 Kimi Code CLI — 跨平台 Agent 与 IDE 风格工作流的额外参考集成。
结论: Kimi K3 不再是"一张中文模型卡"。它已经成了全球最主流编程 Agent 的可插拔后端,原生支持三档 reasoning 档位,以及和直接调用 API 时完全一致的 K3 工具调用语义。
Kimi K3 vs Claude / GPT / Qwen3: 同档对比
开源权重模型很少在 benchmark 上正面击败闭源前沿模型,所以大多数对比最终落到"按成本调整后的推理质量"。下一张表是开发者侧比较,使用官方公开定价;具体 benchmark 数字要等开源权重落地后由社区独立评测。
| 模型 | 参数 | 上下文 | 缓存命中输入 / 1M | 未命中输入 / 1M | 输出 / 1M |
|---|---|---|---|---|---|
| Kimi K3 | 2.8T (MoE) | 1M | ¥2.00 (~$0.28) | ¥20.00 (~$2.78) | ¥100.00 (~$13.89) |
| Claude Sonnet 4.5 | 闭源 | 1M | $0.30 | $3.00 | $15.00 |
| GPT-5 | 闭源 | 400K | $0.125 | $1.25 | $10.00 |
| Qwen3.8-Max-Preview | 开源权重 | 256K | ¥1.50 | ¥8.00 | ¥32.00 |
| DeepSeek V3 | 约 670B (MoE) | 128K | ¥0.50 | ¥2.00 | ¥8.00 |
K3 的缓存命中价是同档最低,对每轮重复发送同一系统提示 + 工具目录的长程 Agent 来说尤其划算。未命中输入和输出价换算成美元后大致与 Claude Sonnet 4.5 持平 — 高端模型对应高端定价。论"每美元 token 数",DeepSeek V3 仍然遥遥领先,但它的 128K 上下文和不支持视觉限制了 Agent 场景。K3 vs Qwen3.8 的对比详见 Qwen3.8 vs Kimi K3 对比文。
本周开发者 5 步行动清单
如果你还在纠结要不要在 7 月 27 日开源权重落地前把工程时间投给 Kimi K3,下面这个 5 步清单能最大化信号、最小化承诺。
- 7 月 27 日自己验证开源权重。 收藏 官方 K3 quickstart,发布日当天去翻 changelog。Moonshot 一贯把权重放到 Hugging Face,所以同时盯 Hugging Face 主页和 changelog 订阅。
- 今天先用 API 跑一次冒烟测试。 理解 K3 工具调用行为最便宜的方式就是一发 curl。先把
reasoning_effort设成low控制成本,再用max重跑同一个 prompt,看更深的推理是否真的改变了你在意的那个答案。 - 把 K3 接进 Claude Code 或 Codex CLI。 这两个 Agent 现在都有官方 Kimi K3 指南。增加一个 Kimi profile 大约 10 分钟,然后你就可以在真实编程工作里 A/B 对比 K3 vs Claude Sonnet / GPT-5。
- 审计你的 prompt 缓存命中率。 K3 最大的经济杠杆是 prompt > 256 tokens 时的自动缓存。审计你 Agent 的系统提示和工具目录的稳定性 — 哪怕重新排个序也可能让整个 session 的缓存命中全断。
- 规划 30% 代金券。 如果你能在 8 月 12 日之前充值 ¥5,000,赠送代金券(30%,90 天有效)等同于 K3 消费 7.7 折。把充值安排成你能一次承受的最大单笔 — 因为只有首日最高那笔算数。
关于 Kimi K3 的常见问题
以下是开发者最常问的 7 个问题,答案均已与官方 quickstart 和定价页交叉核对。
Kimi K3 真的开源吗?权重具体哪天发布?
开源。Kimi K3 quickstart 明确写到完整模型权重将在 2026 年 7 月 27 日前发布。Moonshot 把 K3 描述为首个 3 万亿参数开源模型。技术报告和架构细节将随权重一起发布。
Kimi K3 每百万 token 多少钱?
官方 K3 定价页 列出的费率是缓存命中输入 ¥2/百万 tokens、缓存未命中输入 ¥20/百万 tokens、输出 ¥100/百万 tokens。新用户 ¥15 注册代金券不能用于 K3,需先完成充值。
今天就能在 Claude Code 里用 Kimi K3 吗?
可以。Moonshot 已经发布了官方的 Claude Code + Kimi K3 配置指南,包含环境变量、base URL 配置,以及哪些 K3 专属参数(如 reasoning_effort)能干净迁移。
Kimi K3 支持图像和视频输入吗?
支持。K3 接受文本、图像、视频输入。图片必须以 base64 或 Kimi 的 ms://<file-id> 引用发送;公网图片 URL 不支持,且 content 必须是消息 part 数组,不是序列化字符串。
reasoning_effort 是什么?应该用哪个值?
reasoning_effort 是顶层请求参数,控制 Kimi K3 回答前推理多深。接受 low、high、max,默认 max。K3 始终开启推理,不能完全关闭,但便宜的分类/路由步骤可以用 low,最终综合再用 max。
Kimi K3 与 GPT-5、Claude Sonnet 4.5 在编程上对比如何?
独立 benchmark 数字要等开源权重落地才会稳定。从经济性看,K3 缓存命中输入价是三者最低(¥2 vs Claude Sonnet 4.5 的 $0.30、GPT-5 的 $0.125),未命中输入和输出价换算美元后大致与 Claude Sonnet 4.5 持平。差异化在于生态:K3 自带 Claude Code、Codex CLI、OpenCode、Hermes Agent 一手接入。
新用户 ¥15 代金券能用于 Kimi K3 吗?
不能。官方 quickstart 明确写到 ¥15 注册代金券不能用于体验 K3;必须先完成充值(最低 ¥10),K3 调用才会成功。
参考资料
- Moonshot AI,Kimi K3 quickstart — 2026-07-23 实查
- Moonshot AI,Kimi K3 定价 — 2026-07-23 实查
- Moonshot AI,Kimi K3 发布限时充值活动(2026-07-16 至 2026-08-12)
- Moonshot AI,Kimi API 模型列表
- Moonshot AI,Claude Code + Kimi K3 接入指南
- Moonshot AI,Codex CLI + Kimi K3 接入指南
- Moonshot AI,MoBA: 面向长文本大模型的混合块注意力机制
- APIRank,Kimi K3 API 完整评测 2026
- APIRank,Qwen3.8 vs Kimi K3: 2T+ 开源模型 API 2026
免责声明
APIRank 可能从本文合作伙伴链接中获得代琈佣金,但编辑判断保持独立。