新闻解读

Kimi K3 发布 2026:月之暗面 3 万亿级开源旗舰全面解读

Kimi K3 这一周在国内 AI 开发者圈被反复讨论,核心原因只有一个:Moonshot AI 的旗舰模型即将成为全球首个开源的 3 万亿参数模型。官方 Kimi K3 quickstart 明确写到,完整模型权重将于 2026 年 7 月 27 日前 发布。叠加 1M token 上下文、原生视觉、工具调用、可配置的 reasoning_effort,这是 2026 年最重要的开源权重发布事件,没有之一。

本文按新闻解读角度拆解 Kimi K3 架构(KDA + Attention Residuals + 896 专家 MoE)、Kimi K3 API 定价(缓存命中 ¥2/M、未命中 ¥20/M、输出 ¥100/M)、Claude Code / Codex CLI / OpenCode / Hermes Agent 集成,以及一个重要勘误 — 之前的 Kimi K3 API 评测写 reasoning_effort 只支持 max现在已扩展为 low / high / max 三档,API 已经更新。

需要逐项 benchmark 对比,可以看 Qwen3.8 vs Kimi K3 对比文;只看 API 用法细节,看 Kimi K3 API 完整评测

2026-07-23 实查: 价格、能力、生态集成页面均来自 platform.kimi.com。开源权重发布日期与架构描述来自 Kimi K3 官方 quickstart

为什么 Kimi K3 突然成为 2026 年最火的开源故事

Moonshot 的这次发布释放了三个只有十倍预算的实验室才会同时给出的信号:

  • 规模: 2.8 万亿总参数的稀疏 MoE 架构 — 有史以来最大的开源权重模型。
  • 发布窗口: 完整权重在 2026 年 7 月 27 日前 开源,距离公告不到两周。
  • 生态就绪: 首日就同步上线 Claude Code、Codex CLI、OpenCode、Hermes Agent、OpenClaw、Kimi Code CLI 六大框架的官方集成指南。

对一家中国 AI 公司来说,这种生态覆盖密度非常罕见。Moonshot 卖的不是一份 checkpoint,而是把 Kimi K3 定位为"中文推理默认引擎"——专门给那些在简体中文场景下水土不服的西方编程 Agent 用。

如果追踪开源模型尺寸榜,Kimi 在过去 12 个月里有 9 个月占据尺寸上限。K3 把这一纪录再往上推了 40%,并附带了关于"为什么稀疏大模型在长程任务上胜过稠密模型"的架构论证。

2.8T 架构: KDA、Attention Residuals、896 专家 MoE

Kimi K3 基于 Moonshot 团队首次完整披露的两项架构创新:

  • Kimi Delta Attention (KDA) — 混合线性注意力变体,在不付出二次方注意力代价的前提下,让信息在更长序列中持续流动。
  • Attention Residuals (AttnRes) — 一条残差通道,让更深的 KDA 层堆叠在网络变深时仍然可训练。

叠加扩展后的 Mixture-of-Experts 设计 — 896 个专家、每 token 激活 16 个,由 Moonshot 自家的 Stable LatentMoE 框架稳定训练。官方称 K3 相比 K2 的训练算力效率提升约 2.5 倍。具体数字要等技术报告随权重一起发布,但定性结论是 K3 在每个 FLOP 上能换到明显更多的能力。

组件 Kimi K2 Kimi K3
总参数量 约 1T 2.8T
注意力机制 标准 + MoBA 稀疏 KDA + Attention Residuals
MoE 专家数 384 896 (每 token 激活 16 个)
上下文窗口 256K 1,048,576 (1M)
原生视觉 部分模型支持 文本 + 图像 + 视频

想了解 Moonshot 上一代 MoBA 混合块注意力 的更多技术细节,可以看官方 MoBA 技术 changelog — KDA 的前置工作就来自这篇论文。

Kimi K3 编程: 为什么它是真正的长程 Agent 模型

K3 主打两类工作: 长程编程会话和端到端知识工作。官方 quickstart 写得很明确: K3 可以在极少人工监督下持续完成长时间工程任务,理解和操作大型代码库,并协调使用终端工具。这不是聊天机器人的定位 — 这是为了与 Claude Code、Codex CLI、Gemini CLI 直接竞争。

三个具体能力让这个定位立得住:

  • 视觉反馈回路。 K3 接受截图和视频输入,所以它能驱动前端、游戏开发、CAD 等"验证器是渲染画面"的开发流程。
  • 工具调用纪律。 K3 完整支持 tool_choice(强制调用控制)、动态加载工具(通过空 content 的 system 消息声明工具子集),以及标准 tool_call / tool_result 协议。
  • 稳定的推理。 K3 始终开启思考,但 reasoning_effort 可调 — Agent 可以在便宜的探索步骤用 low,最终综合步骤再切回 max,不丢思维链保证。

如果你正把 K3 与 Claude Sonnet 4.5GPT-5 在长程编程上做对比,记得 K3 的缓存命中输入价是同档最低的(¥2/M),所以系统提示和工具目录每轮重复的 Agent 受益最明显。具体经济性后面定价章节有详细测算。

1M 上下文、原生视觉、工具调用栈

Kimi K3 的1,048,576 token 上下文窗口是发布时就亮出的数字,但围绕它的生态已经成熟。三类能力现在能协同工作,而过去需要分别打补丁:

能力 Kimi K3 详情 实际使用注意
上下文窗口 1,048,576 tokens 与发布时一致;缓存阈值现已明确文档化
自动上下文缓存 prompt > 256 tokens 时启用 重复发送长 system prompt 即可命中;无需 cache ID 或 TTL
视觉 (图像) base64 或 ms://<file-id> 公网图片 URL 不支持;content 必须是对象数组
视频输入 支持 通过 Files API 以 file-extract 用途上传;用 ms:// 引用
工具调用 标准 + tool_choice 首轮 tool_choice: "required" 强制至少调用一次
动态加载工具 通过空 content 的 system 消息注入 服务端不持久化声明;每次请求都要重发
结构化输出 json_schema + strict: true 只解析 message.content,不要解析 reasoning_content
联网搜索 暂停 / 升级中 官方文档明确不建议生产使用

特别要说一下缓存阈值: 只有 prompt 超过 256 tokens 时,新请求才能命中前缀缓存。低于 256 tokens 的请求不会被缓存(直接丢弃),所以一连串短 Agent 调用享受不到缓存红利。知识库问答、仓库级重构、多文档摘要这类长上下文工作流,自动缓存就是白嫖的省钱工具。

reasoning_effort: 这条 API 变更值得重新读一遍

本站之前的 Kimi K3 API 评测把 reasoning_effort 描述为"只支持 max"。这已经不准了。当前 quickstart 列出了三个独立档位:

  • low — 最小化推理;最便宜、最快
  • high — 均衡推理
  • max — 默认;最深的推理链

Kimi K3 始终思考,所以不能彻底关闭 — 但便宜的分类、路由、摘要步骤可以用 low,最终综合再用 max。其他几个关键采样默认值已固定: temperature=1.0top_p=0.95n=1、penalty 全为 0;官方建议不要显式传入。

流式响应携带两个 delta — reasoning_contentcontent,可以分别渲染到不同 UI 轨道上。多轮对话时必须原样回传完整 assistant message(包括 reasoning_content),否则上下文连贯性会断。

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.cn/v1",
)

# 便宜的推理用于路由步骤
cheap = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[{"role": "user", "content": "给这个工单分类: 退货 物流慢"}],
)

# 最深推理用于最终综合
final = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="max",
    messages=[
        {"role": "user", "content": f"起草一份回复: {cheap.choices[0].message.content}"},
    ],
)
print(final.choices[0].message.content)

Kimi K3 定价 + 7 月 16 日 — 8 月 12 日限时充值活动

官方 K3 定价表 列出了三档 CNY 计费项(每 1M tokens):

项目 价格(每 1M tokens) 美元等价(¥7.20)
缓存命中输入 ¥2.00 ~$0.28
缓存未命中输入 ¥20.00 ~$2.78
输出 ¥100.00 ~$13.89

美元按 ¥7.20 = $1 的快照汇率换算,会随汇率波动。以 CNY 数字为准。

最大的预算陷阱: 输出价是未命中输入的 5 倍。一个编程 Agent 每 100K 缓存前缀产生 30K tokens 代码 + 推理,账单里大约 60% 来自输出。缓存前缀、缩短工具结果回显、别把整个文件回传给模型。

Kimi K3 发布限时充值活动时间是 2026-07-16 00:00 至 2026-08-12 23:59 (UTC+8)。每个组织可以领取一张赠券,按活动期内首日最高单笔充值金额阶梯:

充值金额 (CNY) 赠送代金券 实际折扣
¥99 – ¥499 10% 9.1 折
¥500 – ¥1,999 20% 8.3 折
¥2,000 – ¥4,999 25% 8 折
≥ ¥5,000 30% 7.7 折

代金券有效期 90 天,单张上限 ¥20,000,消费时优先扣除。本活动仅限 API 开放平台,不含 Kimi 客户端和 Kimi Code。新用户 ¥15 注册代金券 不能用于 K3,首次调用 K3 前必须先完成充值(最低 ¥10)。

生态集成: Claude Code、Codex、OpenCode、Hermes Agent

K3 这次发布最不寻常的是集成覆盖面。Moonshot 在发布后几天内就为六大主流 Agent 框架提供了一手接入指南:

  • Claude Code — Anthropic 的 Claude Code CLI 直接接入 Kimi K3 作为模型后端。
  • Codex CLI — OpenAI Codex CLI 官方接入 api.moonshot.cn 的配置指南。
  • OpenCode — 中国区 Kimi 平台内置认证流程,K3 全部 reasoning 档位可用。
  • Hermes Agent — Hermes Agent 运行时内启用 K3 的文本、图像、视频理解。
  • OpenClawKimi Code CLI — 跨平台 Agent 与 IDE 风格工作流的额外参考集成。

结论: Kimi K3 不再是"一张中文模型卡"。它已经成了全球最主流编程 Agent 的可插拔后端,原生支持三档 reasoning 档位,以及和直接调用 API 时完全一致的 K3 工具调用语义。

Kimi K3 vs Claude / GPT / Qwen3: 同档对比

开源权重模型很少在 benchmark 上正面击败闭源前沿模型,所以大多数对比最终落到"按成本调整后的推理质量"。下一张表是开发者侧比较,使用官方公开定价;具体 benchmark 数字要等开源权重落地后由社区独立评测。

模型 参数 上下文 缓存命中输入 / 1M 未命中输入 / 1M 输出 / 1M
Kimi K3 2.8T (MoE) 1M ¥2.00 (~$0.28) ¥20.00 (~$2.78) ¥100.00 (~$13.89)
Claude Sonnet 4.5 闭源 1M $0.30 $3.00 $15.00
GPT-5 闭源 400K $0.125 $1.25 $10.00
Qwen3.8-Max-Preview 开源权重 256K ¥1.50 ¥8.00 ¥32.00
DeepSeek V3 约 670B (MoE) 128K ¥0.50 ¥2.00 ¥8.00

K3 的缓存命中价是同档最低,对每轮重复发送同一系统提示 + 工具目录的长程 Agent 来说尤其划算。未命中输入输出价换算成美元后大致与 Claude Sonnet 4.5 持平 — 高端模型对应高端定价。论"每美元 token 数",DeepSeek V3 仍然遥遥领先,但它的 128K 上下文和不支持视觉限制了 Agent 场景。K3 vs Qwen3.8 的对比详见 Qwen3.8 vs Kimi K3 对比文

本周开发者 5 步行动清单

如果你还在纠结要不要在 7 月 27 日开源权重落地前把工程时间投给 Kimi K3,下面这个 5 步清单能最大化信号、最小化承诺。

  1. 7 月 27 日自己验证开源权重。 收藏 官方 K3 quickstart,发布日当天去翻 changelog。Moonshot 一贯把权重放到 Hugging Face,所以同时盯 Hugging Face 主页和 changelog 订阅。
  2. 今天先用 API 跑一次冒烟测试。 理解 K3 工具调用行为最便宜的方式就是一发 curl。先把 reasoning_effort 设成 low 控制成本,再用 max 重跑同一个 prompt,看更深的推理是否真的改变了你在意的那个答案。
  3. 把 K3 接进 Claude Code 或 Codex CLI。 这两个 Agent 现在都有官方 Kimi K3 指南。增加一个 Kimi profile 大约 10 分钟,然后你就可以在真实编程工作里 A/B 对比 K3 vs Claude Sonnet / GPT-5。
  4. 审计你的 prompt 缓存命中率。 K3 最大的经济杠杆是 prompt > 256 tokens 时的自动缓存。审计你 Agent 的系统提示和工具目录的稳定性 — 哪怕重新排个序也可能让整个 session 的缓存命中全断。
  5. 规划 30% 代金券。 如果你能在 8 月 12 日之前充值 ¥5,000,赠送代金券(30%,90 天有效)等同于 K3 消费 7.7 折。把充值安排成你能一次承受的最大单笔 — 因为只有首日最高那笔算数。

关于 Kimi K3 的常见问题

以下是开发者最常问的 7 个问题,答案均已与官方 quickstart 和定价页交叉核对。

Kimi K3 真的开源吗?权重具体哪天发布?

开源。Kimi K3 quickstart 明确写到完整模型权重将在 2026 年 7 月 27 日前发布。Moonshot 把 K3 描述为首个 3 万亿参数开源模型。技术报告和架构细节将随权重一起发布。

Kimi K3 每百万 token 多少钱?

官方 K3 定价页 列出的费率是缓存命中输入 ¥2/百万 tokens、缓存未命中输入 ¥20/百万 tokens、输出 ¥100/百万 tokens。新用户 ¥15 注册代金券不能用于 K3,需先完成充值。

今天就能在 Claude Code 里用 Kimi K3 吗?

可以。Moonshot 已经发布了官方的 Claude Code + Kimi K3 配置指南,包含环境变量、base URL 配置,以及哪些 K3 专属参数(如 reasoning_effort)能干净迁移。

Kimi K3 支持图像和视频输入吗?

支持。K3 接受文本、图像、视频输入。图片必须以 base64 或 Kimi 的 ms://<file-id> 引用发送;公网图片 URL 不支持,且 content 必须是消息 part 数组,不是序列化字符串。

reasoning_effort 是什么?应该用哪个值?

reasoning_effort 是顶层请求参数,控制 Kimi K3 回答前推理多深。接受 lowhighmax,默认 max。K3 始终开启推理,不能完全关闭,但便宜的分类/路由步骤可以用 low,最终综合再用 max

Kimi K3 与 GPT-5、Claude Sonnet 4.5 在编程上对比如何?

独立 benchmark 数字要等开源权重落地才会稳定。从经济性看,K3 缓存命中输入价是三者最低(¥2 vs Claude Sonnet 4.5 的 $0.30、GPT-5 的 $0.125),未命中输入和输出价换算美元后大致与 Claude Sonnet 4.5 持平。差异化在于生态:K3 自带 Claude Code、Codex CLI、OpenCode、Hermes Agent 一手接入。

新用户 ¥15 代金券能用于 Kimi K3 吗?

不能。官方 quickstart 明确写到 ¥15 注册代金券不能用于体验 K3;必须先完成充值(最低 ¥10),K3 调用才会成功。

参考资料


免责声明

APIRank 可能从本文合作伙伴链接中获得代琈佣金,但编辑判断保持独立。