新闻解读

Qwen3.8 vs Kimi K3:8 天内接连发布的两款 2T+ 开源模型 API 对比

2026 年 7 月 12 日至 7 月 19 日之间,两家中国实验室先后发布了跨越 2 万亿参数门槛的开源权重语言模型:月之暗面的 Kimi K3(2.8T 总参数、1M token 上下文、原生视觉)和阿里巴巴的 Qwen3.8-Max-Preview(2.4T 总参数,被定位为对标 GPT-5.5 / Claude Opus 4.7 / Gemini 3.1 Pro 的开源权重旗舰)。本文是一篇面向 API 的对比,不是基准跑分对比:当你把每个模型接入真实的生产端点时实际拿到什么、每百万 token 的成本、支持的工具能力,以及不同场景下应该选哪一个。

两个模型今天都可以通过兼容 OpenAI 与 Anthropic chat-completion 协议的托管 API 调用,不需要 PyTorch 集群就能评测。下文的价格表、上下文窗口与工具调用功能均直接来自 2026 年 7 月 20 日各厂商官方文档:Qwen3.8-Max-Preview 见 help.aliyun.com/zh/model-studio/text-generation-model,Kimi K3 见 platform.kimi.com/docs

Qwen3.8-Max-Preview 一览

Qwen3.8-Max-Preview 是阿里云百炼(Model Studio)上的 Qwen 3.8 顶级端点。阿里官方能力定位表把它对标 GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro,定档比更通用的 qwen3.7-max 还要高一级。截至 2026 年 7 月 19 日,百炼上的模型卡片显示"仅 Token Plan 可用"——不能纯按量付费;必须订阅 Token Plan,把 Qwen3.8-Max-Preview 与每月 token 配额捆绑在一起。

官方文档列出的关键技术点:

  • 参数规模:2.4T 总参数(Mixture-of-Experts,来自 @Alibaba_Qwen 2026 年 7 月 19 日的发布贴)。
  • 上下文窗口:长上下文支持达到 1M token 量级,3.8-Max-Preview 特别针对仓库级代码任务做了优化。
  • 协议:OpenAI 兼容、Anthropic 兼容、原生 DashScope 协议——三种都通过同一个 base_url 暴露。
  • 区域:北京(cn-beijing)、新加坡、东京、法兰克福、弗吉尼亚——上线即五个区域端点。
  • 工具能力:完整的 function calling / tool_choice 支持、结构化输出(JSON Schema);图像理解需路由到 Qwen-VL 类端点。
  • 访问门槛:必须订阅 Token Plan(百炼会从模型卡片直接跳转订阅页面)。

由于模型被 Token Plan 锁住,其定价结构与 Kimi K3 的按量付费模式完全不同:你购买 token 配额,模型消耗从配额中扣除;配额用尽后要么升级套餐,要么等下一个计费周期。3.8 preview 档位定位于最强推理负载,不是廉价的批量生成——阿里自家给"编程 Agent"场景的均衡推荐是 qwen3.7-plus

Kimi K3 一览

Kimi K3 是月之暗面(Moonshot AI)的旗舰模型,通过标准的按量付费 API 在 platform.kimi.com 上提供。模型文档列出的头条特性延续了 Kimi K2.6/K2.7 在中国开发者群体中受欢迎的设计并放大:2.8T 总参数、1,048,576 token 上下文窗口、原生图像与视频理解、自动上下文缓存、JSON mode、结构化输出、tool_choice 控制。

2026 年 7 月 20 日从 Kimi 官方文档采集的价格(人民币 / 百万 token):

  • 缓存命中输入:¥2 / M tokens。
  • 缓存未命中输入:¥20 / M tokens。
  • 输出:¥100 / M tokens。
  • 自动缓存:平台自动缓存重复的前缀,按缓存命中率计费——这是长程 Agent 最大的成本杠杆。

Kimi K3 同时提供 tool_choice、动态工具加载、JSON Schema 结构化输出、reasoning effort 控制。新用户 ¥15 代金券适用于 K3(被排除在代金券可抵扣模型清单之外),所以从第一次生产测试开始就要算好预算。两个便宜一些的同门——Kimi K2.7 Code 和 Kimi K2.6——共享同样的 256K 上下文窗口和同样的自动缓存,输出成本大约是 K3 的十分之一。大多数不需要 1M 上下文的团队,最终还是会将 90% 流量路由到 K2.7 或 K2.6。

Qwen3.8-Max-Preview vs Kimi K3:核验后的价格与规格

两款旗舰模型并排对比:

维度Qwen3.8-Max-PreviewKimi K3
厂商阿里云百炼月之暗面 Moonshot
总参数2.4T2.8T
上下文窗口长上下文(1M 量级)1,048,576 tokens(1M)
原生视觉通过 Qwen-VL 端点(独立 model id)是(图像 + 视频)
Function calling / tool_choice完整完整(tool_choice、动态加载、JSON Schema)
结构化输出JSON SchemaJSON mode + JSON Schema
自动上下文缓存API 默认未暴露(需手工复用前缀)是(自动,按缓存命中率计费)
API 协议OpenAI、Anthropic、DashScopeOpenAI 兼容
区域5 个(北京、新加坡、东京、法兰克福、弗吉尼亚)中国大陆(cn)
访问模式必须订阅 Token Plan按量付费(预充值)
输入(缓存未命中)通过 Token Plan 配额计费¥20 / M tokens
输入(缓存命中)不适用(手工缓存)¥2 / M tokens
输出通过 Token Plan 配额计费¥100 / M tokens
推理控制默认开启推理(无公开 reasoning_effort 旋钮)开启推理;reasoning_effort 当前仅支持 max

务实的翻译:Kimi K3 在预算与集成上更友好(OpenAI SDK、自动缓存、一张按量付费价格表)。Qwen3.8-Max-Preview 是更国际化的选项(5 个区域、双协议 OpenAI/Anthropic 兼容),也是两款中唯一一个能让全球团队直接拿到英文官方文档的。

通过 OpenAI 兼容 API 调用 Qwen3.8-Max-Preview

百炼的模型卡片提供一键"复制 SDK 配置"片段。在北京区域开通工作区并订阅 Token Plan 后,端点是:

curl https://<WorkspaceId>.cn-beijing.maas.aliyuncs.com/compatible-mode/v1/chat/completions   -H "Authorization: Bearer ***   -H "Content-Type: application/json"   -d '{
    "model": "qwen3.8-max-preview",
    "messages": [
      {"role": "system", "content": "你是一个精准的编程助手。"},
      {"role": "user", "content": "把这个函数重构为 async/await 风格。"}
    ],
    "max_tokens": 4096,
    "temperature": 0.2
  }'

Python 客户端用法一样——把 openai SDK 指向上面的 base_url,把 qwen3.8-max-preview 作为 model id 传入。同一个工作区也提供 Anthropic 兼容 base URL,意味着 Claude Code 以及任何其他 Anthropic 协议的工具都可以把 Qwen3.8-Max-Preview 作为模型后端接入,不需要写适配层。

通过 OpenAI 兼容 API 调用 Kimi K3

Kimi 平台提供 OpenAI 兼容 base URL,当前端点:

curl https://api.moonshot.cn/v1/chat/completions   -H "Authorization: Bearer ***   -H "Content-Type: application/json"   -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "system", "content": "你是一个精准的编程助手。"},
      {"role": "user", "content": "把这个函数重构为 async/await 风格。"}
    ],
    "max_tokens": 4096,
    "temperature": 0.2
  }'

长上下文负载下,Kimi 的自动上下文缓存是核心成本杠杆:任何你复用的 prompt 前缀都会按 ¥2/M(缓存命中)计费,而不是 ¥20/M(缓存未命中)。对一个每次调用都重复 180K token 系统消息的 200K token 对话来说,缓存命中把有效输入成本降到大约十分之一。

什么时候选 Qwen3.8-Max-Preview

三种具体场景适合选 Qwen3.8-Max-Preview:

  • 你需要中国境外的区域以满足合规或延迟要求。五区域上线(新加坡、东京、法兰克福、弗吉尼亚,加上北京)意味着可以把数据驻留放在中国大陆之外——这对于面向欧美客户、不能走中国托管端点的产品尤其关键。
  • 你的技术栈原生就讲 Anthropic Messages API。Claude Code、Cursor 的 Claude 模式 Agent,以及越来越多的 Agent 框架都原生调用 Anthropic 协议。百炼的 Anthropic 兼容 base URL 让这套技术栈原样保留,再把 Qwen3.8-Max-Preview 替换进去,不用写翻译层。
  • 你想直接评测开源权重。阿里把 Qwen3.8 权重以宽松许可证发布在 Hugging Face 与 ModelScope 上,所以当托管 API 的成本结构不适合你的工作负载时,你可以自部署到自己的 GPU 集群。

代价是 3.8-Max-Preview 档位被 Token Plan 锁住。如果你的用量高度变化(突发性、波动性、不可预测),锁定一个 Plan 配额在运维上很麻烦。对于稳定、可预测、能提前估算的工作负载,Plan 定价与闭源模型档位有竞争力。

什么时候选 Kimi K3

三种场景适合选 Kimi K3:

  • 你需要在同一个 model id 里支持原生视觉。Kimi K3 直接在 chat-completions 端点接受图像和视频。Qwen3.8-Max-Preview 上要切到独立的 Qwen-VL model id 处理图像,意味着客户端要写路由逻辑。
  • 你的 Agent 是长程循环、复用缓存后的系统提示。自动上下文缓存让 Kimi K3 成为 2026 年最便宜的 1M 上下文 API,对那些重复大前缀的工作负载(代码仓库、RAG 上下文、系统指令)尤其划算。¥2/M 缓存命中率大约比未命中低一个数量级,而且没有手工缓存管理代码要写。
  • 你想用一个端点同时处理工具调用和结构化输出,无需切 model。K3 的 tool_choice、JSON mode、JSON Schema 都在同一个端点、同一个 SDK 上。

代价是地域:Kimi K3 目前是中国大陆服务。如果你需要美国/欧盟的数据驻留叙事,Kimi K3 不是合适选择。

成本测算:200K-Agent 工作负载

具体来看:一个长程 Agent,每轮处理约 200K token、复用 150K token 系统提示、产出约 5K token,每种模型的费用是多少?假设:每天 1000 轮,Kimi K3 自动缓存命中,Qwen3.8-Max-Preview 使用 Token Plan 配额。

  • Kimi K3(缓存命中):(150K × ¥2 + 50K × ¥20 + 5K × ¥100) / 1M × 1000 = ¥(0.30 + 1.00 + 0.50) × 1000 = ¥1,800/天 ≈ ¥54,000/月。
  • Kimi K3(缓存未命中):(200K × ¥20 + 5K × ¥100) / 1M × 1000 = ¥(4.00 + 0.50) × 1000 = ¥4,500/天 ≈ ¥135,000/月。
  • Qwen3.8-Max-Preview:成本与 Plan 绑定,无法与 Kimi 按 token 计费直接对比。顶级 Token Plan 每月提供上千万 token 配额,实际换算下来,对同样负载约 ¥80,000-¥150,000/月——与 Kimi K3 缓存命中量级相当,但没有自动缓存折扣。

如果你的 Agent 真正长程运行、缓存命中率高,Kimi K3 在原始成本上胜出。如果只能达到 30-40% 缓存命中(短对话、系统提示多变),差距会缩小,Qwen3.8-Max-Preview 的 Token Plan 加上国际区域会显得更划算。

为什么两款都重要:2T+ 开源权重的拐点

更大的故事是结构性的。直到 2026 年 7 月,2T 参数门槛还是一个闭源俱乐部——GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro、Grok 4。短短八天之内,两家中国实验室把开源权重的 2T+ 模型搬到了生产 API 端点上。权重可下载、代码开源、托管端点遵循任何开发者都已熟悉的 OpenAI 与 Anthropic 协议。

对买方来说,这改变了议价格局。当你可以在自己的 GPU 集群上以每小时 $1-3/H100 的成本自部署 Qwen3.8-Max 或 Kimi K3 时,托管 API 的价格变成了天花板而不是地板。对开源权重阵营来说,这次发布确认了上一代 Kimi K2 已经开启的趋势线:开源权重阵营现在与闭源旗舰只差一代,闭源定价溢价必须继续缩水才守得住。

结论

Qwen3.8-Max-Preview 和 Kimi K3 在 2026 年 7 月 21 日都已经是可用、真实、2T+ 旗舰级的 API——都可以用现成的 OpenAI 或 Anthropic SDK 接入。选择不是"哪个更强",而是"哪个更适合你的技术栈":

  • 选 Qwen3.8-Max-Preview:国际区域、Anthropic 协议工具、自部署灵活性。
  • 选 Kimi K3:原生视觉、自动缓存、中国大陆延迟、一个 OpenAI 兼容端点搞定一切。

如果 2026 年你在评估 AI Agent 基础设施,却没有把两个端点都跑一遍对比,你就在把开源权重的定价压力留在桌面上没拿起来。先在每个上面跑 100 轮基准测试,按成本与区域画像分流,把另一个端点保活当 fallback。闭源 2T+ 模型不再是唯一的选择。

参考资料


披露

APIRank 可能通过本文中的合作伙伴链接获得联盟佣金。编辑判断保持独立。