Cloudflare Workers AI 上线 DeepSeek V4 Flash 与 Pro:边缘推理走向 100 万上下文

2026 年 8 月 14 日,Cloudflare 在 Workers AI 上新增 DeepSeek V4 FlashDeepSeek V4 Pro——这是该平台首批支持 完整 1,048,576(100 万)token 上下文窗口 的两个模型。此举把 Cloudflare 的全球边缘网络变成了 DeepSeek 开源权重一代的分发渠道,落地时间距 DeepSeek V4 Pro 官方发布仅一天、距 V4 Flash 预览仅数周。本文梳理真正上线了什么、核实后的边缘定价、100 万上下文的 Agent 场景,以及 Worker AI 与直连 DeepSeek、经 OpenRouter 等聚合商调用的对比。

🌍 快速结论:Workers AI 的 DeepSeek V4 是让 1M 上下文的 DeepSeek 就近运行在现有 Worker 旁 的最快方式——零基础设施、自带 AI Gateway 观测与 Cloudflare 全球覆盖。代价是:Workers AI 的 V4 Pro 按 DeepSeek 高峰价计费,低频重负载仍以直连 API 更划算。

8 月 14 日上线了什么

Cloudflare 2026 年 8 月 14 日更新日志确认两个模型已上线,句柄为 @cf/deepseek-ai/deepseek-v4-pro-0813@cf/deepseek-ai/deepseek-v4-flash-0731。核心亮点是上下文窗口:1,048,576 token,它们是 Workers AI 平台首批能在单次请求中容纳大型代码库、长程多步 Agent 轨迹或全书级推理内容的模型,超过此前平台上任何其他模型的上下文上限。

两个模型都支持 思考模式(思维链推理) 用于逐步解题,以及 函数调用,让 Agent 能在多轮对话中调用工具与 API。Cloudflare 将 DeepSeek V4 Flash 描述为「更快、更低成本的孪生模型」,本次发布取代了此前的预览版,并「显著增强了 Agent 能力」。官方定位的场景是长程 Agent 工作流、大型代码库推理与多步分析——正是会让较小上下文窗口失灵的任务。

核实后的 Workers AI 边缘定价

模型输入 ($/百万)输出 ($/百万)缓存输入 ($/百万)上下文
DeepSeek V4 Pro 0813$1.32$3.96$0.0441M
DeepSeek V4 Flash 0731$0.44$1.32$0.0141M

以上为 Cloudflare Workers AI 模型页的官方费率(2026-08-16 核实)。两个模型都要求 Workers Paid 计划或预付 AI Gateway 额度,不适用于标准 Workers Free 计费档。缓存输入折扣值得单独一提:Pro 的缓存输入低至 $0.044/M、Flash 低至 $0.014/M,提示词缓存能大幅压降低成本在长上下文、多轮 Agent 循环中的大头。Workers AI 按 token 计推理费,AI Gateway 的观测功能叠加在上;具体 Gateway 转嫁费用取决于账户请求量,详见 Workers AI 定价页

100 万上下文:真正重要的 Agent 场景

这里的核心是 100 万 token 的上下文,而非价格。过去要把单体仓库分块成数百次检索调用的代码库 Agent,现在可以在一次请求里传入相关文件、甚至整个模块依赖图;研究型 Agent 可以同时保留完整语料、笔记与长分析链而不必淘汰早期上下文;需要循环调用大量函数的长程 Agent 也不再为了压到 128K/200K 上限而做激进的摘要压缩。

对已在运行 Worker 的团队,绑定是最简单的集成路径:在 Worker 里写 env.AI.run("@cf/deepseek-ai/deepseek-v4-pro-0813", { messages }),无需虚拟机、网关或额外的密钥管理。同一批模型也可通过 REST APIOpenAI 兼容端点AI Gateway 调用(后者提供跨厂商缓存、限流、重试与观测)。想要完全可移植的 OpenAI 风格接口,可参考我们的 Cloudflare AI Gateway 评测

提示词缓存才是真正的成本杠杆

有了 100 万 token 的上下文窗口,账单的 输入 一侧会很快成为大头。一个长程 Agent 如果每轮都重发 40 万 token 的仓库上下文,在没有缓存的情况下每走一步都要为这段上下文付全价。Cloudflare 的缓存输入定价正是为化解这一问题而设:DeepSeek V4 Pro 缓存输入从 $1.32 降到 每百万 $0.044(约 30 倍折扣),V4 Flash 从 $0.44 降到 每百万 $0.014(同样约 30 倍)。实际效果是:带大段稳定前缀的多轮 Agent 循环,成本接近一个小得多的请求——因为只有每一轮追加的新增量(新的工具结果与新指令)按全价输入计费。

用一个成本模型让它具体化。假设一个代码库分析 Agent 每任务跑 200 轮,稳定上下文 30 万 token,每轮追加约 2K 新 token,每轮输出约 1K token。无缓存时,一个任务约 200 × 300K = 6000 万输入 token,按 $1.32/M 计,仅 V4 Pro 的输入就约 $79。启用提示词缓存后,每轮的缓存部分(300K 中的 298K)按 $0.044/M 计费,只有 2K 增量按全价:输入成本降至每任务约 $2.90,降幅超过 25 倍。这一开关(在 Workers AI 的 OpenAI 兼容端点配合正确的缓存键默认开启)正是「100 万上下文的 Agent 从经济上不可行到真正可跑」的分水岭。DeepSeek 与 OpenRouter 也提供各自的提示缓存优惠;Workers AI 的不同在于折扣已内置在平台的固定费率卡中,而不是另开一个套餐开关。

Workers AI vs 直连 DeepSeek API vs OpenRouter

路线V4 Pro $/百万 (入/出)V4 Flash $/百万 (入/出)适合
Workers AI(本次发布)$1.32 / $3.96$0.44 / $1.32与 Worker 边缘就近、AI Gateway、免基础设施的 1M 上下文
直连 DeepSeek API(高峰)$1.32 / $3.96约 $0.14–$0.28最简单的直连计费;中国托管源站
直连 DeepSeek API(低谷)约 $0.66 / $1.98约 $0.07–$0.14可安排到低谷时段执行的批量任务——半价
OpenRouter(digitalocean / deepseek 等厂商)随厂商而异随厂商而异单钥匙多厂商路由与故障转移

最醒目的对比是:Workers AI 把 DeepSeek V4 Pro 定在恰好等于 DeepSeek 自己高峰时段的费率($1.32/$3.96),而直连 API 在低谷时段约为其一半(V4 Pro 随正式版上线的峰谷计费详见我们的 DeepSeek V4 Pro 峰谷定价文章)。因此,如果流量突发且对延迟敏感,Workers AI 的固定费率与边缘就近占优;如果能把重负载排进低谷窗口,直连 API 约 50% 的折扣极具吸引力。

V4 Flash 的情况则相反:Workers AI 的 $0.44/$1.32 高于直连 API 约 $0.14–$0.28 的缓存未命中区间,但多出来的价格换来的是 100 万上下文(直连 API 上预览版更受限)加边缘就近。想先对比再决定,可参考我们的 DeepSeek V4 Flash API 评测OpenRouter Agent Token 份额分析

对 2026 年 API 采购者的意义

DeepSeek V4 登上 Workers AI,是 2026 年推理市场分层的最新证据:前沿实验室卖高端闭源模型,开源权重运营商(DeepSeek、Qwen、Llama、Mistral)卖性价比推理,而 分发层——Cloudflare、OpenRouter、Vercel、AI Gateway——是路由、上下文窗口与故障转移决策发生的地方。从 Cloudflare 网络按 token 计费提供 1M 上下文的开源权重模型,并带提示缓存折扣与 AI Gateway 观测,等于把长上下文 Agent 推理商品化的方式,与 Workers 当年把无服务器计算商品化如出一辙。

对成本敏感的 Agent 团队,实操打法:把对延迟敏感、缓存密集的 Agent 回合放到 Workers AI DeepSeek V4(Pro 或 Flash)上,换取 1M 上下文与边缘就近;把批量与非交互式通过放到直连 DeepSeek API 的低谷时段窗口(约 5 折);并在前方保一个 OpenAI 兼容聚合商 Key 做故障转移——即我们在本站反复讲的「多厂商」架构。若想用一把 Key 前置多家厂商并简化跨区域故障转移,FreeModel 的多厂商路由是干净的起点。

一点提醒:边缘推理延迟随区域与流量变化,且 1M 上下文模型在平台上仍标记为 Beta(Cloudflare 将 V4 Pro 列为 Beta)。生产环境请把 Worker 固定到离用户近的区域,并用 AI Gateway 缓存。另外,Cloudflare 与 DeepSeek 的联手,也让大陆连接的团队多了一条不必硬磕 DeepSeek 中国托管源站的路由——相关背景见我们的 Workers AI 中国模型文章

2026 年的 100 万上下文格局

Workers AI 加入 100 万上下文俱乐部值得关注,因为真正能容纳百万 token 的提供商仍然不多,而且代价差异很大。DeepSeek 自家 API 以约 100 万上下文服务 V4 Pro 与 Flash,并开创了峰谷定价(低谷时费率减半)。Google 的 Gemini 家族多年支持 100 万以上上下文,在多模态 1M 任务上领先。xAI 的 Grok 与阿里的 Qwen 也推进到了数十万乃至 100 万 token 级别,Nebius、DigitalOcean Gradient 等开源权重托管商正在把 100 万上下文的 DeepSeek 级模型放到 OpenAI 兼容端点之后。Cloudflare 的不同在于推理 运行在哪里:在距离你的 Worker 一跳之遥的边缘节点上,内置 AI Gateway 观测与提示缓存定价,而不是需要你走公网访问的云区域虚拟机。

对已经跑在 Cloudflare 上的 Agent 平台——一个 Worker、一个 Pages 函数、一个 D1 支撑的任务队列——这种就近正是全部意义所在。你无需管理旁路推理客户端、第二个厂商账号或某个区域端点;模型只是另一个绑定,AI Gateway 提供缓存、限流与统一的分析面板。代价是你把推理与单一平台耦合,因此想要可移植性的团队会保留一条 OpenAI 兼容路线(直连 DeepSeek、OpenRouter 或另一家开源托管商)作为兜底——即聚合商们自己也在鼓励的故障转移模式。

一段代码上手

最快的路径是 OpenAI 兼容端点,从 Worker 或任意 HTTP 客户端调用。一段最小的边缘模型聊天补全如下:

fetch("https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/v1/chat/completions", {
  method: "POST",
  headers: {
    "Authorization": "Bearer {API_TOKEN}",
    "Content-Type": "application/json"
  },
  body: JSON.stringify({
    model: "@cf/deepseek-ai/deepseek-v4-pro-0813",
    messages: [{ "role": "user", "content": "总结这份 50 万 token 的代码库审计,列出最优先的重构风险。" }]
  })
}).then(r => r.json()).then(console.log);

把模型句柄换成 @cf/deepseek-ai/deepseek-v4-flash-0731 即得更便宜、更快的兄弟模型。Worker 原生用法则是 env.AI.run("...", { messages }) 并流式返回。按 Cloudflare 文档,两种方式都需要 Workers Paid 计划或预付 AI Gateway 额度。

Cloudflare Workers AI DeepSeek V4 常见问题

Cloudflare Workers AI 何时上线 DeepSeek V4 Flash 与 Pro?

Cloudflare 于 2026 年 8 月 14 日上线,模型句柄为 @cf/deepseek-ai/deepseek-v4-pro-0813 与 @cf/deepseek-ai/deepseek-v4-flash-0731。

Workers AI 上 DeepSeek V4 价格是多少?

V4 Pro 为每百万输入 $1.32、输出 $3.96、缓存输入 $0.044;V4 Flash 为输入 $0.44、输出 $1.32、缓存输入 $0.014。均需 Workers Paid 计划或预付 AI Gateway 额度。

Workers AI 的 DeepSeek V4 支持 100 万 token 上下文吗?

支持。两者是 Workers AI 平台首批支持完整 1,048,576 token 上下文的模型,均具备思维链推理与函数调用。

如何在 Workers AI 上调用 DeepSeek V4?

通过 Workers AI 绑定(env.AI.run())、REST API、OpenAI 兼容端点或 AI Gateway 四种方式,Cloudflare 均提供官方文档。

Workers AI 的 DeepSeek V4 比直连 API 便宜吗?

视情况而定。Workers AI V4 Pro 与 DeepSeek 高峰价持平($1.32/$3.96),直连 API 低谷约为其一半。选 Workers AI 是为边缘就近与 1M 上下文;选低谷直连是为便宜的批量负载。