Cloudflare Workers AI 上线 DeepSeek V4 Flash 与 Pro:边缘推理走向 100 万上下文
2026 年 8 月 14 日,Cloudflare 在 Workers AI 上新增 DeepSeek V4 Flash 与 DeepSeek V4 Pro——这是该平台首批支持 完整 1,048,576(100 万)token 上下文窗口 的两个模型。此举把 Cloudflare 的全球边缘网络变成了 DeepSeek 开源权重一代的分发渠道,落地时间距 DeepSeek V4 Pro 官方发布仅一天、距 V4 Flash 预览仅数周。本文梳理真正上线了什么、核实后的边缘定价、100 万上下文的 Agent 场景,以及 Worker AI 与直连 DeepSeek、经 OpenRouter 等聚合商调用的对比。
8 月 14 日上线了什么
Cloudflare 2026 年 8 月 14 日更新日志确认两个模型已上线,句柄为 @cf/deepseek-ai/deepseek-v4-pro-0813 与 @cf/deepseek-ai/deepseek-v4-flash-0731。核心亮点是上下文窗口:1,048,576 token,它们是 Workers AI 平台首批能在单次请求中容纳大型代码库、长程多步 Agent 轨迹或全书级推理内容的模型,超过此前平台上任何其他模型的上下文上限。
两个模型都支持 思考模式(思维链推理) 用于逐步解题,以及 函数调用,让 Agent 能在多轮对话中调用工具与 API。Cloudflare 将 DeepSeek V4 Flash 描述为「更快、更低成本的孪生模型」,本次发布取代了此前的预览版,并「显著增强了 Agent 能力」。官方定位的场景是长程 Agent 工作流、大型代码库推理与多步分析——正是会让较小上下文窗口失灵的任务。
核实后的 Workers AI 边缘定价
| 模型 | 输入 ($/百万) | 输出 ($/百万) | 缓存输入 ($/百万) | 上下文 |
|---|---|---|---|---|
| DeepSeek V4 Pro 0813 | $1.32 | $3.96 | $0.044 | 1M |
| DeepSeek V4 Flash 0731 | $0.44 | $1.32 | $0.014 | 1M |
以上为 Cloudflare Workers AI 模型页的官方费率(2026-08-16 核实)。两个模型都要求 Workers Paid 计划或预付 AI Gateway 额度,不适用于标准 Workers Free 计费档。缓存输入折扣值得单独一提:Pro 的缓存输入低至 $0.044/M、Flash 低至 $0.014/M,提示词缓存能大幅压降低成本在长上下文、多轮 Agent 循环中的大头。Workers AI 按 token 计推理费,AI Gateway 的观测功能叠加在上;具体 Gateway 转嫁费用取决于账户请求量,详见 Workers AI 定价页。
100 万上下文:真正重要的 Agent 场景
这里的核心是 100 万 token 的上下文,而非价格。过去要把单体仓库分块成数百次检索调用的代码库 Agent,现在可以在一次请求里传入相关文件、甚至整个模块依赖图;研究型 Agent 可以同时保留完整语料、笔记与长分析链而不必淘汰早期上下文;需要循环调用大量函数的长程 Agent 也不再为了压到 128K/200K 上限而做激进的摘要压缩。
对已在运行 Worker 的团队,绑定是最简单的集成路径:在 Worker 里写 env.AI.run("@cf/deepseek-ai/deepseek-v4-pro-0813", { messages }),无需虚拟机、网关或额外的密钥管理。同一批模型也可通过 REST API、OpenAI 兼容端点 与 AI Gateway 调用(后者提供跨厂商缓存、限流、重试与观测)。想要完全可移植的 OpenAI 风格接口,可参考我们的 Cloudflare AI Gateway 评测。
提示词缓存才是真正的成本杠杆
有了 100 万 token 的上下文窗口,账单的 输入 一侧会很快成为大头。一个长程 Agent 如果每轮都重发 40 万 token 的仓库上下文,在没有缓存的情况下每走一步都要为这段上下文付全价。Cloudflare 的缓存输入定价正是为化解这一问题而设:DeepSeek V4 Pro 缓存输入从 $1.32 降到 每百万 $0.044(约 30 倍折扣),V4 Flash 从 $0.44 降到 每百万 $0.014(同样约 30 倍)。实际效果是:带大段稳定前缀的多轮 Agent 循环,成本接近一个小得多的请求——因为只有每一轮追加的新增量(新的工具结果与新指令)按全价输入计费。
用一个成本模型让它具体化。假设一个代码库分析 Agent 每任务跑 200 轮,稳定上下文 30 万 token,每轮追加约 2K 新 token,每轮输出约 1K token。无缓存时,一个任务约 200 × 300K = 6000 万输入 token,按 $1.32/M 计,仅 V4 Pro 的输入就约 $79。启用提示词缓存后,每轮的缓存部分(300K 中的 298K)按 $0.044/M 计费,只有 2K 增量按全价:输入成本降至每任务约 $2.90,降幅超过 25 倍。这一开关(在 Workers AI 的 OpenAI 兼容端点配合正确的缓存键默认开启)正是「100 万上下文的 Agent 从经济上不可行到真正可跑」的分水岭。DeepSeek 与 OpenRouter 也提供各自的提示缓存优惠;Workers AI 的不同在于折扣已内置在平台的固定费率卡中,而不是另开一个套餐开关。
Workers AI vs 直连 DeepSeek API vs OpenRouter
| 路线 | V4 Pro $/百万 (入/出) | V4 Flash $/百万 (入/出) | 适合 |
|---|---|---|---|
| Workers AI(本次发布) | $1.32 / $3.96 | $0.44 / $1.32 | 与 Worker 边缘就近、AI Gateway、免基础设施的 1M 上下文 |
| 直连 DeepSeek API(高峰) | $1.32 / $3.96 | 约 $0.14–$0.28 | 最简单的直连计费;中国托管源站 |
| 直连 DeepSeek API(低谷) | 约 $0.66 / $1.98 | 约 $0.07–$0.14 | 可安排到低谷时段执行的批量任务——半价 |
| OpenRouter(digitalocean / deepseek 等厂商) | 随厂商而异 | 随厂商而异 | 单钥匙多厂商路由与故障转移 |
最醒目的对比是:Workers AI 把 DeepSeek V4 Pro 定在恰好等于 DeepSeek 自己高峰时段的费率($1.32/$3.96),而直连 API 在低谷时段约为其一半(V4 Pro 随正式版上线的峰谷计费详见我们的 DeepSeek V4 Pro 峰谷定价文章)。因此,如果流量突发且对延迟敏感,Workers AI 的固定费率与边缘就近占优;如果能把重负载排进低谷窗口,直连 API 约 50% 的折扣极具吸引力。
V4 Flash 的情况则相反:Workers AI 的 $0.44/$1.32 高于直连 API 约 $0.14–$0.28 的缓存未命中区间,但多出来的价格换来的是 100 万上下文(直连 API 上预览版更受限)加边缘就近。想先对比再决定,可参考我们的 DeepSeek V4 Flash API 评测 与 OpenRouter Agent Token 份额分析。
对 2026 年 API 采购者的意义
DeepSeek V4 登上 Workers AI,是 2026 年推理市场分层的最新证据:前沿实验室卖高端闭源模型,开源权重运营商(DeepSeek、Qwen、Llama、Mistral)卖性价比推理,而 分发层——Cloudflare、OpenRouter、Vercel、AI Gateway——是路由、上下文窗口与故障转移决策发生的地方。从 Cloudflare 网络按 token 计费提供 1M 上下文的开源权重模型,并带提示缓存折扣与 AI Gateway 观测,等于把长上下文 Agent 推理商品化的方式,与 Workers 当年把无服务器计算商品化如出一辙。
对成本敏感的 Agent 团队,实操打法:把对延迟敏感、缓存密集的 Agent 回合放到 Workers AI DeepSeek V4(Pro 或 Flash)上,换取 1M 上下文与边缘就近;把批量与非交互式通过放到直连 DeepSeek API 的低谷时段窗口(约 5 折);并在前方保一个 OpenAI 兼容聚合商 Key 做故障转移——即我们在本站反复讲的「多厂商」架构。若想用一把 Key 前置多家厂商并简化跨区域故障转移,FreeModel 的多厂商路由是干净的起点。
一点提醒:边缘推理延迟随区域与流量变化,且 1M 上下文模型在平台上仍标记为 Beta(Cloudflare 将 V4 Pro 列为 Beta)。生产环境请把 Worker 固定到离用户近的区域,并用 AI Gateway 缓存。另外,Cloudflare 与 DeepSeek 的联手,也让大陆连接的团队多了一条不必硬磕 DeepSeek 中国托管源站的路由——相关背景见我们的 Workers AI 中国模型文章。
2026 年的 100 万上下文格局
Workers AI 加入 100 万上下文俱乐部值得关注,因为真正能容纳百万 token 的提供商仍然不多,而且代价差异很大。DeepSeek 自家 API 以约 100 万上下文服务 V4 Pro 与 Flash,并开创了峰谷定价(低谷时费率减半)。Google 的 Gemini 家族多年支持 100 万以上上下文,在多模态 1M 任务上领先。xAI 的 Grok 与阿里的 Qwen 也推进到了数十万乃至 100 万 token 级别,Nebius、DigitalOcean Gradient 等开源权重托管商正在把 100 万上下文的 DeepSeek 级模型放到 OpenAI 兼容端点之后。Cloudflare 的不同在于推理 运行在哪里:在距离你的 Worker 一跳之遥的边缘节点上,内置 AI Gateway 观测与提示缓存定价,而不是需要你走公网访问的云区域虚拟机。
对已经跑在 Cloudflare 上的 Agent 平台——一个 Worker、一个 Pages 函数、一个 D1 支撑的任务队列——这种就近正是全部意义所在。你无需管理旁路推理客户端、第二个厂商账号或某个区域端点;模型只是另一个绑定,AI Gateway 提供缓存、限流与统一的分析面板。代价是你把推理与单一平台耦合,因此想要可移植性的团队会保留一条 OpenAI 兼容路线(直连 DeepSeek、OpenRouter 或另一家开源托管商)作为兜底——即聚合商们自己也在鼓励的故障转移模式。
一段代码上手
最快的路径是 OpenAI 兼容端点,从 Worker 或任意 HTTP 客户端调用。一段最小的边缘模型聊天补全如下:
fetch("https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/v1/chat/completions", {
method: "POST",
headers: {
"Authorization": "Bearer {API_TOKEN}",
"Content-Type": "application/json"
},
body: JSON.stringify({
model: "@cf/deepseek-ai/deepseek-v4-pro-0813",
messages: [{ "role": "user", "content": "总结这份 50 万 token 的代码库审计,列出最优先的重构风险。" }]
})
}).then(r => r.json()).then(console.log);
把模型句柄换成 @cf/deepseek-ai/deepseek-v4-flash-0731 即得更便宜、更快的兄弟模型。Worker 原生用法则是 env.AI.run("...", { messages }) 并流式返回。按 Cloudflare 文档,两种方式都需要 Workers Paid 计划或预付 AI Gateway 额度。
Cloudflare Workers AI DeepSeek V4 常见问题
Cloudflare Workers AI 何时上线 DeepSeek V4 Flash 与 Pro?
Cloudflare 于 2026 年 8 月 14 日上线,模型句柄为 @cf/deepseek-ai/deepseek-v4-pro-0813 与 @cf/deepseek-ai/deepseek-v4-flash-0731。
Workers AI 上 DeepSeek V4 价格是多少?
V4 Pro 为每百万输入 $1.32、输出 $3.96、缓存输入 $0.044;V4 Flash 为输入 $0.44、输出 $1.32、缓存输入 $0.014。均需 Workers Paid 计划或预付 AI Gateway 额度。
Workers AI 的 DeepSeek V4 支持 100 万 token 上下文吗?
支持。两者是 Workers AI 平台首批支持完整 1,048,576 token 上下文的模型,均具备思维链推理与函数调用。
如何在 Workers AI 上调用 DeepSeek V4?
通过 Workers AI 绑定(env.AI.run())、REST API、OpenAI 兼容端点或 AI Gateway 四种方式,Cloudflare 均提供官方文档。
Workers AI 的 DeepSeek V4 比直连 API 便宜吗?
视情况而定。Workers AI V4 Pro 与 DeepSeek 高峰价持平($1.32/$3.96),直连 API 低谷约为其一半。选 Workers AI 是为边缘就近与 1M 上下文;选低谷直连是为便宜的批量负载。