DeepSeek V4 Pro API 2026:峰谷定价与新的 Agent 旗舰
2026-08-13,DeepSeek 将 DeepSeek-V4-Pro-0813 在 App、网页端与 API 同步推送至正式版 — 而且随之而来的是一项每个重度 API 用户几小时内就会感受到的定价变化。自 2026 年 8 月 16 日 16:00 UTC(北京时间 8 月 17 日 0 时)起,DeepSeek 将整个 V4 产品线切换到 峰谷计费:在闲时运行你的 Agent,只需支付高峰时段一半的价格。
这是你在跑下一个批处理任务前就该读的文章,因为它改变了你安排 DeepSeek 负载的方式 — 也因为 V4 Pro 终于补上了此前落后于 V4 Flash 的 Agent 能力缺口。下面是你需要知道的:发布了什么、新价格表长什么样、以及如何在高峰时段之外路由你的任务。文中数据均核对自 DeepSeek 官方 定价页 与官方 更新日志。
2026-08-13 到底发布了什么
官方 deepseek-v4-pro 模型(版本 DeepSeek-V4-Pro-0813)是 DeepSeek V4 产品线的旗舰。调用方式不变 — 设置 model="deepseek-v4-pro" 即可使用最新版本。除了版本升级,对开发者而言有三项变化值得关注:
- Agent 能力大幅提升。 DeepSeek 表示正式版在生产环境中的 Agent 性能「提升尤为显著」。代表性数字:HLE(带工具)42.7/60.0(不带工具同样为 42.7)、Terminal Bench 2.1 达 87.9、NL2Repo 61.5、Cybergym 83.3、DeepSWE 62.7、Toolathlon-Verified 74.1、Agents' Last Exam 25.7、AutomationBench(Public)31.8、DSBench-FullStack 71.1、DSBench-Hard 67.2。
- 原生 Responses API + Codex。 deepseek-v4-pro 现在原生支持 OpenAI Responses API 格式,并「针对性适配 Codex」,提供一键配置脚本。这正好补上了我们在 V4 Flash 发布时指出的缺口 — 当时 Responses API 仅限 Flash。
- 三档思考强度。 V4-Pro 与 V4-Flash 现在都支持
low/high/max三档思考模式,你可以按任务复杂度选择推理预算 — 简单任务用low,日常 Agent 用high,最难的问题用max。
模型规格保持与 V4 全系列一致的高上限:1M 输入上下文、384K 最大输出,支持 JSON 输出、工具调用、Anthropic API 格式、对话前缀续写(Beta)、FIM 补全(Beta,仅非思考模式)。
重头戏:峰谷定价今天生效
DeepSeek 定价页现已有醒目提示:「DeepSeek API 价格将进行更新调整,采用峰谷定价,空闲时段价格为高峰时段价格的一半。」该变化自 2026 年 8 月 16 日 16:00 UTC(北京时间 8 月 17 日 0 时)起生效,因此下面的价格表从今天起即为实际计价。
高峰时段为每天 UTC 01:00–04:00 与 06:00–10:00,对应 北京时间 9:00–12:00 与 14:00–18:00。其余所有小时均为闲时 — 而闲时价格是高峰价格的一半。完整价格表如下:
| 每百万 token | V4-Flash 闲时 | V4-Flash 高峰 | V4-Pro 闲时 | V4-Pro 高峰 |
|---|---|---|---|---|
| 输入(缓存命中) | $0.007 | $0.014 | $0.022 | $0.044 |
| 输入(缓存未命中) | $0.22 | $0.44 | $0.66 | $1.32 |
| 输出 | $0.66 | $1.32 | $1.98 | $3.96 |
对比 今天之前 沿用的固定价:deepseek-v4-pro 为 $0.003625(缓存命中)/ $0.435(缓存未命中输入)/ $0.87(输出)每百万 token,deepseek-v4-flash 为 $0.0028 / $0.14 / $0.28。新的闲时 Pro 价格已明显高于旧固定价,而 高峰 Pro 输出飙升至 $3.96/M — 是旧 $0.87 的 4.5 倍以上。50% 折扣是真的,但它适用于重新定价后的基准,而不是上周的价格。
| 变化项 | deepseek-v4-pro | deepseek-v4-flash |
|---|---|---|
| 旧固定输出价(每百万) | $0.87 | $0.28 |
| 新闲时输出价 | $1.98(旧 2.3x) | $0.66(旧 2.4x) |
| 新高峰输出价 | $3.96(旧 4.5x) | $1.32(旧 4.7x) |
| 并发限制 | 500 | 2,500 |
闲时玩法:把 AI API 花费砍一半
新的计费模型把 何时 运行 DeepSeek 负载变成了第一等的成本杠杆。如果一个 Agent 任务对延迟不敏感,把它移出高峰时段(UTC 01:00–04:00 和 06:00–10:00),token 账单就会减半。
- 夜间重建索引与向量回填 — 排到闲时即可免费享受 50% 折扣。
- 批量评测 / 回归测试套件 — 闲时 Pro 输出 $1.98/M 而非 $3.96/M,在长评测任务上复利效应显著。
- 代码评审与 diff 分析 Agent — 排到夜间,让第二天早上以半价拿到结果。
- 缓存命中流量 依旧便宜(闲时 Pro $0.022/M)— 保持 prompt 前缀缓存以最大化命中率。
唯一的坑:DeepSeek 的高峰时段与很多团队的 美国晚间 / 欧洲工作日上午 重叠,因此跨区域的「实时」产品常常会落进高峰时段。这时,模型选择(Flash vs Pro)与缓存命中工程比调度更重要。
还有一个值得点出的战略角度:高峰定价是一种温和的 把需求塑向闲时容量 的手段。DeepSeek 实质上发布了一份分时电价 — 与云 GPU 厂商越来越常用来平滑负载的杠杆相同。对 API 消费者而言,结论是:对延迟不敏感 的负载应视为可调度的批处理,你的编排层应能自动把任务移过高峰边界,而不是默认支付 2 倍附加费。
V4 Pro 现在支持 Responses API 与 Codex
在 7 月底 V4 Flash 发布时,原生 Responses API 支持仅限 Flash — V4 Pro 落后一步。08-13 更新消除了这个缺口:deepseek-v4-pro 现在原生支持 OpenAI Responses API 格式,并针对 OpenAI Codex 做了定制(curl 一键配置脚本即可让 Codex CLI、ChatGPT 桌面端与 VS Code Codex 扩展都指向 deepseek-v4-pro)。如果你一直在跑 Codex 风格的 Agent 循环,Pro 现在是头等公民,而不是绕路方案。
思考模式:low / high / max
两个 V4 模型现在都提供三档思考强度。DeepSeek 自身的建议:简单任务用 low(更快更省),日常 Agent 工作用 high,复杂多步推理用 max。因为思考强度直接权衡成本与推理深度 — 而且现在叠加在峰谷定价之上 — 将 thinking 档位与 时段 搭配使用,能在同一个任务上拥有两个独立的成本旋钮。
# OpenAI Chat Completions — 思考模式 + 模型
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [{"role": "user", "content": "重构这段 diff 并解释权衡。"}],
"thinking": { "type": "max" }
}'
# Responses API(OpenAI 格式)— 负载几乎相同
from openai import OpenAI
client = OpenAI(api_key="your-key", base_url="https://api.deepseek.com")
resp = client.responses.create(
model="deepseek-v4-pro",
input="评审这个 pull request:" + open("pr.diff").read(),
reasoning={"effort": "high"},
)
print(resp.output_text)
成本计算实例
一次典型的大型代码库 Agent 评审可能消耗 约 900K 输入 token(750K 缓存命中 + 150K 缓存未命中)与 80K 输出 token。在新计费体系下,deepseek-v4-pro 的成本如下:
| 场景 | 输入(命中) | 输入(未命中) | 输出 | 总计 |
|---|---|---|---|---|
| 闲时 | $0.017 | $0.099 | $0.158 | $0.27 |
| 高峰 | $0.033 | $0.198 | $0.317 | $0.55 |
| 旧固定价 | $0.003 | $0.065 | $0.070 | $0.14 |
同一个任务在旧固定价下约 $0.14,现在闲时运行约 $0.27(约 2 倍),高峰约 $0.55(约 4 倍)。折扣是真的,但新的基准更高 — 因此 DeepSeek 账单较高的团队现在就该重新做预算,而不是想当然地以为「闲时 = 比以前便宜」。
V4 Pro vs V4 Flash:什么时候选哪个?
两个模型都在峰谷定价之下、都支持 Responses API 与三档思考强度,Pro 与 Flash 的选择纯粹是能力与吞吐的权衡:
- 选 V4 Pro 处理最难的 Agent 任务 — 复杂软件工程、多步推理、任何 DeepSWE 62.7 / DSBench-Hard 67.2 / HLE 42.7(带工具)冗余能派上用场的场景。你拥有 500 并发,对顺序 Agent 循环绰绰有余。
- 选 V4 Flash 做高扇出并行与延迟敏感调用 — 2,500 并发且价格仅为 Pro 的三分之一(闲时 Flash 输出 $0.66 vs Pro $1.98),是批处理与管道任务的默认选择。
- 混合模式: 用 V4 Pro 跑编排器(深度推理),把机械性子任务分给 V4 Flash(便宜、并行)。这是自 V4 Flash 发布以来团队一直在用的同一套分工。
放到 2026 Agent API 全景中看,DeepSeek V4 产品线现在与 Kimi K3(月之暗面的 1M 上下文 Agent 模型)以及我们在 V4 Flash 发布深度解读 中评测过的 GPT-5.6/Claude 定价档位处于同一赛道。DeepSeek 的优势在于峰谷/闲时杠杆:目前没有西方厂商能让你在调整时段后把账单直接减半。
常见问题
定价变化是追溯性的还是前瞻性的?
前瞻性。自 2026 年 8 月 16 日 16:00 UTC 起生效。在此之前的使用仍按旧固定价计费;之后的一切按新的峰谷价格表计价。
哪些时段算闲时?
UTC 01:00–04:00 与 06:00–10:00 之外的所有小时均为闲时。按北京时间,高峰时段是 9:00–12:00 与 14:00–18:00。
缓存命中价格也享受 50% 折扣吗?
是的 — 缓存命中输入为 Flash $0.007/$0.014、Pro $0.022/$0.044(闲时/高峰)。缓存命中一直便宜,在新计费体系下仍是最便宜的一档。
还能调用 deepseek-chat 和 deepseek-reasoner 吗?
目前可以,但 DeepSeek 已表示旧名称将在 V4 发布三个月后退役。新代码请直接指向 deepseek-v4-pro 或 deepseek-v4-flash,避免日后破坏性切换。
deepseek-v4-pro 也支持 Anthropic API 格式吗?
支持。除 OpenAI Chat Completions 与 Responses 格式外,DeepSeek 还在 Anthropic 格式端点(https://api.deepseek.com/anthropic)暴露 Pro,因此使用 Claude SDK 与 Anthropic 协议的 Agent 框架可最小改动地指向 deepseek-v4-pro。
为什么 Flash 的并发上限比 Pro 高?
DeepSeek 将 deepseek-v4-pro 限制为 500 个并发在途请求,而 deepseek-v4-flash 为 2,500 个。更高的 Pro 上限预留给最苛刻的 Agent 循环;Flash 更大的并发预算与更低的价格使它成为扇出密集型管道工作的默认选择。
结论:现在就重新预算,围绕高峰时段排期
DeepSeek V4 Pro 正式版是真正的 Agent 能力跃升 — HLE 42.7(带工具)、Terminal Bench 87.9、原生 Responses API 与 Codex 支持、1M 上下文旗舰上的三档思考强度。但 今天 真正改变你账单的是峰谷重构:闲时输出是旧固定价的 2.3 倍,高峰是 4.5 倍。这不是「即将到来」的脚注 — 它在 2026 年 8 月 16 日 16:00 UTC 落地。
本周就行动:(1) 重新预算任何按旧固定价预测的 DeepSeek 花费;(2) 把批处理与夜间 Agent 负载移入闲时窗口,锁定 50% 折扣;(3) 对延迟敏感的高峰流量,保持 Flash 与 Pro 的清晰分工(Flash 价格只有 Pro 三分之一、并发 5 倍,是合理的默认选择)。
如果你不想在管理 DeepSeek 直连计费之外,再同时打理 OpenAI、Anthropic 与 Google 流量,FreeModel 通过单个 API Key 暴露 deepseek-v4-pro(以及 V4 Flash、Kimi K3、Claude、GPT-5.6 等模型),并提供用量看板展示每次任务的成本 — 让你一眼看清峰谷变化对每个负载的影响。