DeepSeek V4 API 评测 2026:代理 Token 之王
DeepSeek 于 2026 年 4 月 24 日发布的 V4 模型家族,重置了公司的增长轨迹。半年内它在 OpenRouter 上的 token 份额大致翻倍,并自 5 月中旬起稳居平台第一。驱动这轮攀升的引擎是代理(agentic)工作负载。本文为正在决定是否把 V4 设为默认智能体模型的团队,梳理完整的定价、基准与路由图景。
要点速览: DeepSeek V4 在 2026 年 1 月到 6 月间将 OpenRouter token 份额从约 9% 提升到约 18%,目前是平台按用量排名第一的模型。V4 Flash 输入 $0.09/1M、输出 $0.18/1M——约为 GPT-5.5 的 1/30 至 1/55。它是 OpenRouter 首个判定为足以胜任代理工作的 DeepSeek 模型,而代理请求消耗的 token 约为人机对话的 15 倍。Token 份额翻倍但支出份额依然很低,因为 V4 太便宜。实操做法:把代理循环默认路由到 V4 Flash,仅将最难的推理步骤升级到前沿模型。
DeepSeek V4 到底改变了什么
DeepSeek 在 2026 年初持有 OpenRouter 每周 token 流量略低于 10% 的份额。随后,随着代理工作在 2 月和 3 月兴起并以前所未有的速度推高 token 用量,DeepSeek 的份额反而跌到约 5%。公司上受前沿闭源模型挤压,下被一波其他开源 LLM 蚕食。当时看起来 DeepSeek 即将成为代理时代的一个注脚。
4 月 24 日 V4 模型家族的发布立即扭转了局面。到 6 月初,DeepSeek 已拿下近 20% 的 token 份额,并自 5 月中旬起稳居 OpenRouter 榜首。1 月对比 6 月的直接数据显示了这一摆动:DeepSeek 的 token 份额实质翻倍(从 9% 到 18%),而几家领先的美国模型公司——尤其是 Google 和 OpenAI——的份额则在下滑。这不是小众变化,而是生产级 token 流向的结构性再平衡。
定价:为什么 V4 在单位 token 成本上取胜
核心数字极为鲜明。DeepSeek V4 Flash 在最便宜的端点上,价格为输入 $0.09/百万 token、输出 $0.18/百万 token。作为对比,GPT-5.5 的定价约为输入 $5 / 输出 $30 每百万 token。这是输入端 55 倍、输出端 167 倍的差距。
| 模型 | 输入 /1M | 输出 /1M | 最适合 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.09 | $0.18 | 默认代理循环、批量生成 |
| DeepSeek V4(标准) | ~$0.28 | ~$0.88 | 较难的多步推理 |
| GPT-5.5 | $5.00 | $30.00 | 前沿推理,仅升级时用 |
| Claude Sonnet 5 | $3.00 | $15.00 | 高级写作、代理质量层 |
由于代理循环会在每一回合重发相同的系统提示词和工具定义,提示词缓存比标价更重要。在反复工具调用的循环中,缓存输入可显著降低每回合的实际输入成本,进一步扩大 V4 相对那些每次重发 token 都按全价计费的模型的领先优势。
代理 Token 爆发的机制
OpenRouter 在 API 密钥层面把 token 流量分成三类——代理(Agentic)、混合(Mixed)、人类(Human)——依据一个包含工具调用率、回合数、间隔时间等信号的 7 信号加权综合评分。对任何要为智能体做预算的人来说,关键事实是:代理工作每次请求消耗的 token 约为普通人机使用的 15 倍。代理工作负载消耗的 token 在 2026 年 2 月 1 日前后首次超过人类使用的 token。
这正是 V4 崛起背后的机制。当每次请求都重 15 倍时,单位 token 价格就不再是舍入误差——它就是整个预算。一个单位 token 贵 50 倍的前沿模型,在一个本已放大 15 倍的工作负载上会贵 50 倍。V4 Flash 是首个既好到足以托付自主多步循环、又便宜到运行上千步循环仍可负担的 DeepSeek 模型。这一组合正是「足以胜任代理工作负载」的真正含义。
谁在真正使用 V4
这轮翻倍并不局限于某一类用户。爱好者用户——集中在角色扮演、通用聊天、个人智能体等消费导向类别——现在将近三分之一的 token 路由到 DeepSeek 模型。但更具分量的信号在市场顶端:原本被预期优先选用前沿闭源模型的 AI 原生公司和大型组织,6 月初向 DeepSeek 发送的 token 流量远超年初。
这就是信任信号。当一家初创公司把智能体路由到 V4,它是在优化燃烧率;当一家大型组织这么做,它是在深思熟虑地下注——赌 V4 的性价比在生产中站得住脚。如今两者都在大规模发生。
不只是 DeepSeek:中国开源模型集群
DeepSeek 是头条,但 OpenRouter 数据揭示了更广泛的格局。包括小米、腾讯和 Qwen 系列在内的一批中国开源模型作者,在截至 2026 年 6 月的半年里 token 份额都在上升,这些增长主要来自 Google 和 OpenAI 份额的下降。结构性结论:整个开源、成本优化层级正在吸收代理需求的爆发,而 DeepSeek V4 是这场运动的旗舰,而非孤立的异类。
对路由策略而言,这意味着你不再需要押注单一开源模型。分层设置——V4 Flash 作默认、Qwen 系列处理中文任务、前沿模型仅留给最难的推理——能在不引入单点质量故障的前提下保持成本纪律。
代码:通过 OpenRouter 调用 DeepSeek V4
试用 V4 最快的方式是通过 OpenRouter 的 OpenAI 兼容端点。以下是一个最简 curl 调用:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENR...EY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek/deepseek-v4-flash",
"messages": [
{"role": "user", "content": "写一个解析 RFC3339 时间戳的 Python 函数。"}
]
}' 以及用 OpenAI SDK 指向 OpenRouter 基础 URL 的相同 Python 调用:
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="YOUR_OPENROUTER_KEY",
)
resp = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[
{"role": "user", "content": "用 3 个要点总结这份 changelog。"},
],
)
print(resp.choices[0].message.content) 要在带工具调用的智能体循环中运行 V4,你保持相同的 OpenAI 兼容请求结构,并传入一个 tools 数组。由于请求契约与 OpenAI SDK 完全一致,把现有智能体从 GPT 迁移到 V4 通常只是一行模型字符串的改动加上 base-URL 替换——无需重写你的工具处理逻辑。
2026 年推荐路由模式
已经成型的生产模式是围绕 V4 作默认构建的两层(有时三层)路由器:
| 层级 | 模型 | 流量占比 | 角色 |
|---|---|---|---|
| 默认 | DeepSeek V4 Flash | 75-85% | 工具调用、抽取、常规代理步骤 |
| 高级 | Claude Sonnet 5 | 10-20% | 长文写作、细腻语气 |
| 升级 | 前沿推理模型 | 2-5% | 硬核数学、研究、失败层重试 |
使用 FreeModel 搭建多模型方案——一个把 DeepSeek、Claude、GPT、Gemini 统一在单密钥下的 OpenAI 兼容聚合器——可省去自建路由器的集成开销。FreeModel 在标价基础上加一小笔加价,但提供单一计费界面、统一用量分析,以及模型在代理突发时被限速的内置故障转移。对中国大陆以外的团队而言,它也是比路由到单一大陆端点更稳定的 DeepSeek V4 接入路径。
局限与注意事项
V4 并非万能替代品。硬核推理基准(竞赛数学、研究生级科学、ARC 式抽象)仍以明显优势偏向前沿闭源模型——这正是升级层存在的原因。视觉与图像理解也弱于顶级多模态模型。此外,OpenRouter 的 token 份额数据衡量的是通过 OpenRouter 计费的用量,只是整个市场的一个子集;直连厂商的调用不被计入,因此绝对百分比是指示性的,而非完整的行业普查。
实操解读:V4 凭成本赢下你的大部分流量,且现已可信赖用于代理循环,但你仍应在轮换中保留一个前沿模型,用于那一小部分确实需要它的请求。
常见问题:OpenRouter 上的 DeepSeek V4
问:DeepSeek V4 相比 V3 在代理场景有什么不同? 答:V4 是 OpenRouter 首个判定为足以胜任代理工作负载的 DeepSeek 模型。代理任务因高频工具调用和长回合数,每次请求消耗的 token 约为普通人机对话的 15 倍。V4 兼具前沿级工具调用可靠性,以及低到足以支撑智能体运行上千步仍可负担的成本底线。V3 在单轮生成上很强,但在大规模多步自主循环中未被信任。
问:DeepSeek V4 的 API 价格是多少? 答:DeepSeek V4 Flash 最便宜的端点为输入 $0.09/百万 token、输出 $0.18/百万 token,输入价约为 GPT-5.5($5 输入 / $30 输出每百万)的 1/55。提示词缓存可为反复重发系统提示词的代理循环进一步降低实际输入成本。
问:为什么 DeepSeek 的 token 份额翻倍,但支出份额仍然很低? 答:Token 份额衡量的是用量而非金额。由于 V4 Flash 的定价比主流闭源模型低 30-55 倍,token 用量的大幅跃升只带来营收份额的小幅上升。DeepSeek 从约 9% 升至约 18% 的 OpenRouter token 流量,但其在平台总支出中的份额依然低得多——该模型的意义正是便宜到足以在代理规模下运行。
问:DeepSeek V4 只有爱好者在用,还是真实企业也在用? 答:两者都有。爱好者用户将近三分之一的 token 路由到 DeepSeek。但原本被预期坚守前沿闭源模型的 AI 原生公司和大型组织,6 月向 DeepSeek 发送的流量也远超年初。V4 的性价比已足以让各种规模的组织放心地用它承担生产级代理工作。
问:在中国大陆以外如何接入 DeepSeek V4? 答:最简单的两条路径是 OpenRouter(一个密钥、OpenAI 兼容)或像 FreeModel 这样的中国托管聚合器(大陆路由更稳定)。你也可以直接调用 DeepSeek 平台 API,但聚合器路径在代理突发流量导致单端点限速时能提供内置故障转移。
问:除 DeepSeek 外还有哪些中国开源模型在抢份额? 答:OpenRouter 数据显示,包括小米、腾讯和 Qwen 系列在内的一批中国开源模型作者,在截至 2026 年 6 月的半年里 token 份额都在上升,主要来自 Google 和 OpenAI 份额的下降。结构性故事是整个开源、成本优化层级在吸收代理 token 需求的爆发。
结论:把 V4 设为默认,让前沿模型待命
DeepSeek V4 在数月内把 OpenRouter token 份额从 5% 拉到 18%,是迄今为止关于生产级 AI 经济走向的最清晰信号:便宜、能干、开源的模型已成为 token 饥渴的代理时代的新默认,而高端模型则是保留给那一小部分真正需要它们的请求的差异化工具。
如果你正在 2026 年构建或扩展智能体,做法很直接。把循环默认路由到 DeepSeek V4 Flash,把高级写作路由到 Claude Sonnet 5,为升级保留一个前沿推理模型。FreeModel 或 OpenRouter 都能给你一个 OpenAI 兼容密钥,让你在一个下午内接好这套方案。为默认代理流量支付前沿价格的日子已经结束。
相关评测: 查看我们对 DeepSeek、OpenRouter、Anthropic 和 FreeModel 的深度评测,获取完整定价与代码示例。