Claude Opus 5 API:接近 Fable 5 智能,半价即可拥有(2026 评测)

2026 年 7 月 24 日,Anthropic 发布了 Claude Opus 5——Opus 系列的最新成员,也是 Anthropic 迄今为止在以 Opus 4.8 价格提供接近 Fable 5 智能方面走得最远的一步。Opus 5 的定价与其前任完全相同(输入 $5/百万 Token,输出 $25/百万 Token),但在 Frontier-Bench v0.1 上的表现是 Opus 4.8 的两倍多,在 CursorBench 3.2 上以一半的任务成本达到 Fable 5 的 99.5%。

这篇指南为正在评估 Claude Opus 5 的生产环境开发者提供:价格、亮点基准测试、落后于 Mythos 5 和 Fable 5 的领域、新 API 功能(Effort 设置、对话中更换工具、自动回退)的代码示例,以及 Claude 系列和竞品模型的直接成本对比。所有价格和基准数据均来自 2026 年 7 月 24 日发布的 Anthropic 官方公告。

Claude Opus 5 定价:$5/$25 附 Fast 模式

Claude Opus 5 的定价与 Opus 4.8 完全相同,是 Opus 系列历史上最具性价比的升级:

价格层级输入(每 MTok)输出(每 MTok)相对速度
标准$5.00$25.001x(基准)
Fast 模式$10.00$50.00~2.5x
Opus 4.8(前代)$5.00$25.001x
Claude Fable 5(前沿)$15.00$75.000.8x

核心结论:Opus 5 以 Fable 5 三分之一的价格提供接近 Fable 5 的性能。Fast 模式适用于对延迟敏感的聊天、代码补全和交互式 Agent 场景。

基准测试:Opus 5 的统治力

Frontier-Bench v0.1:Opus 4.8 的两倍多

在 Frontier-Bench v0.1(Anthropic 内部编码评测)上,Opus 5 超越所有其他模型,以更低的任务成本实现 Opus 4.8 两倍以上的分数。这是 Anthropic 基准测试套件中最广泛的软件工程能力衡量标准。

CursorBench 3.2:Fable 5 的 99.5%,半价

在 CursorBench 3.2(Cursor 的 IDE Agent 基准测试)上,Opus 5 在最大 effort 设置下达到 Fable 5 峰值分数的 99.5%——成本仅约一半。在所有 effort 设置(high、xhigh、max)下,Opus 5 在给定成本下均取得优于所有其他模型的性能。

ARC-AGI 3:次优模型的 3 倍

在 ARC-AGI 3(抽象与推理语料库)上,Opus 5 的分数是次优模型的 3 倍——这表明 Opus 5 具有比任何其他公开模型都更强的推理能力。

Zapier AutomationBench:1.5 倍通过率

在 Zapier AutomationBench 上,Opus 5 的通过率约为次优模型的 1.5 倍。即使在最低 effort 设置下,Opus 5 通过的测试也比任何其他模型的任何 effort 级别都多。

使用 Opus 5 vs Fable 5 vs Opus 4.8:如何选择

对比维度Opus 5Fable 5Opus 4.8
价格(输入/输出)$5/$25$15/$75$5/$25
Frontier-Bench v0.1最佳(2x Opus 4.8)接近基准
CursorBench 3.2Fable 5 的 99.5%峰值分数较低
ARC-AGI 33x 次优模型较低远低
最适合日常生产:编码、Agent、分析网络安全、前沿研究安全分类器回退

结论:不假思索的升级

Claude Opus 5 是 Opus 系列历史上最容易做出的升级决定:同样的价格,大幅提升的性能。没有哪个生产环境开发者应该在同等价格下选择 Opus 4.8 而非 Opus 5——除非需要 Opus 4.8 作为安全分类器回退(API 现已自动支持)。

Opus 5 让 Fable 5 在日常使用中难以证明其价值——它在编码、Agent 和知识工作基准测试上以 Fable 5 三分之一的价格接近或达到其水平。只在网络安全、高级生物学研究或需要绝对前沿的任务中选择 Fable 5。

如果你今天在构建 Claude 应用,生产环境的默认模型应该是 claude-opus-5。现已在 Claude API、Claude Code 和 Claude.ai 上可用。