OpenRouter Luna 半价:GPT-5.6 三档选购指南 2026
2026-08-03,OpenRouter 对 GPT-5.6 Luna(permaslug openai/gpt-5.6-luna-20260709)打了 50% 限时折扣:prompt 从 $0.20/M 降到 $0.10/M,completion 从 $1.20/M 降到 $0.60/M。同窗口 Terra / Terra-Pro 也重新定价到 $1.00/M prompt + $6.00/M completion——比 OpenAI 官方价便宜 60%。Sol / Sol-Pro 维持 $5/$30 列表价,无折扣。本指南是速查表:什么时候该走 OpenRouter 渠道、什么时候留 OpenAI 直连、促销结束怎么接住。
2026-08 价格矩阵
下面所有数字都是 2026-08-03 实时对照 https://openrouter.ai/api/v1/models 和每个模型的 https://openrouter.ai/openai/gpt-5.6-{tier} 页面拿到的。OpenRouter 一列反映当前促销(如有),OpenAI Direct 一列是上游列表价。
| 档位 | OpenRouter(即时) | OpenAI 直连(列表) | 相比 OpenAI | 推理支持 |
|---|---|---|---|---|
| Luna | $0.10/M in · $0.60/M out | $1.00/M in · $6.00/M out | 9 折(10 倍) | 支持(Luna 基础) |
| Luna-Pro | $0.10/M in · $0.60/M out | $1.00/M in · $6.00/M out | 9 折(10 倍) | 支持(更长上下文) |
| Terra | $1.00/M in · $6.00/M out | $2.50/M in · $15.00/M out | 6 折 | 支持 |
| Terra-Pro | $1.00/M in · $6.00/M out | $2.50/M in · $15.00/M out | 6 折 | 支持 |
| Sol | $5.00/M in · $30.00/M out | $5.00/M in · $30.00/M out | 0%(无促销) | 支持(max effort) |
| Sol-Pro | $5.00/M in · $30.00/M out | $5.00/M in · $30.00/M out | 0%(无促销) | 支持(max + ultra subagent) |
头条数字是 Luna。从 $1.00/M 跌到 $0.10/M,把它推进了 budget tier 的同价位区(Gemini 2.5 Flash $0.075/$0.30、DeepSeek V4 Flash $0.14/$0.28),同时保留 GPT-5.6 这一代的推理控制和 OpenAI Responses API 接口。对已经站在 OpenAI 生态里的团队,把预算吃紧的工作流推到一个更便宜的 tier 不用改 prompt 也不用改合约——这是那种一周就能回本的迁移。
谁该切换、谁不该切换
如果你属于这几种场景,迁到 OpenRouter Luna
- 大批量分类 / 抽取 / 路由 — $0.10/M prompt + $0.60/M completion 下,典型 2K 输入 / 200 输出工作流的每千次请求成本降到 $0.001-$0.005。把贵模型的流量路由到 Luna,在任何 gateway 里都是一行配置改动。
- 长系统 prompt 的 RAG agent — Luna 在 OpenRouter 上支持推理和 prompt caching(5-10 分钟 TTL)。30K token 系统 prompt 每小时 100 次调用,缓存命中后实际 prompt 成本压到每百万读 $0.01。
- 工具循环的长尾 fallback — Sol 或 Opus 4.8 调用失败或撞限流时,回落到 OpenRouter Luna,agent 保持响应,单次成本是 Sol 的 1/30。
- 评测流水线 — 每天 10K 次评测跑在旗舰模型上,预算烧得最快。开发期路由到 Luna、最终回归扫一遍才上 Sol,是这次促销后便宜得多的常见模式。
这些场景留在 OpenAI 直连
- Zero-retention / HIPAA / SOC-2 路径 — OpenAI 的企业数据处理(zero retention、训练退出、EU 数据驻留)只有 OpenAI 直连才有,OpenRouter 不能透传这些合约。
- 长 TTL prompt caching(24 小时+) — 直连 OpenAI 给企业客户扩展了缓存 TTL;OpenRouter 只认 5-10 分钟标准窗口。
- Sol / Sol-Pro 前沿工作 — Sol 没有 OpenRouter 折扣,而且 OpenRouter 通常多几毫秒延迟(一般是单位数 ms 但对延迟敏感路径确实存在)。旗舰 tier 走 OpenAI 直连。
- 需要 Microsoft Azure OpenAI Service 合约的工作流 — OpenRouter 只代理公共 OpenAI 端点,不代理 Azure OpenAI 端点。
速查决策表
| 你的工作流 | 对的 tier(2026-08) | 对的渠道 |
|---|---|---|
| RAG agent,长 prompt,每天 <500 次 | Luna-Pro | OpenRouter(带缓存) |
| RAG agent,短 prompt,高并发 | Luna | OpenRouter |
| 分类 / 抽取 / 路由 | Luna | OpenRouter |
| 中等难度代码 agent | Terra | OpenRouter |
| 前沿推理 / 硬核 agent | Sol-Pro | OpenAI 直连 |
| 评测扫描,每天 10K+ 调用 | Luna 或 DeepSeek V4 Flash | OpenRouter |
| 企业 zero-retention | Sol 或 Terra | OpenAI 直连 |
| 预算封顶、能中途切模型 | 现在用 Luna → 促销结束切 DeepSeek V4 Flash | OpenRouter + FreeModel 当路由 |
怎么接上 failover(不让促销结束打挂)
OpenRouter 的折扣是促销——某个时间点会回到上游列表价。正确架构是把 Luna 当成分层路由里的一档,而不是硬依赖。三种实现,按工作量排序:
方案 1 — Portkey(5 分钟)
Portkey 的 AI Gateway 把 OpenRouter 当虚拟 provider。你写一条配置,今天把 gpt-5.6-luna 映射到 OpenRouter 上的 openai/gpt-5.6-luna,明天映射到 OpenAI 直连(或者 DeepSeek V4 Flash)。客户端代码不变,价格规则不变,促销结束零代码切换。
{
"strategy": { "mode": "fallback" },
"targets": [
{
"provider": "openrouter",
"model": "openai/gpt-5.6-luna",
"weight": 1.0
},
{
"provider": "openai",
"model": "gpt-5.6-luna",
"weight": 0.5,
"conditions": [{ "type": "price_above", "value": 0.20 }]
}
]
}
Portkey 在每次请求前评估条件——只要 OpenRouter Luna 价格回涨到 $0.20/M prompt 以上,流量就自动回落 OpenAI 直连(或者你列的下一个 fallback)。这是最省力的路径。
方案 2 — Cloudflare AI Gateway(10 分钟)
Cloudflare AI Gateway 接 OpenRouter 和 OpenAI 作为 provider,请求 payload 里写 fallback。同样的模式,托管在 Workers 上零出口费。适合你的 agent 已经跑在 Cloudflare 上的场景。
方案 3 — LiteLLM + 预算守卫(15 分钟)
如果你已经在用 LiteLLM 当代理,给每个模型加一个预算守卫,当 Luna 的有效价格超过你设的阈值就抛 429。agent 自动重试路由表里下一个最便宜的 tier。代码多一些,但最显式。
Luna 在 2026 budget tier 里排第几
2026 年的 budget tier 价格战已经白热化。Luna $0.10/M 的 prompt 价定下后,它在同级能力档(单步推理、128K-200K 上下文)的位置:
| 模型 | Prompt $/M | Completion $/M | 推理 | OpenAI 兼容 |
|---|---|---|---|---|
| GPT-5.6 Luna(OpenRouter) | $0.10 | $0.60 | 支持 | 支持 |
| GPT-5.6 Luna(直连) | $1.00 | $6.00 | 支持 | 支持 |
| Gemini 2.5 Flash | $0.075 | $0.30 | 有限 | 支持(仅 REST) |
| DeepSeek V4 Flash | $0.14 | $0.28 | 不支持(instruct) | 支持 |
| Claude Haiku 4.5 | $1.00 | $5.00 | 支持 | 支持(Anthropic API) |
| Mistral Nemo 13B | $0.04 | $0.08 | 不支持 | 支持 |
纯分类或短抽取,Gemini 2.5 Flash 和 DeepSeek V4 Flash 还是比 Luna 便宜。Luna 折扣最有价值的场景是需要 GPT 级指令遵循、OpenAI Responses API 接口、或者代码已经对接 GPT-5.5 的 drop-in 替换。对于这种工作流,2026-08-03 这一刻它是最便宜的可靠路径。
值得知道的坑
- 折扣只在 OpenRouter。同样的 Luna tier 在 OpenAI 直连就是 $1/$6。如果你为了 Luna 把工作流迁到 OpenRouter,等于接受了 OpenRouter 的合约条款、限流策略和路由选择。OpenRouter 自 2023 年起是可靠的代理,但 SLA 显著弱于 OpenAI 直连的企业 tier。
- 折扣窗口。OpenRouter 不公布这些促销的明确结束日期。2025-2026 的规律是:模型发布带 4-8 周促销,然后要么延长要么恢复。正确做法是现在就接 failover,不是促销到期那天才接。
- 推理控制可用但细节有差。Luna 和 Luna-Pro 在 OpenRouter 上都显示
supports_reasoning: true,但推理 effort 枚举和推理 token 计费与 OpenAI 直连略有不同。如果你依赖精确的推理 token 预算,对照你的具体推理 effort 设置验证一下。 - 跨区域路由。OpenRouter 按请求时把 Luna 路由到当时最便宜的 OpenAI 区域。如果你要 EU 数据驻留,这是问题——需要 EU 数据走 OpenAI 直连的 EU 端点,OpenRouter 只留给 Luna / Terra 折扣最有价值的工作流。
结论
2026-08 这次 OpenRouter Luna 折扣不是价格噱头——它把 GPT-5.6 Luna 推进 budget tier 的同时保留了 GPT-5.6 这一代的推理控制和 OpenAI API 接口。对于已经站在 OpenAI 生态里、想把预算吃紧的工作流推到一个更便宜的 tier、又不想改 prompt 也不改合约的团队,这是今天该做的迁移。接下来 24 小时的三件具体动作:
- 搭一条 Portkey 或 Cloudflare AI Gateway 路由,把你的"便宜 tier"映射到 OpenRouter 上的
openai/gpt-5.6-luna。 - 在非关键工作流上跑 24 小时 A/B:50% OpenRouter Luna 对 50% 你当前的便宜 tier,对比质量、延迟、成本。
- 如果 Luna 在不丢有意义质量的前提下胜出,把它设为默认,把当前 tier 留作 failover——为促销结束那天做准备。
在路由 GPT-5.6 Luna 同时也用 Claude / Gemini / DeepSeek,只想一个 key? 如果你想一个面板看跨 provider 和跨 tier 的 search / generation 成本拆分,FreeModel 把 OpenRouter、OpenAI 直连、Anthropic、Gemini 收在一个 API key 下,用量拆分能在 Luna 促销结束那一刻告诉你——当 tier 涨价或限流把你的单次预算推到警戒线上时,你得在一小时内决定回落 DeepSeek V4 Flash 还是继续 OpenAI 直连。