Fireworks AI (Fireworks AI)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Serverless (Standard, $/1M tokens): DeepSeek V4 Pro $1.74、V4 Flash $0.22、Kimi K3 $3.00、K2.7 Code $0.95、MiniMax M3 $0.30、Qwen 3.7 Plus $0.40、GPT OSS 120B $0.15、GLM 5.1 $1.40。嵌入按模型档 $0.008-$0.016/1M。按需 GPU 按小时:H100 $7.00、H200 $7.00、B200 $10.00、B300 $12.00、GB300 $18.00(9 月 1 日上调)。 | 每百万 tokens |
| 输出 (Output) | Serverless 输出($/1M):DeepSeek V4 Pro $3.48、V4 Flash $0.66、Kimi K3 $15.00、MiniMax M3 $1.20、Qwen 3.7 Plus $1.60、GPT OSS 120B $0.60、GLM 5.1 $4.40。缓存输入显著更低(如 DeepSeek V4 Pro $0.145)。训练:SFT 每 1M 训练 token $0.50(≤16B)到 $10.00(>300B);Serverless Training API 仅按 token 计费、无闲置 GPU 成本。 | 每百万 tokens |
| 缓存读取 | 提示缓存输入 token 计费远低于全新输入——DeepSeek V4 Pro 缓存 $0.145 vs 全新 $1.74(约 -92%);适配价格见各模型档。 | 享折扣 |
注册即享 $1 免费 serverless 额度(pay-per-token,postpaid billing);无永久免费档。按需 GPU 与训练按用量计费。
🤖 支持模型(共 9 个)
✨ 优势
- ✓ OpenAI 兼容 API——推理与微调都是即插即用替代品(相同 API、相同 SFT 数据格式),迁移几乎零改码
- ✓ FireAttention 专有推理引擎 + 量化 + 投机解码,开源模型 TTFT 亚秒——最快的开源模型托管平台之一
- ✓ 托管 DeepSeek V4 Pro/Flash、Kimi K3、Qwen 3.x、MiniMax M3、GLM 5.x、GPT-OSS、NVIDIA Nemotron 等 100+ 开源模型
- ✓ 提示缓存大额折扣:DeepSeek V4 Pro 缓存输入 $0.145 vs 全新 $1.74(约 -92%)
- ✓ 三档 serverless 服务路径(Standard/Priority/Fast)在价格与延迟间按需取舍
- ✓ 微调/训练覆盖最高 1T+ 参数模型;Serverless Training API 仅按 token 计费、无闲置 GPU 成本
- ✓ $1 免费额度、自适应速率限制、全球多区域部署(GLOBAL/US/EUROPE/APAC)
⚠️ 不足
- × 无中国大陆直连——大陆生产需代理/中转,跨太平洋延迟 150-250ms
- × 按需 GPU 2026-09-01 起全面涨价(H100 $7→$8、B200 $10→$13、GB300 $18→$20/小时)
- × 无独立研发的前沿闭源模型——只托管开源权重(DeepSeek/Kimi/Qwen 等),不提供自研旗舰模型
- × 按需 GPU 以预置/部署为主,突发小负载不如 serverless 按 token 灵活;区域限定部署需 1.5 倍加价
🎯 适合场景
开发者与团队若需要「最快的开源模型推理 + OpenAI 兼容 API」且不想自建 vLLM——尤其适合调用 DeepSeek V4、Kimi、Qwen、GPT-OSS 等开源模型的低成本生产场景。
💰 价格与方案
| 服务 / 模型 | 输入 ($/百万) | 缓存 ($/百万) | 输出 ($/百万) | 备注 |
|---|---|---|---|---|
| DeepSeek V4 Pro(Serverless,Standard) | $1.74 | $0.145 | $3.48 | V4 Pro 0813;Priority $2.61 / $0.218 / $5.22 |
| DeepSeek V4 Flash(Serverless,Standard) | $0.22 | $0.007 | $0.66 | V4 Flash 0731;关联 2026 年 8 月 V4 模型家族 |
| Kimi K3(Serverless) | $3.00 | $0.30 | $15.00 | K3;K2.7 Code $0.95 / $0.19 / $4.00 |
| MiniMax M3(Serverless) | $0.30 | $0.06 | $1.20 | 预算级前沿开源模型 |
| Qwen 3.7 Plus(Serverless) | $0.40 | $0.08 | $1.60 | 高性价比中规模开源模型 |
| OpenAI GPT OSS 120B(Serverless) | $0.15 | $0.015 | $0.60 | GPT OSS 20B $0.07 / $0.035 / $0.30 |
| 按需 GPU — NVIDIA H100 80GB | 每 GPU 小时 | $7.00 | — | 2026 年 9 月 1 日起涨至 $8.00/小时 |
| 按需 GPU — NVIDIA B200 180GB | 每 GPU 小时 | $10.00 | — | 2026 年 9 月 1 日起涨至 $13.00/小时 |
| 按需 GPU — NVIDIA GB300 288GB | 每 GPU 小时 | $18.00 | — | 2026 年 9 月 1 日起涨至 $20.00/小时 |
🔧 API 与开发者体验
- •API 风格: OpenAI 兼容 REST API——推理和微调都可作为 OpenAI 的即插即用替代品(相同 API、相同 SFT 数据格式)。把 base URL 改为 https://api.fireworks.ai/inference/v1 即可复用现有客户端。
- •服务路径: 三档 serverless 服务——Standard(成本优化)、Priority(更高吞吐)、Fast(最低延迟)——无需换模型即可按工作负载在价格与速度间取舍。
- •提示缓存: 缓存输入 token 计费远低于全新输入(如 DeepSeek V4 Pro 缓存 $0.145 vs 全新 $1.74)。长系统提示、few-shot 示例、多轮上下文会自动获得大额折扣。
- •FireAttention 引擎: Fireworks 专有推理引擎以前沿速度服务量化开源模型——这是 GPT-OSS、DeepSeek V4、Qwen、Llama 在其网络上 TTFT 亚秒的原因。
- •模型覆盖: 100+ 模型,涵盖文本、视觉、音频、图像和嵌入——包括 DeepSeek V4 Pro/Flash、Kimi K3/K2.7、Qwen 3.x、GPT-OSS、GLM 5.x、MiniMax M3 和 NVIDIA Nemotron。嵌入从 $0.008/1M 输入 token 起。
- •微调与训练: 监督(SFT)、偏好(DPO)和强化微调,支持最高 1T+ 参数模型。SFT 从 $0.50/1M 训练 token 起(<16B);Serverless Training API 只按你 prefill/采样/训练 的 token 计费,无闲置 GPU 成本。
- •免费层与配额: 注册即可获得 $1 免费 serverless 额度;自适应速率限制随用量增减;支持区域限定部署(1.5 倍加价)。
🏎️ 最快的开源模型推理
Fireworks AI 定位为基于开源模型构建的最快平台,其核心差异化在于开源权重的推理速度。专有 FireAttention 推理引擎配合模型量化与投机解码,为 GPT-OSS 120B、DeepSeek V4 Pro 等前沿开源模型提供亚秒级首 token 延迟。由于它托管了 API 社区实际在用的同款模型——DeepSeek V4 Pro/Flash、Kimi K3、Qwen 3.x、MiniMax M3、GLM 5.x——它是自建 vLLM 之外一个有底气、低延迟的选择。DeepSeek V4 Flash(0731)仅 $0.22 输入 / $0.66 输出(每 1M token),是极具性价比的预算选择;三档服务路径(Standard/Priority/Fast)让你按工作负载调节价格与延迟的取舍。这家 YC 背景的公司(Bellevue, WA)还提供提示缓存、自适应速率限制和 OpenAI 兼容 API,因此从 OpenAI 迁移的团队几乎无需改代码就能享受更低的开源模型成本。
🌐 区域可用性与延迟
Fireworks 运行全球基础设施。Serverless 推理默认跨四个高层级分组进行多区域部署——GLOBAL、US、EUROPE、APAC——流量就近服务用户并抵御局部故障。按需 GPU 的单区域覆盖 12 个美国站点(亚利桑那、加州、佐治亚、伊利诺伊、爱荷华、俄亥俄、德州、犹他、弗吉尼亚、华盛顿三个区)加上 EU(法兰克福、冰岛)和 APAC(东京两个区),横跨 H100/A100/B200/H200。没有中国大陆直连端点:作为美国平台,大陆直连需代理或中转,跨太平洋首字节延迟通常 150-250ms,而区域提供商约 50-80ms。对延迟敏感的中国市场流量,建议配合海外中转或选择区域端点;东京多区域是最接近的 APAC 选择。