Fireworks AI (Fireworks AI)

收录于 https://fireworks.ai

综合排名 #15 ⭐ 可考虑
❌ 无中国大陆直连端点。作为美国平台,大陆直连需代理或海外中转,跨太平洋首字节延迟通常 150-250ms。最近 APAC 端点为东京多区域。 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Serverless (Standard, $/1M tokens): DeepSeek V4 Pro $1.74、V4 Flash $0.22、Kimi K3 $3.00、K2.7 Code $0.95、MiniMax M3 $0.30、Qwen 3.7 Plus $0.40、GPT OSS 120B $0.15、GLM 5.1 $1.40。嵌入按模型档 $0.008-$0.016/1M。按需 GPU 按小时:H100 $7.00、H200 $7.00、B200 $10.00、B300 $12.00、GB300 $18.00(9 月 1 日上调)。 每百万 tokens
输出 (Output) Serverless 输出($/1M):DeepSeek V4 Pro $3.48、V4 Flash $0.66、Kimi K3 $15.00、MiniMax M3 $1.20、Qwen 3.7 Plus $1.60、GPT OSS 120B $0.60、GLM 5.1 $4.40。缓存输入显著更低(如 DeepSeek V4 Pro $0.145)。训练:SFT 每 1M 训练 token $0.50(≤16B)到 $10.00(>300B);Serverless Training API 仅按 token 计费、无闲置 GPU 成本。 每百万 tokens
缓存读取 提示缓存输入 token 计费远低于全新输入——DeepSeek V4 Pro 缓存 $0.145 vs 全新 $1.74(约 -92%);适配价格见各模型档。 享折扣
💡 免费额度

注册即享 $1 免费 serverless 额度(pay-per-token,postpaid billing);无永久免费档。按需 GPU 与训练按用量计费。

🤖 支持模型(共 9 个)

DeepSeek V4 Pro — $1.74 input / $0.145 cached / $3.48 output per 1M tokens (Serverless Standard; Priority $2.61 / $0.218 / $5.22) DeepSeek V4 Flash (0731) — $0.22 input / $0.007 cached / $0.66 output per 1M (Standard) Kimi K3 — $3.00 / $0.30 / $15.00 per 1M (Standard); Kimi K2.7 Code $0.95 / $0.19 / $4.00 MiniMax M3 — $0.30 / $0.06 / $1.20 per 1M (Standard) Qwen 3.7 Plus — $0.40 / $0.08 / $1.60 per 1M; Qwen 3.8 Max $2.00 / $0.25 / $6.00 OpenAI GPT OSS 120B — $0.15 / $0.015 / $0.60 per 1M; GPT OSS 20B $0.07 / $0.035 / $0.30 GLM 5.1 — $1.40 / $0.26 / $4.40 per 1M; GLM 5.2 $1.40 / $0.14 / $4.40 Embeddings (open) — $0.008 (≤150M params) to $0.016 (150-350M) per 1M input tokens On-demand GPUs per hour — H100 80GB $7.00 (→$8.00 Sep 1), H200 $7.00 (→$8.00), B200 $10.00 (→$13.00), B300 $12.00 (→$15.00), GB300 $18.00 (→$20.00)

✨ 优势

  • OpenAI 兼容 API——推理与微调都是即插即用替代品(相同 API、相同 SFT 数据格式),迁移几乎零改码
  • FireAttention 专有推理引擎 + 量化 + 投机解码,开源模型 TTFT 亚秒——最快的开源模型托管平台之一
  • 托管 DeepSeek V4 Pro/Flash、Kimi K3、Qwen 3.x、MiniMax M3、GLM 5.x、GPT-OSS、NVIDIA Nemotron 等 100+ 开源模型
  • 提示缓存大额折扣:DeepSeek V4 Pro 缓存输入 $0.145 vs 全新 $1.74(约 -92%)
  • 三档 serverless 服务路径(Standard/Priority/Fast)在价格与延迟间按需取舍
  • 微调/训练覆盖最高 1T+ 参数模型;Serverless Training API 仅按 token 计费、无闲置 GPU 成本
  • $1 免费额度、自适应速率限制、全球多区域部署(GLOBAL/US/EUROPE/APAC)

⚠️ 不足

  • × 无中国大陆直连——大陆生产需代理/中转,跨太平洋延迟 150-250ms
  • × 按需 GPU 2026-09-01 起全面涨价(H100 $7→$8、B200 $10→$13、GB300 $18→$20/小时)
  • × 无独立研发的前沿闭源模型——只托管开源权重(DeepSeek/Kimi/Qwen 等),不提供自研旗舰模型
  • × 按需 GPU 以预置/部署为主,突发小负载不如 serverless 按 token 灵活;区域限定部署需 1.5 倍加价

🎯 适合场景

开发者与团队若需要「最快的开源模型推理 + OpenAI 兼容 API」且不想自建 vLLM——尤其适合调用 DeepSeek V4、Kimi、Qwen、GPT-OSS 等开源模型的低成本生产场景。

💰 价格与方案

服务 / 模型输入 ($/百万)缓存 ($/百万)输出 ($/百万)备注
DeepSeek V4 Pro(Serverless,Standard)$1.74$0.145$3.48V4 Pro 0813;Priority $2.61 / $0.218 / $5.22
DeepSeek V4 Flash(Serverless,Standard)$0.22$0.007$0.66V4 Flash 0731;关联 2026 年 8 月 V4 模型家族
Kimi K3(Serverless)$3.00$0.30$15.00K3;K2.7 Code $0.95 / $0.19 / $4.00
MiniMax M3(Serverless)$0.30$0.06$1.20预算级前沿开源模型
Qwen 3.7 Plus(Serverless)$0.40$0.08$1.60高性价比中规模开源模型
OpenAI GPT OSS 120B(Serverless)$0.15$0.015$0.60GPT OSS 20B $0.07 / $0.035 / $0.30
按需 GPU — NVIDIA H100 80GB每 GPU 小时$7.002026 年 9 月 1 日起涨至 $8.00/小时
按需 GPU — NVIDIA B200 180GB每 GPU 小时$10.002026 年 9 月 1 日起涨至 $13.00/小时
按需 GPU — NVIDIA GB300 288GB每 GPU 小时$18.002026 年 9 月 1 日起涨至 $20.00/小时

🔧 API 与开发者体验

  • API 风格: OpenAI 兼容 REST API——推理和微调都可作为 OpenAI 的即插即用替代品(相同 API、相同 SFT 数据格式)。把 base URL 改为 https://api.fireworks.ai/inference/v1 即可复用现有客户端。
  • 服务路径: 三档 serverless 服务——Standard(成本优化)、Priority(更高吞吐)、Fast(最低延迟)——无需换模型即可按工作负载在价格与速度间取舍。
  • 提示缓存: 缓存输入 token 计费远低于全新输入(如 DeepSeek V4 Pro 缓存 $0.145 vs 全新 $1.74)。长系统提示、few-shot 示例、多轮上下文会自动获得大额折扣。
  • FireAttention 引擎: Fireworks 专有推理引擎以前沿速度服务量化开源模型——这是 GPT-OSS、DeepSeek V4、Qwen、Llama 在其网络上 TTFT 亚秒的原因。
  • 模型覆盖: 100+ 模型,涵盖文本、视觉、音频、图像和嵌入——包括 DeepSeek V4 Pro/Flash、Kimi K3/K2.7、Qwen 3.x、GPT-OSS、GLM 5.x、MiniMax M3 和 NVIDIA Nemotron。嵌入从 $0.008/1M 输入 token 起。
  • 微调与训练: 监督(SFT)、偏好(DPO)和强化微调,支持最高 1T+ 参数模型。SFT 从 $0.50/1M 训练 token 起(<16B);Serverless Training API 只按你 prefill/采样/训练 的 token 计费,无闲置 GPU 成本。
  • 免费层与配额: 注册即可获得 $1 免费 serverless 额度;自适应速率限制随用量增减;支持区域限定部署(1.5 倍加价)。

🏎️ 最快的开源模型推理

Fireworks AI 定位为基于开源模型构建的最快平台,其核心差异化在于开源权重的推理速度。专有 FireAttention 推理引擎配合模型量化与投机解码,为 GPT-OSS 120B、DeepSeek V4 Pro 等前沿开源模型提供亚秒级首 token 延迟。由于它托管了 API 社区实际在用的同款模型——DeepSeek V4 Pro/Flash、Kimi K3、Qwen 3.x、MiniMax M3、GLM 5.x——它是自建 vLLM 之外一个有底气、低延迟的选择。DeepSeek V4 Flash(0731)仅 $0.22 输入 / $0.66 输出(每 1M token),是极具性价比的预算选择;三档服务路径(Standard/Priority/Fast)让你按工作负载调节价格与延迟的取舍。这家 YC 背景的公司(Bellevue, WA)还提供提示缓存、自适应速率限制和 OpenAI 兼容 API,因此从 OpenAI 迁移的团队几乎无需改代码就能享受更低的开源模型成本。

🌐 区域可用性与延迟

Fireworks 运行全球基础设施。Serverless 推理默认跨四个高层级分组进行多区域部署——GLOBAL、US、EUROPE、APAC——流量就近服务用户并抵御局部故障。按需 GPU 的单区域覆盖 12 个美国站点(亚利桑那、加州、佐治亚、伊利诺伊、爱荷华、俄亥俄、德州、犹他、弗吉尼亚、华盛顿三个区)加上 EU(法兰克福、冰岛)和 APAC(东京两个区),横跨 H100/A100/B200/H200。没有中国大陆直连端点:作为美国平台,大陆直连需代理或中转,跨太平洋首字节延迟通常 150-250ms,而区域提供商约 50-80ms。对延迟敏感的中国市场流量,建议配合海外中转或选择区域端点;东京多区域是最接近的 APAC 选择。