Fireworks AI 2026 评测:开源模型推理定价与 Serverless

Fireworks AI(fireworks.ai)是一家 YC 背景的 serverless 推理平台,自称「基于开源 AI 模型构建的最快平台」。它不是自研前沿闭源模型,而是运行 API 社区实际在用的开源权重——DeepSeek V4Kimi K3Qwen 3.xMiniMax M3GLM 5.x,以及现在的 OpenAI GPT-OSS——跑在专有 FireAttention 推理引擎上,并通过 OpenAI 兼容 API 对外服务。凭借 100+ 模型、按 token 的 serverless 定价、提示缓存和 $1 免费额度,它是自建 vLLM 或经聚合器路由之外的强有力替代方案。完整 4 段对比见 Fireworks AI 厂商页面,或对比 GroqTogether AIDeepSeek

🌍 速览:Fireworks 是低延迟、低成本开源模型推理且零运维的上佳选择。DeepSeek V4 Flash 定价($0.22 输入 / $0.66 输出,每 1M)是市面上最便宜的开源价格之一,FireAttention 引擎给出亚秒级 TTFT,提示缓存可把大输入账单砍掉约 90%。代价是:无中国大陆直连端点、无自研前沿模型、按需 GPU 2026 年 9 月 1 日起上涨约 15-27%。生产级开源模型 API 调用选 Fireworks;绝对最低延迟选 Groq(专用 LPU 硬件);最广开源模型目录与托管微调选 Together AI

Fireworks AI 是什么?2026 年开源模型推理为何重要?

Fireworks AI 的创立是为了解决一个具体痛点:前沿开源模型授权便宜,但跑好很贵。Hugging Face 权重好下载,却常常因为在朴素 vLLM 配置上冷启动慢、批处理差、基础设施昂贵而表现不佳。Fireworks 用一套专为推理打造的栈来攻坚——FireAttention 引擎、内核级优化、模型量化、投机解码——把开源模型延迟推到前沿闭源水平,却无需闭源提供商的 API 加价。结果是你可以把它当作一个开箱即用的 OpenAI 端点:同样的请求格式、同样的 SDK、同样的 SFT 数据格式用于微调,只是指向开源权重、成本更低。

这也是该平台在 2026 年重要的原因。随着 DeepSeek、Qwen(阿里)、Kimi(月之暗面)等厂商不断推出更强的开源权重,团队越来越常问一个问题:能否在不付出 OpenAI 每百万输出 token $3-15 的情况下获得接近前沿的质量?Fireworks 正是少数几家给出肯定回答的提供商之一——与 GroqTogether AISambaNova 一样,以企业级速度和可靠性服务这些开源权重。公开的 定价页serverless 定价文档 是本文所有数字的主要来源。

Fireworks AI serverless 定价:热门模型按 token 价格

Fireworks 按 token 计费 serverless 推理,分三个维度——输入、缓存输入、输出——并按工作负载可选 StandardPriorityFast 三档服务路径。下表展示 Standard 档价格(美元 / 每百万 token,2026 年 8 月自官方文档核对):

模型输入 ($/M)缓存 ($/M)输出 ($/M)备注
DeepSeek V4 Pro$1.74$0.145$3.48Priority $2.61 / $0.218 / $5.22
DeepSeek V4 Flash (0731)$0.22$0.007$0.66预算之选;2026 年 8 月 V4 家族
Kimi K3$3.00$0.30$15.00K2.7 Code $0.95 / $0.19 / $4.00
MiniMax M3$0.30$0.06$1.20预算级前沿开源模型
Qwen 3.7 Plus$0.40$0.08$1.60Qwen 3.8 Max $2.00 / $0.25 / $6.00
OpenAI GPT-OSS 120B$0.15$0.015$0.60GPT-OSS 20B $0.07 / $0.035 / $0.30
GLM 5.1$1.40$0.26$4.40GLM 5.2 $1.40 / $0.14 / $4.40

几点定价要点值得牢记。首先,提示缓存是大杠杆:Fireworks 把缓存输入定得远低于全新输入——DeepSeek V4 Pro 从 $1.74 降到缓存 $0.145(每 1M),约 92% 折扣。长系统提示、few-shot 示例、长多轮上下文会触发缓存,所以重复上下文的负载能大幅砍成本。其次,Priority 档(约 Standard 的 1.25-1.5 倍)和 Fast 档让你只在需要处购买更高吞吐或更低延迟。第三,嵌入从 $0.008 / 1M 输入 token 起(<150M 参数模型),检索负载上也很划算。

按需 GPU 定价与微调:容量和训练侧

除按 token 的 serverless 外,Fireworks 还提供按需 GPU 部署(按 GPU 秒计费)和托管微调。其按需 GPU 列表——2026 年 8 月自公开定价页核对——从 H100 80GB 每小时 $7.00 起,最高到 GB300 288GB 每小时 $18.00。值得注意的是,这些价格 2026 年 9 月 1 日起上涨:H100/H200 从 $7.00 涨到 $8.00,B200 从 $10.00 涨到 $13.00,B300 从 $12.00 涨到 $15.00,GB300 从 $18.00 涨到 $20.00。规划专用容量的团队应在变价前锁定当前价格。区域限定单区域部署另有 1.5 倍加价。

自定义模型方面,Fireworks 支持对最高 1T+ 参数开源模型进行 SFT、偏好(DPO)和强化微调,微调后的模型与基础模型同价服务。监督微调按模型大小每 1M 训练 token 计费:≤16B 参数 $0.50,16.1-80B $3.00(SFT)/ $6.00(DPO),80-300B $6.00 / $12.00,>300B(DeepSeek V3、Kimi K2 级别)$10.00 / $20.00。较新的 Serverless Training API 接入共享、常驻的训练池——只按你 prefill、采样和训练 的 token 计费,无预置、无闲置成本。粗略估算:Qwen 3.5 9B 每 1M prefill $0.66、采样 $1.995、训练 $1.463;Kimi K3 192k 为 $10.87 / $27.11 / $32.55。

开发者体验:为生产而生的 OpenAI 兼容 API

开发者体验是 Fireworks 的隐形强项。API 对推理和微调都 OpenAI 兼容——把 base URL 换成 https://api.fireworks.ai/inference/v1,现有 OpenAI 客户端即可工作,包括函数调用和结构化(JSON)输出。这让迁移对已在 OpenAI 上的团队几乎零改码,也正是 Fireworks 成为开源模型生产流量热门去处的原因。平台核心开发者功能包括:

  • 三档服务路径——Standard、Priority、Fast——按工作负载选择价格 vs 延迟,无需换模型。
  • 自动提示缓存——缓存输入 token 只按全新输入的一小部分计费,无需开关或配置。
  • 自适应速率限制——吞吐配额随你的用量增减,而不是一开始就固定。
  • 结构化输出与函数调用——为 agent 和工具工作流提供可靠的 JSON 响应。
  • 嵌入与重排序——开源嵌入模型用于检索,重排序模型用于搜索管道。
  • 量化与自定义模型——从 Hugging Face 等处上传权重,用量化精度部署以降低成本。

因为 Fireworks 在自己的引擎上运行开源权重,你还能在新开源版本落地当天就用上——包括DeepSeek V4 Pro(0813 构建),直接关联到 2026 年 8 月 DeepSeek V4 模型家族浪潮,详见 DeepSeek V4 Pro 定价DeepSeek V4 Flash API

Fireworks AI vs. Groq、Together AI、SambaNova

这些竞品从不同角度界定开源模型推理的光谱。Groq 是极端速度选项:其定制 LPU 硬件对支持的模型给出最低延迟,但目录更小、更不灵活。Together AI 以最广的开源模型目录外加托管微调和大社区与之抗衡,按 token 价格相近。SambaNova 聚焦企业级开源模型推理与高吞吐服务。Fireworks 在组合上差异化:通过 FireAttention 在热门开源模型上实现亚秒级 TTFT、激进的提示缓存定价、三档服务路径,以及企业级可靠性的 OpenAI 兼容 API。如果延迟是唯一指标且 Groq 支持你的模型,Groq 胜出;如果需要最宽的模型货架加调参,Together AI 很强;至于跨 DeepSeek、Kimi、Qwen、MiniMax 的成本优化 OpenAI 即插即用,Fireworks 是领先选择。

谁该选 Fireworks AI——谁不该

选 Fireworks 如果:(a) 需要 OpenAI 兼容 API 的生产级开源模型推理且不想自建 vLLM;(b) 重视 DeepSeek V4、Kimi K3、Qwen 3.x 上的亚秒级首 token 延迟和深度提示缓存折扣;(c) 需要微调开源模型并低价服务(无按 token 微调加价);或 (d) 想以最少改动把代码库从 OpenAI 迁到更便宜的开源模型。跳过它如果:(a) 需要绝对最低延迟且 Groq 支持你的模型;(b) 依赖只有 OpenAI/Anthropic/Google 提供的前沿专有模型(Fireworks 只托管开源权重);(c) 直接面向中国大陆提供延迟敏感流量——没有中国端点,跨太平洋延迟 150-250ms;(d) 需要永久免费层而非一次性 $1 额度。

区域可用性与延迟

Fireworks 运行全球基础设施。Serverless 推理默认跨四个高层级分组进行多区域部署——GLOBALUSEUROPEAPAC——流量就近服务用户并抵御局部故障。按需 GPU 的单区域覆盖 12 个美国站点(亚利桑那、加州、佐治亚、伊利诺伊、爱荷华、俄亥俄、德州、犹他、弗吉尼亚、华盛顿三个区)加上法兰克福和两个冰岛站点(EU)、两个东京区(APAC),配 H100、A100、B200、H200。没有中国大陆直连端点。作为美国平台(Bellevue, WA),大陆直连需代理或中转,跨太平洋首字节延迟通常 150-250ms,而区域提供商约 50-80ms。对延迟敏感的中国市场流量,建议配合海外中转或选择区域端点——东京多区域是最接近的 APAC 选项。与其他推理提供商的对比见 最便宜 LLM API 定价盘点

Fireworks AI 常见问题

Q: Fireworks AI 是好的开源模型推理提供商吗?

A: 是的,尤其适合低延迟生产负载。FireAttention 引擎给开源模型亚秒级 TTFT,定价有竞争力(DeepSeek V4 Flash $0.22 输入 / $0.66 输出,每 1M),OpenAI 兼容 API 让迁移几乎零改码。

Q: Fireworks AI 的计费模式是什么?

A: Serverless 推理按 token 计费,分输入、缓存输入、输出三档,有 Standard/Priority/Fast 三档路径。按需 GPU 按 GPU 秒计费。微调按每 1M 训练 token(SFT)或经 Serverless Training API 按 token 计费。新账号有 $1 免费 serverless 额度。

Q: Fireworks AI 有免费层吗?

A: 每次注册可获得一次性 $1 免费 serverless 额度,足够真实测试。没有持续免费层;serverless 是按量后付费。

Q: 能在 Fireworks AI 上用哪些模型?

A: 100+ 开源模型,覆盖文本、视觉、音频、图像和嵌入——DeepSeek V4 Pro/Flash、Kimi K3/K2.7、Qwen 3.x、OpenAI GPT-OSS 120B/20B、GLM 5.x、MiniMax M3、NVIDIA Nemotron,以及嵌入和重排序模型。

Q: Fireworks AI 比 OpenAI 用开源模型便宜吗?

A: 通常是的。DeepSeek V4 Flash($0.22 输入 / $0.66 输出)和 GPT-OSS 120B($0.15 / $0.60)等开源模型只有 OpenAI gpt-5 档价格的一小部分,且 Fireworks 以低延迟 + 提示缓存服务它们。

Q: 能在 Fireworks AI 上微调模型吗?

A: 可以。SFT、DPO 和强化微调支持最高 1T+ 参数开源模型,微调后的模型与基础模型同价服务。SFT 按大小每 1M 训练 token $0.50-$10.00。

Q: Fireworks AI 在中国可用吗?

A: 无中国大陆直连端点。美国平台,大陆访问需代理或中转,跨太平洋延迟 150-250ms。东京多区域是最接近的 APAC 选项。