Fireworks AI (Fireworks AI)

收录于 https://fireworks.ai

综合排名 #11 ⭐ 可考虑
❌ 需代理 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Firefunction-v2: $0.90/M, Llama 3.3 70B: $0.90/M, DeepSeek-R1: $2.00/M 每百万 tokens
输出 (Output) Firefunction-v2: $0.90/M, Llama 3.3 70B: $0.90/M, DeepSeek-R1: $2.00/M 每百万 tokens
💡 免费额度

新用户 $0.50 免费额度

🤖 支持模型(共 100 个)

Llama 3.3 70B Firefunction-v2 QWEN 2.5 72B DeepSeek-R1 Mixtral 8x22B CodeLlama 70B Llama 3.1 405B

✨ 优势

  • Firefunction-v2 是专为 Function Calling 优化的模型
  • Llama 3.3 70B 仅 $0.90/M tokens,非常平价
  • Moonshot 引擎实现快速推理
  • 支持 LoRA 微调部署
  • 100+ 开源模型托管

⚠️ 不足

  • × 国内需代理访问
  • × Firefunction-v2 以外模型竞争力一般
  • × 无免费额度
  • × 公司规模较小,长期服务稳定性存疑
  • × 非 OpenAI 兼容模型需要额外适配

🎯 适合场景

Function Calling 密集的应用;需要本地推理快速响应的场景;开源模型部署测试

💰 价格与方案

模型输入 ($/百万)缓存 ($/百万)输出 ($/百万)最佳用途
Kimi K3$3.00$0.30$15.00前沿推理与智能体
Kimi K2.7 Code$0.95$0.19$4.00编程与代码智能体
DeepSeek V4 Pro (0813)$1.74$0.145$3.48深度推理,100 万上下文
DeepSeek V4 Flash (0731)$0.14$0.028$0.28低成本高并发任务
GLM 5.2$1.40$0.14$4.40通用对话与智能体
Qwen 3.7 Plus$0.40$0.08$1.60预算型通用场景
MiniMax M3$0.30$0.06$1.20轻量 / 预算型应用
OpenAI GPT OSS 120B$0.15$0.015$0.60开源权重通用模型
Muse Glimmer 30B$0.35$0.04$1.50多模态 / 视觉
其他开源模型$0.10–$1.20$0.10–$1.20按规模:MoE ≤56B $0.50,稠密 >16B $0.90

🔧 API 与开发者体验

  • API 接口: OpenAI 兼容端点 https://api.fireworks.ai/inference/v1 — 大多数 OpenAI SDK 只需替换 base_url 与 api_key 即可使用。支持聊天补全、流式、函数调用、结构化输出、视觉与向量嵌入。
  • 注册与额度: 在 app.fireworks.ai 完全自助注册;新账号赠送 $1 免费额度,后付费计费,无服务器端限流较高。无需销售沟通即可开始。
  • 服务路径: 三档无服务器服务:Standard(默认)、Priority(更高限流与吞吐,约 1.5 倍价格)、Fast(更低延迟)。仅美国端点加价 10%,满足数据驻留需求。
  • 提示词缓存与批量: 缓存输入 token 价格约便宜 90%(如 DeepSeek V4 Pro 缓存 $0.145 vs 输入 $1.74/百万);批量推理按无服务器价格的 5 折计费(输入输出均适用)。
  • 微调与训练: 支持 LoRA SFT/DPO、全参 SFT/DPO 与 RL 微调;微调模型按基础模型的无服务器价格提供服务。Serverless Training API 按 token 计费(无需预置),Dedicated Training API 按 GPU 小时计费。
  • 按需 GPU: H100($7/小时)、H200($7)、B200($10)、B300($12)、GB300($18)——按秒计费、无启动费用;区域受限部署加价 50%。
  • 函数调用与智能体: 原生工具调用支持 JSON schema,另有 Fireworks 自研的 Firefunction 函数调用优化开源模型系列,适合智能体负载。

🚀 高性能开源权重推理与 Moonshot 引擎

Fireworks AI 的核心优势是高性能托管开源权重模型:前沿开源版本几天内即可上线——DeepSeek V4 Pro 0813、Kimi K3、GLM 5.2、Qwen 3.7 Plus、MiniMax M3 与 OpenAI GPT OSS 系列都运行在自研 Moonshot 推理引擎上,官方声称吞吐量比开源推理栈高约 250%、延迟低约 50%。同一平台还提供按秒计费、无启动费用的按需 GPU(H100/H200/B200/B300/GB300),以及完整的微调栈(LoRA 与全参 SFT/DPO 及 RL),训练后的模型按基础模型的无服务器价格提供服务。这种组合——最新开源权重、快速推理、GPU 与微调同一账单——正是它与纯 API 转售商的最大区别。

🌐 中国访问与延迟

Fireworks AI 是美国公司,在中国大陆没有节点,api.fireworks.ai 并未针对中国流量优化。大陆直连通常需要代理、VPN 或海外中转,实际延迟常在 200–500ms 以上(取决于线路质量),远高于国内厂商的百毫秒以内。没有面向中国的专属定价或结算方式。替代方案:通过 OpenAI 兼容的聚合器转发以访问相同模型,或在国内 GPU 云上自托管开源权重模型(DeepSeek、Qwen、GLM、Kimi)——目录中大部分是开源权重,Fireworks 并非唯一托管方。