Fireworks AI (Fireworks AI)
综合排名 #11 ⭐ 可考虑
❌ 需代理 | 🌍 国际
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Firefunction-v2: $0.90/M, Llama 3.3 70B: $0.90/M, DeepSeek-R1: $2.00/M | 每百万 tokens |
| 输出 (Output) | Firefunction-v2: $0.90/M, Llama 3.3 70B: $0.90/M, DeepSeek-R1: $2.00/M | 每百万 tokens |
💡 免费额度
新用户 $0.50 免费额度
🤖 支持模型(共 100 个)
Llama 3.3 70B Firefunction-v2 QWEN 2.5 72B DeepSeek-R1 Mixtral 8x22B CodeLlama 70B Llama 3.1 405B
✨ 优势
- ✓ Firefunction-v2 是专为 Function Calling 优化的模型
- ✓ Llama 3.3 70B 仅 $0.90/M tokens,非常平价
- ✓ Moonshot 引擎实现快速推理
- ✓ 支持 LoRA 微调部署
- ✓ 100+ 开源模型托管
⚠️ 不足
- × 国内需代理访问
- × Firefunction-v2 以外模型竞争力一般
- × 无免费额度
- × 公司规模较小,长期服务稳定性存疑
- × 非 OpenAI 兼容模型需要额外适配
🎯 适合场景
Function Calling 密集的应用;需要本地推理快速响应的场景;开源模型部署测试
💰 价格与方案
| 模型 | 输入 ($/百万) | 缓存 ($/百万) | 输出 ($/百万) | 最佳用途 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $0.30 | $15.00 | 前沿推理与智能体 |
| Kimi K2.7 Code | $0.95 | $0.19 | $4.00 | 编程与代码智能体 |
| DeepSeek V4 Pro (0813) | $1.74 | $0.145 | $3.48 | 深度推理,100 万上下文 |
| DeepSeek V4 Flash (0731) | $0.14 | $0.028 | $0.28 | 低成本高并发任务 |
| GLM 5.2 | $1.40 | $0.14 | $4.40 | 通用对话与智能体 |
| Qwen 3.7 Plus | $0.40 | $0.08 | $1.60 | 预算型通用场景 |
| MiniMax M3 | $0.30 | $0.06 | $1.20 | 轻量 / 预算型应用 |
| OpenAI GPT OSS 120B | $0.15 | $0.015 | $0.60 | 开源权重通用模型 |
| Muse Glimmer 30B | $0.35 | $0.04 | $1.50 | 多模态 / 视觉 |
| 其他开源模型 | $0.10–$1.20 | — | $0.10–$1.20 | 按规模:MoE ≤56B $0.50,稠密 >16B $0.90 |
🔧 API 与开发者体验
- •API 接口: OpenAI 兼容端点 https://api.fireworks.ai/inference/v1 — 大多数 OpenAI SDK 只需替换 base_url 与 api_key 即可使用。支持聊天补全、流式、函数调用、结构化输出、视觉与向量嵌入。
- •注册与额度: 在 app.fireworks.ai 完全自助注册;新账号赠送 $1 免费额度,后付费计费,无服务器端限流较高。无需销售沟通即可开始。
- •服务路径: 三档无服务器服务:Standard(默认)、Priority(更高限流与吞吐,约 1.5 倍价格)、Fast(更低延迟)。仅美国端点加价 10%,满足数据驻留需求。
- •提示词缓存与批量: 缓存输入 token 价格约便宜 90%(如 DeepSeek V4 Pro 缓存 $0.145 vs 输入 $1.74/百万);批量推理按无服务器价格的 5 折计费(输入输出均适用)。
- •微调与训练: 支持 LoRA SFT/DPO、全参 SFT/DPO 与 RL 微调;微调模型按基础模型的无服务器价格提供服务。Serverless Training API 按 token 计费(无需预置),Dedicated Training API 按 GPU 小时计费。
- •按需 GPU: H100($7/小时)、H200($7)、B200($10)、B300($12)、GB300($18)——按秒计费、无启动费用;区域受限部署加价 50%。
- •函数调用与智能体: 原生工具调用支持 JSON schema,另有 Fireworks 自研的 Firefunction 函数调用优化开源模型系列,适合智能体负载。
🚀 高性能开源权重推理与 Moonshot 引擎
Fireworks AI 的核心优势是高性能托管开源权重模型:前沿开源版本几天内即可上线——DeepSeek V4 Pro 0813、Kimi K3、GLM 5.2、Qwen 3.7 Plus、MiniMax M3 与 OpenAI GPT OSS 系列都运行在自研 Moonshot 推理引擎上,官方声称吞吐量比开源推理栈高约 250%、延迟低约 50%。同一平台还提供按秒计费、无启动费用的按需 GPU(H100/H200/B200/B300/GB300),以及完整的微调栈(LoRA 与全参 SFT/DPO 及 RL),训练后的模型按基础模型的无服务器价格提供服务。这种组合——最新开源权重、快速推理、GPU 与微调同一账单——正是它与纯 API 转售商的最大区别。
🌐 中国访问与延迟
Fireworks AI 是美国公司,在中国大陆没有节点,api.fireworks.ai 并未针对中国流量优化。大陆直连通常需要代理、VPN 或海外中转,实际延迟常在 200–500ms 以上(取决于线路质量),远高于国内厂商的百毫秒以内。没有面向中国的专属定价或结算方式。替代方案:通过 OpenAI 兼容的聚合器转发以访问相同模型,或在国内 GPU 云上自托管开源权重模型(DeepSeek、Qwen、GLM、Kimi)——目录中大部分是开源权重,Fireworks 并非唯一托管方。