fal.ai (fal.ai)
收录于 https://fal.ai
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | 按请求/按时长计费,无月费。图像生成:FLUX.2 Pro $0.03/第一个 MP + $0.015/额外 MP、FLUX1.1 [pro] 按 MP、Nano Banana 2 $0.08/图、FLUX.1 [schnell] 无定价显示。视频:Kling v3 $0.084-0.168/秒、Seedance 2.0 $0.3034/秒(720p)。TTS:通过 ElevenLabs/MiniMax 等第三方提供。余额模式:预付 $10+ 存入信用余额,用完为止。开源模型按秒计费,秒级颗粒度。 | 每百万 tokens |
| 输出 (Output) | 每百万 tokens |
无免费 API 层(预付 $10 起买信用余额);无月费、无订阅、无隐藏费用;Serverless 模式下零运行时自动缩零
🤖 支持模型(共 1396 个)
✨ 优势
- ✓ 🧠 1,396+ 开源/商业模型:FLUX.2 Pro、GPT Image 2、Kling Video、Nano Banana 2、ElevenLabs TTS、MiniMax 等
- ✓ ⚡ <1 秒冷启动(业界最快),按秒计费,零运行时自动缩零
- ✓ 🔌 OpenAI 兼容 API + WebSocket Streaming + REST,所有模型统一接口
- ✓ 🧩 覆盖 text-to-image、image-to-video、text-to-video、TTS、Audio、LLM、3D 等多种模态
- ✓ 💰 无月费、无订阅,预付 $10 起即用,按模型单价精确扣除
- ✓ 🏠 Python SDK (pip install fal) + TypeScript SDK + REST API,全语言支持
⚠️ 不足
- × 无免费 API 层(对比 OpenRouter 有免费模型、Replicate 有试用额度)
- × 模型碎片化:1,396+ 模型各自定价,没有统一的 token-based 定价表
- × 无内置 Guardrails / Prompt 管理 / 可观测性(对比 Portkey 或 OpenRouter 的 observability)
- × FLUX 推理价格一般比 BFL 原厂贵 5-15%
- × 实时 API 文档对部分模型缺乏详细的 request/response schema
🎯 适合场景
需要多模态 AI 推理(图像、视频、音频、3D)的开发者和团队;希望在同一平台上访问 1,000+ 模型而无需管理多个 API Key;冷启动敏感的推理场景(<1 秒冷启动业界最快);快速原型验证与按秒付费的轻量级生产部署
💰 价格与方案
| 模型 | 类别 | 价格 | 备注 |
|---|---|---|---|
| FLUX.2 [pro] | 图像(文生图) | 首个 MP $0.03 + 额外 MP $0.015 | Black Forest Labs 旗舰;支持 kontext / edit 变体 |
| Nano Banana 2 | 图像(文生图/图生图) | $0.08 / 张 | Google Gemini 图像模型;$1 可生成 12 张 |
| Nano Banana Pro | 图像(文生图/图生图) | $0.15 / 张 | Pro 档;4K 输出按双倍计费 |
| gpt-image-1.5(GPT Image 2) | 图像(文生图/编辑) | 按 token:文本输入 $5 / 输出 $10 每百万 | OpenAI 图像生成;图像 token 输入 $8 / 输出 $30 每百万 |
| Kling Video v3 [pro] | 视频(文生视频/图生视频) | $0.112–0.168 / 秒 | 快手可灵 3.0;开启原生音频约加价 50% |
| Veo 3.1 Fast | 视频(文生视频/图生视频) | $0.10–0.15 / 秒 | Google 视频生成;快速档适合高吞吐 |
| Veo 3.1 Lite | 视频(文生视频/图生视频) | $0.03–0.05 / 秒 | 经济档;开启音频额外计费 |
| ElevenLabs TTS v3 | 语音合成 | 按字符(ElevenLabs 费率) | 语音合成经 ElevenLabs 路由 |
| MiniMax Music 2.6 | 音乐生成 | $0.05 / 秒 | 文生音乐;$1 约生成 20 秒 |
🔧 API 与开发者体验
- •fal-serverless 引擎: fal 自研推理运行时以亚秒级冷启动执行数千个开源与闭源模型;空闲时自动缩零,只按实际算力付费,无需预留容量。
- •异步队列 + Webhook: 生成端点可同步调用或通过异步任务队列 + webhook 回调与状态轮询执行 —— 适合无需保持长连接的批量渲染任务。
- •单一 REST API: 一个 base URL(api.fal.ai)覆盖图像、视频、音频、3D 与 LLM 端点,JSON schema 一致;每个模型在文档中暴露其类型化的请求/响应契约。
- •客户端 SDK: 官方 fal-client SDK 支持 Python 与 JavaScript/TypeScript,同时提供 REST 与 WebSocket;Playground 可先测试提示词再写代码。
- •按秒计费: 开源模型按秒计费、秒级颗粒度;图像模型按兆像素/张、视频模型按秒 —— 无月费承诺,无档位门槛。
- •微调与训练端点: FLUX LoRA / Kontext 训练器、Wan 图像训练器、Z-image 训练器支持自定义模型微调,按 1000 步运行计费。
- •OpenAI 兼容 Chat: LLM 任务上 fal 暴露 OpenAI 兼容的 chat completions,现有工具调用与 agent 管线只需替换 base-URL 和 Key 即可迁移。
⚡ fal-serverless 与多模型路由
fal.ai 的招牌能力是 fal-serverless —— 一套自研推理运行时,把数千个开源与商业模型(FLUX、Nano Banana、Kling、Veo、Seedream、GPT Image、MiniMax、ElevenLabs)整合在单一 API 之后。它的两大核心是速度与成本控制:亚秒级冷启动与自动缩零使其明显快于 Replicate 等 GPU 云同行,而按秒/按兆像素计费、无中间商加价则让单位成本比直接多供应商集成低 30–50%。除生成外,fal 还提供微调端点(FLUX LoRA/Kontext 训练器)、3D 资产生成管线、去背、放大,以及面向 LLM 任务的 OpenAI 兼容 chat completions,使其成为在生产中跨多模型 A/B 测试团队的一站式网关,而非锁定单一厂商的产品线。
🌐 中国访问与延迟
fal.ai 主要部署于 AWS US-East,未在中国大陆部署边缘节点,因此 GFW 内的开发者通常需要稳定的 VPN 或海外 VPS 才能可靠访问 api.fal.ai;从大陆城市到美东区域每请求延迟通常在 250–500ms(不含模型生成时间),对轮询式生成尚可接受,但对实时交互负载不太理想。部分国内团队改为通过转售同一批端点并提供中文计费与更低延迟路由的国内聚合平台间接使用 fal 模型目录。由于 fal 的按秒媒体生成本质上是异步的,中等延迟很少阻断生产使用 —— 但面向大陆用户交付的团队应在架构中预留代理或国内中转。在非中国大陆区域,fal 延迟极佳,其模型广度使其成为多模型媒体负载的有力默认选择。