Modal (Modal)
综合排名 #28 ⭐ 可考虑
❌ 需代理(基础设施在 AWS/GCP 海外区域,国内直连不稳定) | 🌍 国际
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | 按 GPU 秒计费:H100 $0.001097/s、A100 80GB $0.000694/s、T4 $0.000164/s | 每百万 tokens |
| 输出 (Output) | 同输入(按 GPU 时间,无 idle 费用) | 每百万 tokens |
| 缓存读取 | 无 prompt cache 概念(按 GPU 实际运行时间计算) | 享折扣 |
💡 免费额度
Starter 计划免费 + $30/月 计算额度(每月刷新)
🤖 支持模型(共 12 个)
B300 / B200 / H200 / H100 / A100 / L40S / A10 / L4 / T4 (GPU) Self-hosted LLM inference (vLLM, SGLang, TensorRT-LLM) Custom PyTorch / TensorFlow / JAX models Stable Diffusion XL / FLUX / SD3 image generation Whisper transcription / XTTS speech synthesis Embeddings (BGE, GTE, sentence-transformers) Sandbox (arbitrary Linux containers)
✨ 优势
- ✓ Python 原生 serverless GPU 平台,开发者体验极佳
- ✓ 按 GPU 秒计费,零 idle 费用,spiky 工作负载成本最优
- ✓ 内置沙箱、分布式队列、分布式 dict,支持 LLM 推理/训练/批处理
- ✓ Starter 计划含 $30/月免费额度,独立开发者友好
- ✓ vLLM/SGLang/TensorRT-LLM 一键部署开源 LLM
⚠️ 不足
- × 非模型 API 提供商,自托管开源模型需要选型与维护
- × 冷启动有 1-3 秒延迟,不适合超低延迟实时推理
- × Region 选择加价 1.5-1.75 倍,非主区域成本高
- × 无 prompt cache 概念,长上下文场景成本不如 Anthropic/OpenAI
🎯 适合场景
自托管开源 LLM(Llama/Qwen/DeepSeek);spiky 工作负载;ML 训练与批量推理