Modal (Modal)

收录于 https://modal.com

综合排名 #28 ⭐ 可考虑
❌ 需代理(基础设施在 AWS/GCP 海外区域,国内直连不稳定) | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) 按 GPU 秒计费:H100 $0.001097/s、A100 80GB $0.000694/s、T4 $0.000164/s 每百万 tokens
输出 (Output) 同输入(按 GPU 时间,无 idle 费用) 每百万 tokens
缓存读取 无 prompt cache 概念(按 GPU 实际运行时间计算) 享折扣
💡 免费额度

Starter 计划免费 + $30/月 计算额度(每月刷新)

🤖 支持模型(共 12 个)

B300 / B200 / H200 / H100 / A100 / L40S / A10 / L4 / T4 (GPU) Self-hosted LLM inference (vLLM, SGLang, TensorRT-LLM) Custom PyTorch / TensorFlow / JAX models Stable Diffusion XL / FLUX / SD3 image generation Whisper transcription / XTTS speech synthesis Embeddings (BGE, GTE, sentence-transformers) Sandbox (arbitrary Linux containers)

✨ 优势

  • Python 原生 serverless GPU 平台,开发者体验极佳
  • 按 GPU 秒计费,零 idle 费用,spiky 工作负载成本最优
  • 内置沙箱、分布式队列、分布式 dict,支持 LLM 推理/训练/批处理
  • Starter 计划含 $30/月免费额度,独立开发者友好
  • vLLM/SGLang/TensorRT-LLM 一键部署开源 LLM

⚠️ 不足

  • × 非模型 API 提供商,自托管开源模型需要选型与维护
  • × 冷启动有 1-3 秒延迟,不适合超低延迟实时推理
  • × Region 选择加价 1.5-1.75 倍,非主区域成本高
  • × 无 prompt cache 概念,长上下文场景成本不如 Anthropic/OpenAI

🎯 适合场景

自托管开源 LLM(Llama/Qwen/DeepSeek);spiky 工作负载;ML 训练与批量推理