Lambda GPU Cloud (Lambda)

收录于 https://lambda.ai

综合排名 #20 ⭐ 可考虑
❌ 无中国大陆直连节点;数据中心在美国(加州等区域),国内访问需代理或海外中转。 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) GPU instance on-demand per GPU/hr: NVIDIA B200 SXM6 $6.69, H100 SXM $3.99, A100 SXM 80GB $2.79, A100 SXM 40GB $1.99, GH200 $2.29, A100 PCIe $1.99, A6000 $1.09, A10 $1.29, V100 $0.79. 1-Click Cluster reserved per GPU/hr: B200 $9.86 (16 GPU) to $8.87 (256+), H100 $6.16 to $5.54. Superclusters / Private Cloud (4000+ GPUs) via sales. No egress fees. 每百万 tokens
输出 (Output) Billed by the second per GPU instance (no idle GPU cost); clusters and reserved capacity carry a minimum commitment (2 weeks to 1 year). Managed orchestration: Managed Kubernetes and Slurm included at no extra per-node fee; Lambda Stack one-line install. No per-token inference pricing — Lambda's Inference API is winding down; self-hosted inference billed as GPU runtime. 每百万 tokens
缓存读取 N/A (GPU cloud — no per-token prompt-cache concept; KV-cache cost is absorbed into GPU-hour billing) 享折扣
💡 免费额度

无永久免费 GPU 层;注册后按用量计费(GPU 实例按秒计费)。1-Click Clusters 与 Superclusters 需预付 / 承诺周期(2 周至 1 年)。

🤖 支持模型(共 8 个)

NVIDIA HGX B200 180GB (on-demand GPU instances; $6.69/GPU/hr) NVIDIA H100 SXM 80GB ($3.99/GPU/hr on-demand) NVIDIA A100 SXM 80GB / 40GB ($2.79 / $1.99 per GPU/hr on-demand) NVIDIA GH200 96GB ($2.29/GPU/hr) NVIDIA A6000 / A10 / V100 (entry tiers $1.09 / $1.29 / $0.79 per GPU/hr) 1-Click Clusters: NVIDIA HGX B200 ($9.86-$8.87/GPU/hr) and H100 ($6.16-$5.54/GPU/hr), 16x-512x GPUs, 2 weeks to 1 year Superclusters / Private Cloud: single-tenant NVIDIA VR200 NVL72 (Rubin) and GB300 NVL72 (Blackwell) clusters, 4,000+ GPUs, Quantum-2 InfiniBand Self-hosted open-model inference on GPU instances (vLLM / SGLang / TensorRT-LLM) — Inference API is winding down

✨ 优势

  • 旗舰级开源/闭源模型训练基础设施:OpenAI 的 GPT-5 与 Google DeepMind 的 Gemini 等前沿模型曾在 Lambda GPU 集群上训练(官方案例)
  • 按秒计费按需 GPU 实例,无闲置 GPU 成本、无 egress 费 — H100 SXM $3.99/GPU/hr、B200 SXM6 $6.69/GPU/hr
  • 1-Click Clusters 从 16x 到 512x GPU 分钟级自助部署,预付 2 周-1 年有批量折扣(H100 16 GPU $6.16 → 256+ GPU $5.54/GPU/hr)
  • Superclusters / Private Cloud:单租户 VR200 NVL72(Rubin)与 GB300 NVL72(Blackwell)集群,4000+ GPU + NVIDIA Quantum-2 InfiniBand
  • SOC 2 Type II + ISO 27001/27017/27701/22301 认证,Trust Portal 实时合规文档;2025 年 11 月获 $1.5B 融资(微软 + 英伟达领投),谋求 IPO

⚠️ 不足

  • × 不是按 token 计费的模型 API — 推理需要自己在 GPU 实例上用 vLLM/SGLang 部署;官方 Inference API 正在逐步退役(2026)
  • × 无中国大陆直连,中国生产部署需代理
  • × 1-Click Clusters 与 Superclusters 需 2 周-1 年预付承诺,不适合突发/短时负载
  • × 相比 RunPod/Hyperbolic 等竞品,入门 GPU(RTX 4090 等消费级卡)缺失,全是数据中心级 GPU(A10/A6000 起步)
  • × 没有免费层,按秒计费仍需信用卡 + 账单地址验证

🎯 适合场景

需要训练/微调大模型的 AI 实验室与企业(OpenAI、DeepMind 曾用);在 GPU 实例上自托管开源模型推理(vLLM/SGLang)的团队;需要 16x-512x GPU 大规模集群且能承诺 2 周-1 年的团队;重视合规(SOC 2/ISO)与无 egress 费的企业

💰 价格与方案

服务计费单位价格备注
按需实例 — NVIDIA B200 SXM6每 GPU / 小时$6.69180GB 显存,8-GPU 主机;无 egress 费
按需实例 — NVIDIA H100 SXM每 GPU / 小时$3.9980GB 显存;最常租用的 Hopper GPU
按需实例 — NVIDIA A100 SXM 80GB / 40GB每 GPU / 小时$2.79 / $1.99Ampere 主力卡,80GB 或 40GB 版本
按需实例 — NVIDIA GH200每 GPU / 小时$2.2996GB Grace-Hopper 超级芯片
按需实例 — NVIDIA A100 PCIe / A6000 / A10 / V100每 GPU / 小时$1.99 / $1.09 / $1.29 / $0.79入门数据中心级
1-Click 集群 — NVIDIA HGX B200(16 GPU)每 GPU / 小时$9.86预付 2 周-1 年;256+ GPU 降至 $8.87
1-Click 集群 — NVIDIA HGX H100(16 GPU)每 GPU / 小时$6.16256+ GPU 降至 $5.54;需预付承诺
Superclusters / Private Cloud合同联系销售单租户 VR200 NVL72(Rubin)/ GB300 NVL72(Blackwell),4000+ GPU,Quantum-2 InfiniBand
托管 Kubernetes / Slurm包含$0 额外集群编排无每节点附加费
自托管推理(vLLM / SGLang)每 GPU / 小时与实例费率相同Inference API 正在退役 — 在 GPU 实例上部署开源模型

🔧 API 与开发者体验

  • API 风格: Lambda 是 GPU 云,不是按 token 计费的 LLM API。主要接口是 Cloud 控制台 + 用于启动实例、1-Click 集群和 Kubernetes 的 REST API。模型推理需自己在 GPU 实例上用 vLLM、SGLang 或 TensorRT-LLM 部署开源权重,再暴露自己的 OpenAI 兼容端点。
  • Lambda Stack: 一行安装器,在任意 Lambda 系统上配置 CUDA、cuDNN、PyTorch、TensorFlow 和 NVIDIA 驱动 — 从空 GPU 到可用 ML 环境的最快路径(托管实例已预装镜像)。
  • 托管 Kubernetes + Slurm: 两种编排层都可在 1-Click 集群上使用,无每节点附加费。运行 PyTorch DDP / FSDP 或 Slurm 任务数组的团队可获得与本地相同调度器,而无需自己搭建集群。
  • 1-Click 集群启动: 自助式多节点配置,从 16x 到 512x GPU 分钟级完成 — 在控制台选择 GPU 类型、节点数、存储和编排方式(托管 K8s、预装 K8s 或 Slurm)。Supercluster 档以下无需销售介入。
  • 按秒计费: 按需 GPU 实例按秒计费、可随时终止 — 无闲置 GPU 浪费。集群需 2 周至 1 年预付,解锁批量价格。
  • 无 Egress 费: Lambda 公布无 egress 费定价 — 出云数据传输不像超大规模云那样计费。对移动大型 checkpoint 和数据集的训练任务很有价值。
  • Inference API 状态: Lambda 的托管 Inference API 官方正在逐步退役(2026)— 推理的推荐路径是在 GPU 实例上部署模型。需要托管按 token 端点的团队应使用 vLLM 自托管配合 Lambda GPU,或改用独立的按 token 提供商。

🧠 前沿训练与自托管推理能力

Lambda 的核心能力是用于前沿训练和自托管推理的原始 NVIDIA GPU 容量。OpenAI 的 GPT-5 和 Google DeepMind 的 Gemini 是官方记载曾在 Lambda GPU 集群上训练过的模型之一 — 这是大多数专用 GPU 云都无法匹敌的可信度信号。其技术栈覆盖 Rubin 代 VR200 NVL72、Blackwell GB300 NVL72 / HGX B300 / HGX B200 和 Hopper H200/H100,通过三种方式交付:按秒计费按需实例用于原型,自助式 1-Click 集群(16x-512x GPU)用于生产分布式训练,以及带 NVIDIA Quantum-2 InfiniBand 的单租户 Superclusters(4000+ GPU)用于最大工作负载。因为 Lambda 以基础设施为先,模型选择不受限制 — 你可以用 vLLM 或 SGLang 部署任何开源权重(DeepSeek V4、Qwen 3.x、Llama、GLM、Kimi),并自行控制量化、批处理和 KV 缓存策略,这才是团队选择 Lambda 而非固定按 token API 的真正原因:对推理成本和延迟的完全控制。

🌐 区域可用性与延迟

Lambda 的数据中心在美国(加州及其他美国区域),服务北美及日益增长的欧洲团队。截至 2026 年 8 月,没有中国大陆直连节点,也未宣布中国区域;中国用户需要代理或海外中转,跨太平洋到美国区域的首字节延迟通常 150-250ms,而区域提供商(阿里云百炼、字节火山引擎)约 50-80ms。对训练任务而言,因为 GPU 按小时租用、数据批量搬运,这种网络成本不那么关键;但对于面向中国终端用户的延迟敏感型自托管推理,区域 GPU 云更合适。欧洲和中东是目前国际扩张的重点。合规(SOC 2 Type II、ISO 27001/27017/27701/22301)配合实时 Trust Portal,简化了企业 GPU 承诺的安全审查。