Lambda GPU Cloud (Lambda)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | GPU instance on-demand per GPU/hr: NVIDIA B200 SXM6 $6.69, H100 SXM $3.99, A100 SXM 80GB $2.79, A100 SXM 40GB $1.99, GH200 $2.29, A100 PCIe $1.99, A6000 $1.09, A10 $1.29, V100 $0.79. 1-Click Cluster reserved per GPU/hr: B200 $9.86 (16 GPU) to $8.87 (256+), H100 $6.16 to $5.54. Superclusters / Private Cloud (4000+ GPUs) via sales. No egress fees. | 每百万 tokens |
| 输出 (Output) | Billed by the second per GPU instance (no idle GPU cost); clusters and reserved capacity carry a minimum commitment (2 weeks to 1 year). Managed orchestration: Managed Kubernetes and Slurm included at no extra per-node fee; Lambda Stack one-line install. No per-token inference pricing — Lambda's Inference API is winding down; self-hosted inference billed as GPU runtime. | 每百万 tokens |
| 缓存读取 | N/A (GPU cloud — no per-token prompt-cache concept; KV-cache cost is absorbed into GPU-hour billing) | 享折扣 |
无永久免费 GPU 层;注册后按用量计费(GPU 实例按秒计费)。1-Click Clusters 与 Superclusters 需预付 / 承诺周期(2 周至 1 年)。
🤖 支持模型(共 8 个)
✨ 优势
- ✓ 旗舰级开源/闭源模型训练基础设施:OpenAI 的 GPT-5 与 Google DeepMind 的 Gemini 等前沿模型曾在 Lambda GPU 集群上训练(官方案例)
- ✓ 按秒计费按需 GPU 实例,无闲置 GPU 成本、无 egress 费 — H100 SXM $3.99/GPU/hr、B200 SXM6 $6.69/GPU/hr
- ✓ 1-Click Clusters 从 16x 到 512x GPU 分钟级自助部署,预付 2 周-1 年有批量折扣(H100 16 GPU $6.16 → 256+ GPU $5.54/GPU/hr)
- ✓ Superclusters / Private Cloud:单租户 VR200 NVL72(Rubin)与 GB300 NVL72(Blackwell)集群,4000+ GPU + NVIDIA Quantum-2 InfiniBand
- ✓ SOC 2 Type II + ISO 27001/27017/27701/22301 认证,Trust Portal 实时合规文档;2025 年 11 月获 $1.5B 融资(微软 + 英伟达领投),谋求 IPO
⚠️ 不足
- × 不是按 token 计费的模型 API — 推理需要自己在 GPU 实例上用 vLLM/SGLang 部署;官方 Inference API 正在逐步退役(2026)
- × 无中国大陆直连,中国生产部署需代理
- × 1-Click Clusters 与 Superclusters 需 2 周-1 年预付承诺,不适合突发/短时负载
- × 相比 RunPod/Hyperbolic 等竞品,入门 GPU(RTX 4090 等消费级卡)缺失,全是数据中心级 GPU(A10/A6000 起步)
- × 没有免费层,按秒计费仍需信用卡 + 账单地址验证
🎯 适合场景
需要训练/微调大模型的 AI 实验室与企业(OpenAI、DeepMind 曾用);在 GPU 实例上自托管开源模型推理(vLLM/SGLang)的团队;需要 16x-512x GPU 大规模集群且能承诺 2 周-1 年的团队;重视合规(SOC 2/ISO)与无 egress 费的企业
💰 价格与方案
| 服务 | 计费单位 | 价格 | 备注 |
|---|---|---|---|
| 按需实例 — NVIDIA B200 SXM6 | 每 GPU / 小时 | $6.69 | 180GB 显存,8-GPU 主机;无 egress 费 |
| 按需实例 — NVIDIA H100 SXM | 每 GPU / 小时 | $3.99 | 80GB 显存;最常租用的 Hopper GPU |
| 按需实例 — NVIDIA A100 SXM 80GB / 40GB | 每 GPU / 小时 | $2.79 / $1.99 | Ampere 主力卡,80GB 或 40GB 版本 |
| 按需实例 — NVIDIA GH200 | 每 GPU / 小时 | $2.29 | 96GB Grace-Hopper 超级芯片 |
| 按需实例 — NVIDIA A100 PCIe / A6000 / A10 / V100 | 每 GPU / 小时 | $1.99 / $1.09 / $1.29 / $0.79 | 入门数据中心级 |
| 1-Click 集群 — NVIDIA HGX B200(16 GPU) | 每 GPU / 小时 | $9.86 | 预付 2 周-1 年;256+ GPU 降至 $8.87 |
| 1-Click 集群 — NVIDIA HGX H100(16 GPU) | 每 GPU / 小时 | $6.16 | 256+ GPU 降至 $5.54;需预付承诺 |
| Superclusters / Private Cloud | 合同 | 联系销售 | 单租户 VR200 NVL72(Rubin)/ GB300 NVL72(Blackwell),4000+ GPU,Quantum-2 InfiniBand |
| 托管 Kubernetes / Slurm | 包含 | $0 额外 | 集群编排无每节点附加费 |
| 自托管推理(vLLM / SGLang) | 每 GPU / 小时 | 与实例费率相同 | Inference API 正在退役 — 在 GPU 实例上部署开源模型 |
🔧 API 与开发者体验
- •API 风格: Lambda 是 GPU 云,不是按 token 计费的 LLM API。主要接口是 Cloud 控制台 + 用于启动实例、1-Click 集群和 Kubernetes 的 REST API。模型推理需自己在 GPU 实例上用 vLLM、SGLang 或 TensorRT-LLM 部署开源权重,再暴露自己的 OpenAI 兼容端点。
- •Lambda Stack: 一行安装器,在任意 Lambda 系统上配置 CUDA、cuDNN、PyTorch、TensorFlow 和 NVIDIA 驱动 — 从空 GPU 到可用 ML 环境的最快路径(托管实例已预装镜像)。
- •托管 Kubernetes + Slurm: 两种编排层都可在 1-Click 集群上使用,无每节点附加费。运行 PyTorch DDP / FSDP 或 Slurm 任务数组的团队可获得与本地相同调度器,而无需自己搭建集群。
- •1-Click 集群启动: 自助式多节点配置,从 16x 到 512x GPU 分钟级完成 — 在控制台选择 GPU 类型、节点数、存储和编排方式(托管 K8s、预装 K8s 或 Slurm)。Supercluster 档以下无需销售介入。
- •按秒计费: 按需 GPU 实例按秒计费、可随时终止 — 无闲置 GPU 浪费。集群需 2 周至 1 年预付,解锁批量价格。
- •无 Egress 费: Lambda 公布无 egress 费定价 — 出云数据传输不像超大规模云那样计费。对移动大型 checkpoint 和数据集的训练任务很有价值。
- •Inference API 状态: Lambda 的托管 Inference API 官方正在逐步退役(2026)— 推理的推荐路径是在 GPU 实例上部署模型。需要托管按 token 端点的团队应使用 vLLM 自托管配合 Lambda GPU,或改用独立的按 token 提供商。
🧠 前沿训练与自托管推理能力
Lambda 的核心能力是用于前沿训练和自托管推理的原始 NVIDIA GPU 容量。OpenAI 的 GPT-5 和 Google DeepMind 的 Gemini 是官方记载曾在 Lambda GPU 集群上训练过的模型之一 — 这是大多数专用 GPU 云都无法匹敌的可信度信号。其技术栈覆盖 Rubin 代 VR200 NVL72、Blackwell GB300 NVL72 / HGX B300 / HGX B200 和 Hopper H200/H100,通过三种方式交付:按秒计费按需实例用于原型,自助式 1-Click 集群(16x-512x GPU)用于生产分布式训练,以及带 NVIDIA Quantum-2 InfiniBand 的单租户 Superclusters(4000+ GPU)用于最大工作负载。因为 Lambda 以基础设施为先,模型选择不受限制 — 你可以用 vLLM 或 SGLang 部署任何开源权重(DeepSeek V4、Qwen 3.x、Llama、GLM、Kimi),并自行控制量化、批处理和 KV 缓存策略,这才是团队选择 Lambda 而非固定按 token API 的真正原因:对推理成本和延迟的完全控制。
🌐 区域可用性与延迟
Lambda 的数据中心在美国(加州及其他美国区域),服务北美及日益增长的欧洲团队。截至 2026 年 8 月,没有中国大陆直连节点,也未宣布中国区域;中国用户需要代理或海外中转,跨太平洋到美国区域的首字节延迟通常 150-250ms,而区域提供商(阿里云百炼、字节火山引擎)约 50-80ms。对训练任务而言,因为 GPU 按小时租用、数据批量搬运,这种网络成本不那么关键;但对于面向中国终端用户的延迟敏感型自托管推理,区域 GPU 云更合适。欧洲和中东是目前国际扩张的重点。合规(SOC 2 Type II、ISO 27001/27017/27701/22301)配合实时 Trust Portal,简化了企业 GPU 承诺的安全审查。