Lambda GPU Cloud 2026 评测:H100/B200 定价与 1-Click 集群
Lambda(lambda.ai)自称「超级智能云」——一家 GPU 云和 AI 基础设施公司(前身品牌 Lambda Labs / Lambda Cloud),提供从单个按需 GPU 实例到数千 GPU 单租户超级集群的 NVIDIA 加速算力。它不是按 token 计费的模型 API,也不是 AWS Lambda(无服务器函数产品),两者无关。Lambda 在专用 GPU 云中拥有无与伦比的可信度信号:OpenAI 的 GPT-5 和 Google DeepMind 的 Gemini 都是官方记载曾在 Lambda GPU 集群上训练过的前沿模型。其产品栈按三种方式扩展——按秒计费的按需实例(单节点 B200/H100)、自助式1-Click 集群(16x-512x GPU)、以及基于 NVIDIA Quantum-2 InfiniBand 的单租户Superclusters / Private Cloud(4000+ GPU)——覆盖 NVIDIA Rubin 代(VR200 NVL72)、Blackwell(GB300 NVL72、HGX B300、HGX B200)和 Hopper(H200、H100)系统。完整 4 段对比见 Lambda 厂商页面,或对比 RunPod、Crusoe、Hyperbolic。
Lambda 是什么?2026 年「超级智能云」为何重要?
Lambda 最初是 GPU 算力和深度学习硬件公司,在 AI 需求爆发后转型为完全托管的 NVIDIA GPU 云("GPU cloud" / "neocloud")。其定位「The Superintelligence Cloud」反映了一个刻意的选择:不与超大规模云在通用云服务上竞争,而是专注于密集的 NVIDIA 集群加上编排层(托管 Kubernetes、Slurm)、一行Lambda Stack 安装器(CUDA、cuDNN、PyTorch、TensorFlow、NVIDIA 驱动)以及企业合规(SOC 2 Type II、ISO 27001/27017/27701/22301、实时 Trust Portal)。公开的 GPU 定价页 和 llms.txt 概览 是本文数据的主要来源。
Lambda GPU 定价:按需实例、1-Click 集群、Superclusters
Lambda 按每 GPU 小时(秒级粒度)计费且无 egress 费。按需列表价格与 1-Click 集群预付价(2026 年 8 月从公开定价页核实):
| GPU / 服务 | 按需($/GPU/hr) | 备注 |
|---|---|---|
| NVIDIA B200 SXM6 | $6.69 | 180GB 显存,8-GPU 主机 |
| NVIDIA H100 SXM | $3.99 | 80GB 显存 —— 最常租用的 Hopper GPU |
| NVIDIA A100 SXM 80GB / 40GB | $2.79 / $1.99 | Ampere 主力卡 |
| NVIDIA GH200 | $2.29 | 96GB Grace-Hopper 超级芯片 |
| NVIDIA A100 PCIe / A6000 / A10 / V100 | $1.99 / $1.09 / $1.29 / $0.79 | 入门数据中心级 |
| 1-Click 集群 — HGX B200(16 GPU) | $9.86 | 预付 2 周-1 年;256+ GPU 降至 $8.87 |
| 1-Click 集群 — HGX H100(16 GPU) | $6.16 | 256+ GPU 降至 $5.54;需预付 |
| Superclusters / Private Cloud | 联系销售 | VR200 NVL72(Rubin)/ GB300 NVL72(Blackwell),4000+ GPU,Quantum-2 InfiniBand |
几点定价说明。按需 H100 $3.99/GPU-hr 与 RunPod 和 Hyperbolic 的突发价相当,且 Lambda 的「无 egress 费」政策对移动大型 checkpoint 和数据集的训练任务是实在的降本杠杆。1-Click 集群和 Supercluster 价附带 2 周至 1 年的预付承诺,以换取批量折扣;如果你只需要突发容量,按秒计费的按需实例更划算。Lambda 没有消费级 GPU(无 RTX 4090)——产品线仅数据中心级,从 A10/A6000/V100 起步。
Lambda 的 API 表面:它是基础设施云,不是模型 API
对 API 调用方而言,理解 Lambda 最重要的一点是:它不是按 token 计费的模型端点。Lambda 的托管 Inference API 正在逐步退役(2026),官方指引是「继续在 NVIDIA GPU 实例上无缝部署和扩展模型」。这意味着开发者体验是运维优先的:你从 Cloud 控制台或 REST API 启动 GPU 实例或集群,然后用 vLLM、SGLang 或 TensorRT-LLM 自行部署开源权重,暴露自己的 OpenAI 兼容端点。代价是控制力:你拥有量化、批处理、KV 缓存策略,以及关键的——成本和延迟。回报是最大的模型自由——DeepSeek V4、Qwen 3.x、Llama、GLM、Kimi 或其中任何一个的微调版——且没有托管 API 的按 token 加价。
- Lambda Stack:一行安装器配置 CUDA、cuDNN、PyTorch、TensorFlow 和 NVIDIA 驱动——托管实例已预装镜像,几分钟从空 GPU 到可用 ML 环境。
- 托管 Kubernetes + Slurm:两种编排层都在 1-Click 集群上提供且无每节点费——运行 PyTorch DDP/FSDP 或 Slurm 任务数组的团队可获得与本地相同的调度器。
- 1-Click 集群启动:从控制台分钟级自助配置 16x-512x GPU;Supercluster 档以下无需销售介入。
- 按秒计费:按需实例按秒计费、随时终止;集群附 2 周至 1 年预付。
- 无 egress 费:出站数据传输不像超大规模云那样按量计费。
为什么 Lambda 对 API 调用方重要:前沿训练资质与基础设施持久性
对 2026 年选择 AI 基础设施的工程师而言,Lambda 重要有两个原因。第一,可信度:OpenAI 的 GPT-5 和 Google DeepMind 的 Gemini 被官方记载在 Lambda GPU 集群上训练——这是大多数专用 GPU 云无法匹敌的信号,也强烈暗示如果你需要大规模有保障的 NVIDIA 容量,Lambda 拥有相应集群。第二,持久性:Lambda 2025 年 11 月获 $1.5B 融资,由 微软和英伟达领投,并正在谋求 IPO(2026 年 1 月讨论过 $350M 上市前融资)。这是你可以放心用于生产负载的基础设施资本画像。合规栈(SOC 2 Type II、ISO 27001/27017/27701/22301、实时 Trust Portal)进一步降低了企业安全审查的门槛。需要注意的是,Lambda 的价值几乎完全通过自管理 GPU 使用实现——你用托管 API 的便利换取原始控制力。需要托管 OpenAI 兼容端点的团队应把 Lambda GPU 与 vLLM 自托管结合,或改选按 token 提供商。
Lambda vs. RunPod、Crusoe、Hyperbolic
这三家竞品从不同角度框定 GPU 云光谱,各自对应 Lambda 的一种用例。RunPod 是开发者友好的 serverless 选项:按秒 GPU pods、大型市场、以及消费级卡(RTX 4090),是突发推理和实验最便宜的选择。Crusoe 和 Nebius 最接近「带托管推理 API 的 GPU 云」:他们既出租 GPU 算力,又为开源模型暴露 OpenAI 兼容按 token 端点,让你得到 Lambda 级算力而无需自己管理 vLLM。Hyperbolic 是聚合闲置 GPU 的去中心化市场,入门价最低,但以可预测容量为代价。Lambda 的定位是企业训练 + 自托管生产推理档:最顶级的客户名单、$1.5B+ 融资、严格合规、以及通向 4000+ GPU 单租户集群的清晰(虽需承诺)路径。
谁该选 Lambda —— 谁不该选
选 Lambda 如果你:(a) 训练或微调大型模型,需要资金充足、合规平台上的有保障 NVIDIA 容量;(b) 用 vLLM/SGLang 大规模自托管生产推理,想要每 GPU 小时透明的价格且无 egress 费;或 (c) 企业需要 SOC 2/ISO 合规,并希望扩展至 4000+ GPU 单租户集群。跳过它如果你:(a) 只需简单调用开源或前沿模型——托管按 token API(OpenAI、聚合器、或 Crusoe/Nebius)对纯消费更简单更便宜;(b) 需要廉价、突发、按秒 GPU 且无多周承诺——RunPod 或 Hyperbolic 更合适且提供 RTX 4090 等消费级卡;(c) 服务面向中国大陆的延迟敏感流量——没有中国端点,跨太平洋延迟 150-250ms。
区域可用性与延迟
Lambda 的数据中心在美国(加州及其他美国区域),服务北美及日益增长的欧洲团队;欧洲和中东是当前国际扩张重点。截至 2026 年 8 月,没有中国大陆直连端点,也未宣布中国区域。对中国生产部署,你需要代理或选择有本地存在的区域提供商。对延迟敏感的亚洲流量,跨太平洋请求到美国区域通常增加 150-250ms 首字节延迟,而区域提供商(阿里云百炼、字节火山引擎、Cloudflare Workers AI)约 50-80ms。对训练负载——GPU 按小时租用、数据批量搬运——这种网络成本远不如同步推理关键。Lambda 最适合美国/欧洲锚定的训练与自托管推理;延迟关键的亚洲流量应选择区域 GPU 云。
Lambda GPU Cloud 常见问题
A: 不能直接。Lambda 没有托管的按 token 推理端点(Inference API 正在退役)。你租一个 GPU 实例,自己用 vLLM/SGLang 部署开源权重,然后调用自己的 OpenAI 兼容端点。
A: 按秒计费的按需实例(H100 SXM $3.99/GPU-hr、A10 $1.29/GPU-hr)配合 vLLM 自托管是突发工作的最便宜路径。1-Click 集群预付(2 周-1 年)只有在高利用率持续时才能降低每 GPU 成本。
A: 不收。Lambda 公布无 egress 费定价,这对移动大型 checkpoint 和数据集的训练任务很重要。
A: 按需:B200 SXM6、H100 SXM、A100 SXM 80GB/40GB、GH200、A100 PCIe、A6000、A10、V100。集群:HGX B200 和 HGX H100 最高 512 GPU。Superclusters:VR200 NVL72(Rubin)和 GB300 NVL72(Blackwell),4000+ GPU。无消费级卡(无 RTX 4090)。
A: 适合。租 H100/B200 实例,用你的框架微调,然后在同一实例上 serve 或快照镜像启动 serve 节点——完全控制,无按 token 微调加价。
A: 无关。Lambda(lambda.ai)是 GPU 云 / AI 基础设施公司,前身品牌 Lambda Labs;AWS Lambda 是亚马逊的无服务器函数产品。两者是无关的公司和产品。