CoreWeave (CoreWeave)

收录于 https://www.coreweave.com

综合排名 #14 ⭐ 可考虑
❌ 无中国大陆直连节点。数据中心集中在美国;2026 年已扩展至印尼(首个 APAC 节点)、英国(两个数据中心运营中)、瑞典。国内访问需代理,跨太平洋延迟较高。 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) GPU On-Demand hourly: NVIDIA HGX H100 $49.24, HGX H200 $50.44, HGX B200 $68.80, A100 80GB $21.60, L40S $18.00, L40 $10.00, GB200 NVL72 $42.00. Spot discounts: H100 $19.71, H200 $20.93, B200 $34.11, A100 $9.65. Serverless Inference is pay-per-token via W&B Inference; Dedicated Inference is GPU-hour / node-based. 每百万 tokens
输出 (Output) 每百万 tokens
💡 免费额度

无永久免费层。Serverless Inference 按 token 计费;GPU 实例按小时计费(On-Demand)或有 spot 折扣。0EM(零出口费迁移)计划在迁移阶段免除出口费。

🤖 支持模型(共 8 个)

NVIDIA HGX H100 ($49.24/hr), HGX H200 ($50.44/hr), HGX B200 ($68.80/hr), A100 80GB ($21.60/hr), L40S ($18.00/hr), L40 ($10.00/hr), GB200 NVL72 ($42.00/hr) — On-Demand/Spot GPU instances Serverless Inference (W&B Inference, pay-per-token): GLM 5.2, Kimi K2.6/K2.7, DeepSeek R1/V3, Llama 3.x, Qwen — OpenAI-compatible API Dedicated Inference: bring your own model weights on dedicated GPU infrastructure (H100, B200, A100) Inference on CKS (CoreWeave Kubernetes Service): full control over the serving stack

✨ 优势

  • Nasdaq 上市公司(CRWV),英伟达持股约 11%,「neocloud」头部玩家
  • 三大推理产品全部 OpenAI 兼容:Serverless(W&B Inference,按 token)、Dedicated(自带模型权重,GPU-小时)、CKS 上推理(完全掌控 serving 栈)
  • 知名客户:OpenAI(追加 $6.5B)、Anthropic(多年协议)、Meta($21B 扩展)、Perplexity、Runway、Jane Street($6B)、MasterClass(W&B Weave 追踪 AI 教学 agent)
  • MLPerf 训练/推理双纪录;2 分钟训练 DeepSeek V3;首个部署 NVIDIA Vera Rubin NVL72 与 GB300 NVL72
  • 0EM 零出口费迁移计划 + AI 对象存储 + Sandboxes(RL 训练)降低 AI 工作负载迁移与运行成本

⚠️ 不足

  • × 无中国大陆直连节点,国内生产部署需代理;亚太地区首个节点 2026 年才落地印尼
  • × GPU On-Demand 小时价偏高(H100 $49.24/hr 是很多自研端点之外的溢价选择);Serverless 按 token 价需在 W&B 目录查询,无统一量化表格
  • × 云控制台/文档较偏 Kubernetes 与专业 AI 工程团队,纯 API 小白上手门槛高于 OpenAI 等
  • × 容量/需求波动大,部分高需求 GPU(如 GB200)On-Demand 需等待或转 Capacity Plans/保留
  • × Serverless 推理生态依托 W&B(被 CoreWeave 收购)整合,独立于 CoreWeave 账号体系,认知成本略高

🎯 适合场景

需要 OpenAI 兼容推理 API + 底层 GPU 算力一体化(Serverless 按 token + Dedicated 自带模型 + CKS 全掌控)的 AI 团队;需要在 CoreWeave GPU 上训练/微调自己的模型然后以 OpenAI 兼容端点 serve 的团队;看重 MLPerf 性能纪录与英伟达最新平台(Vera Rubin NVL72、GB300)的企业;用量大、希望 0EM 免出口费迁移与自有对象存储的工程组织。

💰 价格与方案

资源计费单位价格备注
NVIDIA HGX H100(按需)每 GPU 小时$49.24Spot $19.71(约省 60%);推理单 GPU $6.16/hr
NVIDIA HGX H200(按需)每 GPU 小时$50.44Spot $20.93;推理单 GPU $6.31/hr
NVIDIA HGX B200(按需)每 GPU 小时$68.80Spot $34.11;推理单 GPU $8.60/hr
NVIDIA A100 80GB(按需)每 GPU 小时$21.60Spot $9.65;推理单 GPU $2.70/hr
NVIDIA L40S(按需)每 GPU 小时$18.00Spot $7.88;推理单 GPU $2.25/hr
NVIDIA L40(按需)每 GPU 小时$10.00Spot $6.27;推理单 GPU $1.25/hr
NVIDIA GB200 NVL72(按需)每 GPU 小时$42.00Spot 不可用;4-GPU Blackwell 超级芯片系统
Serverless Inference(W&B)按 tokenW&B 目录价按 token 付费,目录含 GLM 5.2、Kimi K2.6/K2.7、DeepSeek R1/V3、Llama、Qwen
Dedicated InferenceGPU-小时 / 节点合同价自带模型权重部署在专属 GPU;完整 gateway + 扩缩容控制
CKS 上推理GPU-小时 / 预留节点CKS 定价在 CoreWeave Kubernetes Service 上完全掌控 serving 栈
0EM 零出口费迁移迁移期免费$0 出口费免出口费、无锁定;专家引导迁移到 AI 对象存储

🔧 API 与开发者体验

  • API 风格: 三大推理产品全部暴露 OpenAI 兼容端点。现有 OpenAI 客户端库、agent 工具链只需最小改动即可接入。Dedicated Inference 通过 CoreWeave Inference 管理 API 配置(api.coreweave.com 上的 REST/JSON、HTTP/2 上的 gRPC,以及 Terraform provider)。
  • 部署方式: 三种 serve 模型的方式:Serverless Inference(CoreWeave 托管目录、自动扩缩容、无需管理基础设施)、Dedicated Inference(自带模型权重部署在专属 GPU 基础设施,完整控制 gateway、扩缩容和容量预留)、CKS 上推理(在 CoreWeave Kubernetes Service 上完全掌控 serving 栈、运行时和网络)。
  • NVIDIA GPU 访问: 按需提供 H100、H200、B200、A100、L40S、L40 和 GB200 NVL72,spot 折扣 40-60%。首个部署 NVIDIA Vera Rubin NVL72 和 GB300 NVL72 的云 — 抢先使用最新 NVIDIA 平台。
  • 模型目录(Serverless): CoreWeave 托管目录覆盖流行模型——GLM 5.2、Kimi K2.6/K2.7、DeepSeek R1/V3、Llama 3.x、Qwen——以及通过 Dedicated 部署任意目录模型或自带权重。MLPerf 纪录:CoreWeave 约 2 分钟训练 DeepSeek V3,并在 Kimi K2.6 的推理速度/价格表现上领先。
  • 训练 + 推理闭环: 与纯推理中转站不同,CoreWeave 让你在同一 GPU 集群上训练或微调(CKS、SUNK、Mission Control 可观测性),然后用 OpenAI 兼容端点 serve——缩小了自主 agent 改进的训练到推理差距。
  • Sandboxes / RL: CoreWeave Sandboxes(2026 年推出)加速强化学习 agent 工具使用和模型评估;还推出了 serverless RL 能力用于构建可靠的 RL 奖励系统。适合迭代 agent 的团队,而不仅是调用静态端点。
  • 存储与数据: AI 对象存储(每 GPU 2 GB/s 吞吐)、分布式文件存储和专属 VAST 存储。0EM(零出口费迁移)计划让你以零出口费、零锁定迁移进 CoreWeave。
  • 可观测性: Mission Control 提供集群生命周期控制器、节点生命周期控制器、可观测性、安全和审计可见性——规模 AI 的运营标准。Tensorizer 加速推理模型加载。
  • 限速与企业: 容量通过 On-Demand、Spot、Capacity Plans 或预留节点提供。高需求 GPU(如 GB200)可能需要等待名单或预留。与 OpenAI、Anthropic、Meta 和对冲基金 Jane Street 的企业协议表明容量规模强大。

🧠 GPU 原生训练到推理能力

CoreWeave 的决定性能力在于它是一家 GPU 原生的云,而非纯粹的推理 API 中转站。团队可以按需租用 NVIDIA H100/H200/B200 实例(或预留容量),在 CoreWeave Kubernetes Service(CKS)上用 Mission Control 可观测性训练或微调模型,然后用 OpenAI 兼容的推理端点 serve 同一个模型——Serverless(托管目录)或 Dedicated(自带权重)。这缩小了纯中转站如 OpenRouter 或 Portkey 无法提供的训练到推理闭环,因为 serve 发生在构建权重的同一 GPU 集群上。CoreWeave 在 MLPerf 训练(约 2 分钟训练 DeepSeek V3)和推理性价比(Kimi K2.6)上都领先,并且是首个部署 NVIDIA Vera Rubin NVL72 和 GB300 NVL72 的云。对 API 调用方而言,OpenAI 兼容界面意味着你可以先用托管目录模型做原型,之后无需任何客户端改动即可切换到运行自己微调的 Dedicated 端点。权衡:这种能力面向能操作 Kubernetes、能理解 GPU 容量的工程师,而不是面向前沿 API 的一行式替代品。

🌐 区域可用性与延迟

CoreWeave 是一家总部位于美国(新泽西州 Roseland)的 AI 云,数据中心集中在美国。2026 年它进行了国际扩张:两个英国数据中心已投入运营,宣布扩展至印尼作为其首个亚太节点,并通过与 Conapto 的合作在瑞典提供容量。没有中国大陆直连端点;Inference 管理 API 和控制台由美国前端区域提供。对于基于中国的生产部署,预计需要使用代理或具有本地存在的区域提供商。延迟方面,CoreWeave 针对北美和欧洲用户群做了优化:从亚洲跨太平洋请求美国区域通常增加 150-250ms 的首字节延迟,而阿里云百炼、字节火山引擎或 Cloudflare Workers AI 等区域提供商约 50-80ms。对于面向亚太用户的团队,2026 年的印尼扩展是缩短距离的第一步,但中国大陆延迟仍是一个因素。以训练到推理工作负载为主、锚定美国/欧洲的团队选择 CoreWeave;面向亚洲、对延迟敏感的流量选择区域提供商。