CoreWeave (CoreWeave)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | GPU On-Demand hourly: NVIDIA HGX H100 $49.24, HGX H200 $50.44, HGX B200 $68.80, A100 80GB $21.60, L40S $18.00, L40 $10.00, GB200 NVL72 $42.00. Spot discounts: H100 $19.71, H200 $20.93, B200 $34.11, A100 $9.65. Serverless Inference is pay-per-token via W&B Inference; Dedicated Inference is GPU-hour / node-based. | 每百万 tokens |
| 输出 (Output) | 每百万 tokens |
无永久免费层。Serverless Inference 按 token 计费;GPU 实例按小时计费(On-Demand)或有 spot 折扣。0EM(零出口费迁移)计划在迁移阶段免除出口费。
🤖 支持模型(共 8 个)
✨ 优势
- ✓ Nasdaq 上市公司(CRWV),英伟达持股约 11%,「neocloud」头部玩家
- ✓ 三大推理产品全部 OpenAI 兼容:Serverless(W&B Inference,按 token)、Dedicated(自带模型权重,GPU-小时)、CKS 上推理(完全掌控 serving 栈)
- ✓ 知名客户:OpenAI(追加 $6.5B)、Anthropic(多年协议)、Meta($21B 扩展)、Perplexity、Runway、Jane Street($6B)、MasterClass(W&B Weave 追踪 AI 教学 agent)
- ✓ MLPerf 训练/推理双纪录;2 分钟训练 DeepSeek V3;首个部署 NVIDIA Vera Rubin NVL72 与 GB300 NVL72
- ✓ 0EM 零出口费迁移计划 + AI 对象存储 + Sandboxes(RL 训练)降低 AI 工作负载迁移与运行成本
⚠️ 不足
- × 无中国大陆直连节点,国内生产部署需代理;亚太地区首个节点 2026 年才落地印尼
- × GPU On-Demand 小时价偏高(H100 $49.24/hr 是很多自研端点之外的溢价选择);Serverless 按 token 价需在 W&B 目录查询,无统一量化表格
- × 云控制台/文档较偏 Kubernetes 与专业 AI 工程团队,纯 API 小白上手门槛高于 OpenAI 等
- × 容量/需求波动大,部分高需求 GPU(如 GB200)On-Demand 需等待或转 Capacity Plans/保留
- × Serverless 推理生态依托 W&B(被 CoreWeave 收购)整合,独立于 CoreWeave 账号体系,认知成本略高
🎯 适合场景
需要 OpenAI 兼容推理 API + 底层 GPU 算力一体化(Serverless 按 token + Dedicated 自带模型 + CKS 全掌控)的 AI 团队;需要在 CoreWeave GPU 上训练/微调自己的模型然后以 OpenAI 兼容端点 serve 的团队;看重 MLPerf 性能纪录与英伟达最新平台(Vera Rubin NVL72、GB300)的企业;用量大、希望 0EM 免出口费迁移与自有对象存储的工程组织。
💰 价格与方案
| 资源 | 计费单位 | 价格 | 备注 |
|---|---|---|---|
| NVIDIA HGX H100(按需) | 每 GPU 小时 | $49.24 | Spot $19.71(约省 60%);推理单 GPU $6.16/hr |
| NVIDIA HGX H200(按需) | 每 GPU 小时 | $50.44 | Spot $20.93;推理单 GPU $6.31/hr |
| NVIDIA HGX B200(按需) | 每 GPU 小时 | $68.80 | Spot $34.11;推理单 GPU $8.60/hr |
| NVIDIA A100 80GB(按需) | 每 GPU 小时 | $21.60 | Spot $9.65;推理单 GPU $2.70/hr |
| NVIDIA L40S(按需) | 每 GPU 小时 | $18.00 | Spot $7.88;推理单 GPU $2.25/hr |
| NVIDIA L40(按需) | 每 GPU 小时 | $10.00 | Spot $6.27;推理单 GPU $1.25/hr |
| NVIDIA GB200 NVL72(按需) | 每 GPU 小时 | $42.00 | Spot 不可用;4-GPU Blackwell 超级芯片系统 |
| Serverless Inference(W&B) | 按 token | W&B 目录价 | 按 token 付费,目录含 GLM 5.2、Kimi K2.6/K2.7、DeepSeek R1/V3、Llama、Qwen |
| Dedicated Inference | GPU-小时 / 节点 | 合同价 | 自带模型权重部署在专属 GPU;完整 gateway + 扩缩容控制 |
| CKS 上推理 | GPU-小时 / 预留节点 | CKS 定价 | 在 CoreWeave Kubernetes Service 上完全掌控 serving 栈 |
| 0EM 零出口费迁移 | 迁移期免费 | $0 出口费 | 免出口费、无锁定;专家引导迁移到 AI 对象存储 |
🔧 API 与开发者体验
- •API 风格: 三大推理产品全部暴露 OpenAI 兼容端点。现有 OpenAI 客户端库、agent 工具链只需最小改动即可接入。Dedicated Inference 通过 CoreWeave Inference 管理 API 配置(api.coreweave.com 上的 REST/JSON、HTTP/2 上的 gRPC,以及 Terraform provider)。
- •部署方式: 三种 serve 模型的方式:Serverless Inference(CoreWeave 托管目录、自动扩缩容、无需管理基础设施)、Dedicated Inference(自带模型权重部署在专属 GPU 基础设施,完整控制 gateway、扩缩容和容量预留)、CKS 上推理(在 CoreWeave Kubernetes Service 上完全掌控 serving 栈、运行时和网络)。
- •NVIDIA GPU 访问: 按需提供 H100、H200、B200、A100、L40S、L40 和 GB200 NVL72,spot 折扣 40-60%。首个部署 NVIDIA Vera Rubin NVL72 和 GB300 NVL72 的云 — 抢先使用最新 NVIDIA 平台。
- •模型目录(Serverless): CoreWeave 托管目录覆盖流行模型——GLM 5.2、Kimi K2.6/K2.7、DeepSeek R1/V3、Llama 3.x、Qwen——以及通过 Dedicated 部署任意目录模型或自带权重。MLPerf 纪录:CoreWeave 约 2 分钟训练 DeepSeek V3,并在 Kimi K2.6 的推理速度/价格表现上领先。
- •训练 + 推理闭环: 与纯推理中转站不同,CoreWeave 让你在同一 GPU 集群上训练或微调(CKS、SUNK、Mission Control 可观测性),然后用 OpenAI 兼容端点 serve——缩小了自主 agent 改进的训练到推理差距。
- •Sandboxes / RL: CoreWeave Sandboxes(2026 年推出)加速强化学习 agent 工具使用和模型评估;还推出了 serverless RL 能力用于构建可靠的 RL 奖励系统。适合迭代 agent 的团队,而不仅是调用静态端点。
- •存储与数据: AI 对象存储(每 GPU 2 GB/s 吞吐)、分布式文件存储和专属 VAST 存储。0EM(零出口费迁移)计划让你以零出口费、零锁定迁移进 CoreWeave。
- •可观测性: Mission Control 提供集群生命周期控制器、节点生命周期控制器、可观测性、安全和审计可见性——规模 AI 的运营标准。Tensorizer 加速推理模型加载。
- •限速与企业: 容量通过 On-Demand、Spot、Capacity Plans 或预留节点提供。高需求 GPU(如 GB200)可能需要等待名单或预留。与 OpenAI、Anthropic、Meta 和对冲基金 Jane Street 的企业协议表明容量规模强大。
🧠 GPU 原生训练到推理能力
CoreWeave 的决定性能力在于它是一家 GPU 原生的云,而非纯粹的推理 API 中转站。团队可以按需租用 NVIDIA H100/H200/B200 实例(或预留容量),在 CoreWeave Kubernetes Service(CKS)上用 Mission Control 可观测性训练或微调模型,然后用 OpenAI 兼容的推理端点 serve 同一个模型——Serverless(托管目录)或 Dedicated(自带权重)。这缩小了纯中转站如 OpenRouter 或 Portkey 无法提供的训练到推理闭环,因为 serve 发生在构建权重的同一 GPU 集群上。CoreWeave 在 MLPerf 训练(约 2 分钟训练 DeepSeek V3)和推理性价比(Kimi K2.6)上都领先,并且是首个部署 NVIDIA Vera Rubin NVL72 和 GB300 NVL72 的云。对 API 调用方而言,OpenAI 兼容界面意味着你可以先用托管目录模型做原型,之后无需任何客户端改动即可切换到运行自己微调的 Dedicated 端点。权衡:这种能力面向能操作 Kubernetes、能理解 GPU 容量的工程师,而不是面向前沿 API 的一行式替代品。
🌐 区域可用性与延迟
CoreWeave 是一家总部位于美国(新泽西州 Roseland)的 AI 云,数据中心集中在美国。2026 年它进行了国际扩张:两个英国数据中心已投入运营,宣布扩展至印尼作为其首个亚太节点,并通过与 Conapto 的合作在瑞典提供容量。没有中国大陆直连端点;Inference 管理 API 和控制台由美国前端区域提供。对于基于中国的生产部署,预计需要使用代理或具有本地存在的区域提供商。延迟方面,CoreWeave 针对北美和欧洲用户群做了优化:从亚洲跨太平洋请求美国区域通常增加 150-250ms 的首字节延迟,而阿里云百炼、字节火山引擎或 Cloudflare Workers AI 等区域提供商约 50-80ms。对于面向亚太用户的团队,2026 年的印尼扩展是缩短距离的第一步,但中国大陆延迟仍是一个因素。以训练到推理工作负载为主、锚定美国/欧洲的团队选择 CoreWeave;面向亚洲、对延迟敏感的流量选择区域提供商。