CoreWeave Cloud API 2026 评测:GPU 原生推理云
CoreWeave(coreweave.com)是一家总部位于美国的 AI 云(纳斯达克:CRWV),也是「neocloud」这个概念的典型代表——专为大规模 AI 训练和推理而建的算力提供商,而非通用 Web 负载云。与 OpenRouter 或 Portkey 这类纯推理中转站不同,CoreWeave 是 GPU 原生云:你可以按需租用(或预留)NVIDIA H100、H200、B200、A100、L40S 或 GB200 NVL72 实例,在 CoreWeave Kubernetes Service(CKS)上训练或微调模型,然后用 OpenAI 兼容端点 serve 同一个模型——Serverless Inference(托管目录)、Dedicated Inference(自带权重)或 CKS 上推理(完全掌控 serving 栈)。CoreWeave 在 MLPerf 训练与推理两端都领先(约 2 分钟训练 DeepSeek V3;Kimi K2.6 推理性价比第一),并且是首个部署 NVIDIA Vera Rubin NVL72 和 GB300 NVL72 的云。英伟达本身持有该公司约 11% 的股份。对 2026 年 8 月选择 AI 推理平台的工程师而言,CoreWeave 的关键价值在于:它是唯一在 OpenAI 兼容界面背后闭合 训练到推理闭环的主流云。完整对比见 CoreWeave 厂商页面,或对比 Nebius、RunPod、Hyperbolic。
CoreWeave 是什么?2026 年为什么 GPU 原生推理重要?
CoreWeave 最初是加密货币挖矿业务,在 AI 需求爆发时将 GPU 集群改用于 AI,成长为最大的独立 AI 云之一。它通过 IPO 上市,现以 CRWV 交易,英伟达持有约 11% 股份并深度绑定平台合作。公司的定位「The Essential Cloud for AI」反映了一个刻意的选择:不与超大规模云在通用云服务上竞争,而是专注于大规模 GPU 集群——H100、H200、B200、GB200 NVL72,以及即将到来的 Vera Rubin NVL72 和 GB300——加上运行前沿规模 AI 所需的存储、Kubernetes 编排(CKS)和可观测性(Mission Control)层。本文数据主要来自其 GPU 定价页 和 CoreWeave Inference 文档。
CoreWeave Inference:三种 OpenAI 兼容的模型 serve 方式
CoreWeave 的推理家族刻意分层,三个选项都暴露 OpenAI API 兼容端点,现有工具和 agent 只需最小代码改动即可接入:
- Serverless Inference(W&B):CoreWeave 通过 W&B Inference 交付 Serverless(CoreWeave 于 2025 年收购 Weights & Biases)。你从托管目录选模型——GLM 5.2、Kimi K2.6/K2.7、DeepSeek R1/V3、Llama 3.x、Qwen——CoreWeave 自动处理供给、扩缩容、路由和资源分配。按 token 以 W&B 目录价计费。
- Dedicated Inference:自带模型权重,部署在专属 GPU 基础设施上。你保留对 gateway、扩缩容和容量预留的完整控制,CoreWeave 管理底层集群。按 GPU-小时或节点合同计费。
- CKS 上推理:在 CoreWeave Kubernetes Service 上运行推理工作负载,完全掌控部署栈、运行时和网络。标准 CKS 计费(GPU-小时或预留节点)。
CoreWeave GPU 定价:按需、spot 与推理价
CoreWeave 按 GPU-小时对实例计费。按需列表价与 spot 折扣(2026 年 8 月公开定价页核实):
| GPU | 按需($/hr) | Spot($/hr) | 推理单 GPU($/hr) |
|---|---|---|---|
| NVIDIA HGX H100 | $49.24 | $19.71 | $6.16 |
| NVIDIA HGX H200 | $50.44 | $20.93 | $6.31 |
| NVIDIA HGX B200 | $68.80 | $34.11 | $8.60 |
| NVIDIA A100 80GB | $21.60 | $9.65 | $2.70 |
| NVIDIA L40S | $18.00 | $7.88 | $2.25 |
| NVIDIA L40 | $10.00 | $6.27 | $1.25 |
| NVIDIA GB200 NVL72 | $42.00 | N/A | — |
几点定价说明。按需 H100 $49.24/hr 是溢价,高于开发者友好的 GPU 云:RunPod 和 Hyperbolic 的 H100 突发/spot 价通常远低于此,L40/A100 是预算工作负载的落点。Spot 折扣约 40-60%(H100 $19.71/hr、H200 $20.93/hr、B200 $34.11/hr)让容量灵活的推理和训练便宜得多。Serverless Inference 没有按 GPU 的价格——通过 W&B 目录按 token 付费,CoreWeave 的 MLPerf 推理领先(Kimi K2.6 最快)意味着目录模型有领先的性价比。0EM(零出口费迁移)计划在迁移进 CoreWeave 时免除出口费且无锁定——对迁移大数据集或模型权重的团队是重要的成本杠杆。
对 API 调用方为何重要:训练到推理闭环
API 调用方应该了解 CoreWeave 的最强理由是 训练到推理闭环。纯中转站(OpenRouter、Portkey)只能把 token 路由到别人运行的模型。CoreWeave 让团队租用 GPU 容量、在 CKS 上训练或微调,然后用 OpenAI 兼容端点 serve 成品权重——Dedicated 用于可调度的预留部署,CKS 上推理用于完整栈控制。OpenAI 兼容界面意味着你可以先在 Serverless 上对托管目录模型做原型,之后零客户端改动切换到运行自己微调的 Dedicated 端点。这就是自主 agent 和前沿实验室团队(OpenAI、Anthropic、Meta、Jane Street、Flow Traders、做 AI 教学 agent 的 MasterClass)锚定 CoreWeave 的原因:做训练的同一 GPU 集群也做 serve,消除了把权重搬到独立推理提供商的数传和冷启动开销。
谁在 CoreWeave 上运行?对 API 团队意味着什么
客户列表是判断 CoreWeave 在 AI 栈中位置的清晰信号。OpenAI 把协议追加最高 $65 亿,说明连最大的前沿实验室也会考虑多元化的专属 AI 容量而不仅是超大规模云。Anthropic 签了多年协议;Meta 宣布 $21 亿扩展 AI 基础设施协议;Jane Street 承诺 $60 亿 AI 云协议;Perplexity 用 CoreWeave 跑推理;Runway 依赖它跑下一代 AI 视频模型;Flow Traders 为量化交易跑基础模型训练;MasterClass(2026 年 8 月宣布)用 CoreWeave Cloud 加 W&B Weave 追踪、监控和改进 AI 教学 agent。对 API 调用方这有两层意义:第一,它验证了 CoreWeave 是持久、资金充足的基础设施——可以托付生产负载,而不是会消失的项目;第二,前沿实验室和企业的高度集中意味着 CoreWeave 的 OpenAI 兼容界面在极端规模下经过了实战检验——从训练运行到高流量推理端点。
开发者体验:在 CoreWeave 上构建是什么感觉
开发者体验与零配置推理中转站差异巨大。因为 CoreWeave 是 Kubernetes 原生云,心智模型是「运维优先」:你供给 GPU 节点、管理集群(CKS)、配置网络和对象存储、用 Mission Control 做可观测性和节点生命周期。Serverless Inference 的体验则正常化——选目录模型、调 OpenAI 兼容端点、按 token 付费——这是大多数 API 调用方最合适的入口。但一旦你想跑自己的微调,就进入 Kubernetes 领域:启动 Dedicated Inference 部署或 CKS 工作负载、配置 gateway、考虑容量预留。这比中转站更强大、更灵活,但也带来真实的运维开销。Dedicated 或 CKS 没有超出按 GPU 按需价之外的公开列表价;企业定价是商谈的,高需求 GPU 如 GB200 可能需要等待名单或 Capacity Plans。Terraform provider 和 gRPC API 对以基础设施即代码方式管理 GPU 集群的团队是强信号。
谁该选 CoreWeave——谁不该
CoreWeave 不是每个 AI API 调用方的默认选择。选它如果:(a) 你训练或微调自己的模型,并想在同一个按 OpenAI 兼容端点 serve 的 GPU 集群上完成;(b) 你需要保证容量、最新英伟达平台(Vera Rubin NVL72、GB300)和 MLPerf 级性能的企业;(c) 你有 Kubernetes 专长,想要对 serving 栈和可观测性的第一方控制。跳过它如果:(a) 你只想用最少设置调用前沿或开源模型——纯消费场景 OpenRouter 或托管模型 API 更简单、按 token 更便宜;(b) 你需要低成本、开发者友好的 GPU 突发——RunPod 或 Hyperbolic 提供便宜得多的入门 H100/L40 价和按秒计费;(c) 你服务中国大陆的延迟敏感流量或需要区域端点——没有中国节点,跨太平洋延迟 150-250ms。CoreWeave 是溢价、企业级、GPU 原生的基础设施档位,不是廉价中转站的一行式替代品。
CoreWeave vs. Nebius、RunPod、Hyperbolic
这三个竞品从不同角度覆盖 GPU 云光谱。Nebius 也是带托管推理和训练栈的 AI 原生云,定位「AI 原生云」,欧美都有较强存在——比 CoreWeave 更接近企业抱负但规模更小、英伟达股权绑定没那么紧。RunPod 是开发者友好选项:serverless GPU pods、市场、按秒计费,突发任务比 CoreWeave 的按小时按需价便宜得多。Hyperbolic 是聚合闲置 GPU 的去中心化市场,入门价最低,但容量和企 业保证的可预测性较弱。CoreWeave 的定位是企业级、与英伟达对齐、抢先最新平台(Vera Rubin NVL72、GB300)、创 MLPerf 纪录——溢价档。重视保证容量、最新 NVIDIA 芯片和第一方训练到推理栈时选 CoreWeave;成本和突发灵活性主导时选 RunPod 或 Hyperbolic。
区域可用性与延迟
CoreWeave 的数据中心集中在美国,2026 年进行国际扩张——英国(两个运营中的数据中心)、印尼作为首个亚太节点、通过 Conapto 合作的瑞典。没有中国大陆直连端点。对于基于中国的生产,你需要代理或选择有本地存在的区域提供商。对延迟敏感的亚洲流量,到美国区域的跨太平洋请求通常增加 150-250ms 首字节延迟,而阿里云百炼、字节火山引擎或 Cloudflare Workers AI 等区域提供商约 50-80ms。服务亚太用户的团队应关注 CoreWeave 的印尼建设,但中国大陆延迟仍是决策因素。CoreWeave 最适合锚定美国/欧洲的训练到推理工作负载;面向亚洲、延迟关键的流量选择区域提供商。
CoreWeave 常见问题
A:两者都是。它是 GPU 原生云,但推理家族(Serverless、Dedicated、CKS)都暴露 OpenAI 兼容端点,所以既作为 AI API 提供商服务目录模型,也出租原始 GPU 容量用于训练和微调。
A:目录模型用 Serverless Inference 按 token 付费——无闲置 GPU 成本,CoreWeave 的 MLPerf 推理领先让 Kimi K2.6 等模型有很强的性价比。自有权重用 Dedicated 或 CKS 上的 spot GPU 实例(比按需省 40-60%)最便宜。
A:CoreWeave 的 0EM(零出口费迁移)计划在迁移进平台时免除出口费且无锁定,AI 对象存储包含原生高吞吐访问。这与按 GB 收出口费的云不同,是一个差异点。
A:H100、H200、B200、A100 80GB、L40S、L40 和 GB200 NVL72 按需提供并可 spot 折扣;另有抢先的 NVIDIA Vera Rubin NVL72 和 GB300 NVL72——CoreWeave 是首个部署这两者的云。
A:适合。在 CKS 上用 Mission Control 可观测性训练或微调,然后用 OpenAI 兼容的 Dedicated 或 CKS 端点 serve 结果——无需模型迁移步骤,在同一 GPU 集群上闭合训练到推理闭环。