Crusoe Cloud (Crusoe)

收录于 https://crusoe.ai

综合排名 #23 ⭐ 可考虑
❌ 无中国大陆直连节点。托管推理 API 托管于 Crusoe 美国数据中心(Colorado / Texas 等);国内访问需代理。 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Pay-as-you-go per 1M tokens, four tiers by parameter count: <16B ($0.40) / 16B-70B ($2.50) / 70B-300B ($6.00) / >300B ($10.00). Serverless Fine-Tuning follows identical 4-tier structure. Managed Inference spans DeepSeek V3/V4 Pro/V4 Flash, GLM 5.1/5.2, GPT-OSS 20B/120B, Gemma 4 31B-it, Kimi K2.6, Llama 3.1/3.3, Nemotron 3 family (VoiceChat/Ultra/Lightning/Nano/Super/Nano Omni), Qwen3 family (8B/235B/Qwen3.5/Qwen3.6), Yutori n1.5. Cached tokens at $0.03-$1.50 per 1M. 每百万 tokens
输出 (Output) Self-Serve Deployments: NVIDIA H100 80GB HGX $5.50/hr, NVIDIA H200 141GB HGX $6.00/hr (dedicated endpoints for open + fine-tuned models). Tailored Deployments and Provisioned Throughput via sales engagement. Managed Kubernetes $0.10/cluster hour; Container Registry $0.10/GiB-month; Object Storage $0.06/GiB-month. 每百万 tokens
💡 免费额度

无永久免费层;按使用量计费;可联系销售获取批量折扣。Serverless Fine-Tuning 四档起价 $0.40/M tokens。

🤖 支持模型(共 17 个)

DeepSeek V3 0324 (legacy frontier: $0.50 input / $1.50 output per 1M tokens) DeepSeek V4 Flash (efficient frontier: $0.14 input / $0.28 output per 1M tokens, 70B tier) DeepSeek V4 Pro (flagship agent model: $1.74 input / $3.48 output per 1M tokens, cached $0.15) GPT-OSS 20B / 120B (OpenAI open weights: $0.05/$0.20 and $0.05/$0.20 per 1M) Gemma 4 31B-it (Google open: $0.14 input / $0.40 output per 1M, cached $0.14) GLM 5.1 / GLM 5.2 (Zhipu flagship + flagship+ on H200 clusters) Kimi K2.6 (Moonshot flagship: $0.70 input / $3.50 output per 1M) Llama 3.3 70B Instruct (Meta: $0.25/$0.75 per 1M) Llama 3.1 8B Instruct (Meta entry) Nemotron 3 family (NVIDIA: VoiceChat / Ultra 550B / 3.5 Lightning / 3 Nano / 3 Super / Nano Omni 30B) Qwen3 family (Alibaba: 8B / 235B A22B Instruct 2507 / Qwen3.5 2B+9B / Qwen3.6 35B A3B) Yutori n1.5 (premium niche model)

✨ 优势

  • MemoryAlloy™ 技术:cluster-native KV cache + 推测解码 + 动态 batching,官方数据首 token 时间快 9.9 倍、吞吐量高 5 倍
  • 4 档统一托管推理定价(<16B / 16B-70B / 70B-300B / >300B),开发者只需按模型规模选档位,无需逐个对比 17+ 模型价格表
  • 17+ 开源旗舰模型托管:DeepSeek V3/V4 Pro/V4 Flash、GPT-OSS 20B/120B、Gemma 4、GLM 5.1/5.2、Kimi K2.6、Llama 3.1/3.3、Nemotron 3 全家、Qwen3 全家、Yutori n1.5
  • OpenAI 兼容 API + MemoryAlloy 集群 KV 缓存 — 切换 OpenAI 客户端零代码改动,自带前缀缓存复用
  • 2026 年估值 $30B(Bloomberg 7月 2日报道),$3B 新一轮融资中;6 月 Pydantic AI 原生集成 Crusoe 作为模型供应商

⚠️ 不足

  • × 无中国大陆直连节点,国内生产部署需代理
  • × 4 档统一定价虽简化决策,但<16B 档 $0.40/M tokens 对超小模型偏贵(Qwen3.5 2B 比 Together AI 等更便宜档位贵 ~2-3x)
  • × OpenAI 兼容性是 API 表面,prompt cache / system message 等高级行为可能与官方 OpenAI 略有差异,需 PoC 验证
  • × Tailored Deployments / Provisioned Throughput 必须联系销售,无透明价格
  • × Serverless Fine-Tuning 是新增能力(7 月推出),稳定性与微调效果生态还在早期

🎯 适合场景

需要 OpenAI 兼容 API + 跨多家开源旗舰模型统一计费 + 集群级 KV 缓存复用的团队;Multi-agent / RAG 系统需要 prefix-cache 命中率高的生产推理;已经在用 OpenAI/Anthropic 但想用 DeepSeek V4 Pro、Qwen3 235B、GLM 5.2、Kimi K2.6 等开源前沿模型做 fallback;AI 实验室需要 Self-Serve Deployments(H100/H200 独立小时计费)做研究/benchmark;预算敏感型生产负载(4 档统一定价简单透明);Jun 12 起 Pydantic AI 原生集成用户

💰 价格与方案

服务档位计费单位价格备注
托管推理 — <16B 参数每 1M tokens$0.40Qwen3.5 2B/9B、Llama 3.1 8B、Qwen3 8B — 缓存输入另行计费
托管推理 — 16B-70B 参数每 1M tokens$2.50Nemotron 3.5 Lightning、GPT-OSS 20B、Qwen3.6 35B A3B、Gemma 4 31B-it
托管推理 — 70B-300B 参数每 1M tokens$6.00Llama 3.3 70B Instruct、GPT-OSS 120B、Qwen3 235B A22B Instruct 2507、DeepSeek V4 Flash(输入/输出分开,缓存 $0.03-0.15)
托管推理 — >300B 参数每 1M tokens$10.00GLM 5.2 — 开源旗舰档
DeepSeek V4 Pro(特定价格)每 1M 输入/输出/缓存$1.74 / $3.48 / $0.15最贵的单模型;agent 旗舰定价
DeepSeek V4 Flash(特定价格)每 1M 输入/输出/缓存$0.14 / $0.28 / $0.0370B+ 档最便宜 — 高效旗舰模型
Kimi K2.6(特定价格)每 1M 输入/输出$0.70 / $3.50缓存 $0.35;具体模型在档位之上另定价
GPT-OSS 120B(特定价格)每 1M 输入/输出/缓存$0.05 / $0.20 / $0.0570B+ 档最低列表价
Serverless 微调 — <16B / 16B-70B / 70B-300B / >300B每 1M tokens$0.40 / $2.50 / $6.00 / $10.00与推理同样的 4 档结构 — 2026 年 7 月推出
自托管部署 — NVIDIA H100 80GB HGX每 GPU 小时$5.50用于开源 + 微调模型的专属端点
自托管部署 — NVIDIA H200 141GB HGX每 GPU 小时$6.00更大显存档,适合大模型
Tailored Deployments合同联系销售最高级别优化 + 基准测试端点
Provisioned ThroughputAI Model Units (AMU)联系销售保证吞吐量,承诺越长越便宜
托管 Kubernetes — 集群每集群小时$0.10用于 GPU + CPU 上的 AI 应用部署
容器镜像存储每 GiB / 月$0.10按区域的容器镜像存储
对象存储每 GiB / 月$0.06数据集 / 模型权重存储
计费最小粒度GPU 计算按分钟无设置费、无隐藏成本、无预付承诺

🔧 API 与开发者体验

  • API 风格: 托管推理采用 OpenAI 兼容 REST API(POST /v1/chat/completions + /v1/completions + /v1/embeddings)。现有 OpenAI / Anthropic SDK 客户端只需修改 base URL 和 API key 即可指向 Crusoe,无需重写代码。8 月 12 日确认 Pydantic AI 原生集成(PydanticAI SDK 将 Crusoe 列为一级模型提供商)。
  • 模型目录: 托管推理上有 17+ 开源权重模型(2026 年 8 月):DeepSeek V3 0324、V4 Pro、V4 Flash;GLM 5.1 / 5.2;GPT-OSS 20B / 120B;Gemma 4 31B-it;Kimi K2.6;Llama 3.1 8B Instruct、3.3 70B Instruct;Nemotron 3 VoiceChat、Ultra 550B、3.5 Lightning、3 Nano、3 Nano Omni 30B、3 Super 120B;Qwen3 8B、235B A22B Instruct 2507、Qwen3.5 2B/9B、Qwen3.6 35B A3B;Yutori n1.5。
  • MemoryAlloy™ 技术: 跨节点持久化的集群原生内存结构,配合集群级 KV 缓存跨请求复用。Crusoe 官方数据:通过推测解码 + 动态 batching,首 token 时间快 9.9 倍、吞吐量高 5 倍。专为长上下文 RAG / agent 工作负载的 prefix-cache 自动命中而设计。
  • Serverless 推理: 托管推理完全 serverless — 无需容量规划、无 warm-up、无闲置 GPU 成本。每个请求自动路由到适配模型的最低档位。按 token 计费,无月最低消费。
  • Serverless 微调(2026 年 7 月): 4 档按使用量计费的微调,与推理相同的参数量定价($0.40 / $2.50 / $6.00 / $10.00 每 1M tokens)。用专有数据定制开源模型,无需搭建 GPU 集群。生态仍处于早期 — 微调结果质量基准测试有限。
  • 自托管部署: 几分钟内为任意开源或微调模型启动专属端点,无需销售参与。NVIDIA H100 80GB HGX $5.50/GPU-小时,NVIDIA H200 141GB HGX $6.00/GPU-小时。最适合需要可基准测试、可复现延迟和专属容量的 AI 实验室。
  • Tailored Deployments + Provisioned Throughput: 销售接触档位提供最高级别优化(自定义基准测试端点 + 带入自有模型)和预留 AI Model Units (AMUs) 以保证吞吐量。承诺越长单价越低。无公开列表价。
  • 对象存储 + 容器镜像仓库: 对象存储 $0.06/GiB-月用于数据集和模型权重;容器镜像仓库 $0.10/GiB-月。托管 Kubernetes $0.10/集群-小时,将 GPU + CPU 资源上的 AI 应用部署整合在一起。
  • 定价可预测性: 托管推理按 token 计费(无小时预订)+ Self-Serve GPU 按分钟计费(无闲置浪费)= 两种部署模式成本都透明。4 档定价规则意味着从模型名称估算花费只需知道其参数量,无需逐个查询单独模型价格。
  • 限速与错误处理: 标准 HTTP 429 + Retry-After;上下文长度 / token 预算 / 模型未找到 / 配额超限等场景均有详细错误码。限速阈值随花费调整 — 高消费客户通过 Tailored Deployments 获得更高上限。

🧠 MemoryAlloy 与开源模型推理能力

Crusoe 的旗舰产品是面向开源权重模型的托管推理,由其专有的集群编排层 MemoryAlloy™ 驱动。与把 KV 缓存放在单实例 GPU 内存的超大规模 LLM 端点不同,MemoryAlloy 持久化集群级 KV 缓存,并通过智能路由在多个请求共享系统提示词时消除冗余的 prefill 计算。结合推测解码和动态 batching,Crusoe 报告相比朴素的单实例部署首 token 时间最多快 9.9 倍、吞吐量高 5 倍。17+ 模型目录覆盖整个开源权重前沿 — DeepSeek V4 Pro 和 V4 Flash 用于 agent 工作负载,GPT-OSS 120B 用于预算有限的 70B+ 推理,Qwen3 235B A22B Instruct 在 MoE 甜蜜点,Kimi K2.6 提供 Moonshot 品质,GLM 5.2 用于 >300B 档,加上全 Llama 3.x、Gemma 4 和 Nemotron 3 系列。对运行长共享上下文的多 agent 或 RAG 系统的团队而言,MemoryAlloy 是单一最大的技术差异化点 — 同样的工作负载在 Together AI 或 Fireworks AI 上每次请求都要支付完整 prefill 成本。

🌐 区域可用性与延迟

Crusoe 是总部位于美国的 AI 基础设施公司(旧金山总部),数据中心运营集中在美国(科罗拉多、得克萨斯以及其他 Crusoe AI 工厂概念使用的地方 — 专为把搁置能源转化为 AI 算力而建设的设施)。托管推理公共 API 由这些美国区域提供;截至 2026 年 8 月,没有中国大陆直连节点,也没有宣布 APAC 或 EU 区域扩张。基于中国的生产部署需要海外代理或在具有本地存在的其他提供商上运行 Self-Serve Deployments。延迟方面,托管推理针对北美 + 欧洲用户群做了优化;从亚洲跨太平洋请求美国 Crusoe 区域通常首字节延迟 150-250ms,而 Cloudflare Workers AI、阿里云百炼、字节火山引擎等区域提供商约 50-80ms。对这些区域的团队而言,MemoryAlloy 的集群缓存收益无法抵消网络成本 — 应选择区域提供商。