Anyscale (Anyscale)

收录于 https://endpoints.anyscale.com

综合排名 #17 ⭐ 可考虑
❌ 需代理 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Llama 3.3 70B: $0.39/M, DeepSeek-R1: $1/M, Mixtral 8x22B: $0.90/M 每百万 tokens
输出 (Output) Llama 3.3 70B: $0.39/M, DeepSeek-R1: $1/M, Mixtral 8x22B: $0.90/M 每百万 tokens
💡 免费额度

新用户 $100 免费额度(一次性),另提供少量项目启动额度($3-$5)

🤖 支持模型(共 20 个)

Llama 3.3 70B Llama 3.1 405B Mixtral 8x22B DeepSeek-R1 CodeLlama 70B Qwen 2.5 72B

✨ 优势

  • Llama 3.3 70B 仅 $0.39/M tokens 具竞争力
  • 基于 Ray 分布式框架,高可用
  • 统一的 API 接口
  • 支持 Function Calling
  • 企业级 SLA 与支持

⚠️ 不足

  • × 国内需要代理访问
  • × 模型种类有限(以开源模型为主)
  • × UI/UX 偏技术向
  • × 品牌知名度不如 Together AI
  • × Ray 生态的复杂性可能影响使用体验

🎯 适合场景

AI 应用开发者需要稳定的开源模型端点;Ray 生态用户;对性价比有要求的企业用户

💰 价格与方案

模型 / 资源价格计费方式备注
Llama 3.3 70B$0.39 / 100万 token按 token(输入+输出)Anyscale Endpoints 上颇具竞争力的开源权重推理
DeepSeek-R1$1.00 / 100万 token按 token(输入+输出)高性价比的推理模型
Mixtral 8x22B$0.90 / 100万 token按 token(输入+输出)适用于通用对话负载的 MoE 模型
纯 CPU 实例$0.0135 / 小时按加速器最便宜的 Ray 计算档位
NVIDIA T4$0.5682 / 小时按加速器小型推理负载的入门 GPU
NVIDIA A10G$1.3635 / 小时按加速器中档 GPU,成本与吞吐的平衡
NVIDIA A100$4.9591 / 小时按加速器大内存 GPU,适用于更大模型与训练
新用户额度$100 免费一次性注册时一次性发放

🔧 API 与开发者体验

  • API 接口: Anyscale Endpoints 通过 OpenAI 兼容的 HTTP API 提供无服务器推理(聊天补全 + 嵌入)。同一接口也可服务于 Anyscale Platform 上的 Ray 任务,让你无需更换技术栈即可在托管推理与 Ray 分布式计算之间切换。
  • 模型: 端点目录以开源权重模型为主:Llama 3.3 70B、Llama 3.1 405B、Mixtral 8x22B、DeepSeek-R1、CodeLlama 70B 与 Qwen 2.5 72B。收购后,更新的第三方旗舰模型通过 Nscale 的 Inference Endpoints(「通过 API 运行模型」)提供。
  • Ray 集成: Anyscale 的差异化在于 Ray——你可以用 @ray.remote 将单个 Python 脚本从笔记本扩展到多节点 GPU 集群。平台在 Ray 之上提供托管调度、自动扩缩与可观测性,用于分布式训练与批量推理。
  • SDK 与工具链: 基于 Ray 的一流 Python SDK;OpenAI Python SDK 也可通过将 base_url 指向 Anyscale 端点用于接口。提供 Notebook 与代码模板,覆盖 LLM 微调、批量推理与多模态负载。
  • 部署选项: Hosted(全托管,无需配置)或 Bring-Your-Own-Cloud(BYOC,在你自己的 VPC 内,支持 AWS/GCP/Azure 或本地)。Hosted 按月计费;BYOC 可通过云市场开票。
  • 认证: 从 Anyscale 控制台获取 API key + token,Python SDK 通过环境变量读取。项目级 key 限定访问范围,控制台支持团队成员与用量看板。
  • 限速与 SLA: 企业级 SLA 提供 24x7 支持与无限制工单;较低档位仅工作时间支持并有工单上限。托管档位按用量计费,无月度最低要求。

🧠 Ray 与 Nscale 收购

Anyscale 的标志性资产是 Ray,这个事实上的 AI 开源分布式计算引擎已部署到几乎所有主流云平台。2026 年 7 月 30 日,英伟达支持的英国 neocloud 厂商 Nscale 同意以约 16.5 亿美元收购 Anyscale,将 Endpoints 与 Ray 平台并入 Nscale 的全栈 AI 云(数据中心覆盖挪威、英国、德州与葡萄牙)。官方目标是多云中立:Ray 负载现在可同时运行在 Nscale 自有的 NVIDIA 基础设施以及 AWS/GCP/Azure 上,为团队提供一个跨厂商统一的 Ray 控制平面。对开发者而言,近期实际影响是连续性——Anyscale 的 API、SDK 与定价保持不变——外加一条更深的路径:当 Ray 任务超出托管档位时,可进入 Nscale 的托管 Slurm、Kubernetes Service 与 Inference Endpoints。

🌐 区域可用性与延迟

Anyscale 是美国公司,API 从托管区域以及你自己的云(BYOC)VPC 提供服务,延迟取决于你部署的区域。中国大陆无直连端点,也无官方中国访问计划,因此中国生产环境需要稳定的海外代理或前置 Anyscale API 的聚合器。在 Nscale 收购后,基础设施扩展到北欧、英国、德州与葡萄牙的 Nscale 数据中心,缩短了欧盟与美国东部负载的延迟,并为需要数据驻留的企业提供了主权 AI 选项。面向中国终端用户的团队应为代理基础设施预留预算,并评估国产开源权重端点(如阿里百炼或腾讯混元)作为延迟敏感推理的备用方案。