Anyscale (Anyscale)
综合排名 #17 ⭐ 可考虑
❌ 需代理 | 🌍 国际
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Llama 3.3 70B: $0.39/M, DeepSeek-R1: $1/M, Mixtral 8x22B: $0.90/M | 每百万 tokens |
| 输出 (Output) | Llama 3.3 70B: $0.39/M, DeepSeek-R1: $1/M, Mixtral 8x22B: $0.90/M | 每百万 tokens |
💡 免费额度
新用户 $100 免费额度(一次性),另提供少量项目启动额度($3-$5)
🤖 支持模型(共 20 个)
Llama 3.3 70B Llama 3.1 405B Mixtral 8x22B DeepSeek-R1 CodeLlama 70B Qwen 2.5 72B
✨ 优势
- ✓ Llama 3.3 70B 仅 $0.39/M tokens 具竞争力
- ✓ 基于 Ray 分布式框架,高可用
- ✓ 统一的 API 接口
- ✓ 支持 Function Calling
- ✓ 企业级 SLA 与支持
⚠️ 不足
- × 国内需要代理访问
- × 模型种类有限(以开源模型为主)
- × UI/UX 偏技术向
- × 品牌知名度不如 Together AI
- × Ray 生态的复杂性可能影响使用体验
🎯 适合场景
AI 应用开发者需要稳定的开源模型端点;Ray 生态用户;对性价比有要求的企业用户
💰 价格与方案
| 模型 / 资源 | 价格 | 计费方式 | 备注 |
|---|---|---|---|
| Llama 3.3 70B | $0.39 / 100万 token | 按 token(输入+输出) | Anyscale Endpoints 上颇具竞争力的开源权重推理 |
| DeepSeek-R1 | $1.00 / 100万 token | 按 token(输入+输出) | 高性价比的推理模型 |
| Mixtral 8x22B | $0.90 / 100万 token | 按 token(输入+输出) | 适用于通用对话负载的 MoE 模型 |
| 纯 CPU 实例 | $0.0135 / 小时 | 按加速器 | 最便宜的 Ray 计算档位 |
| NVIDIA T4 | $0.5682 / 小时 | 按加速器 | 小型推理负载的入门 GPU |
| NVIDIA A10G | $1.3635 / 小时 | 按加速器 | 中档 GPU,成本与吞吐的平衡 |
| NVIDIA A100 | $4.9591 / 小时 | 按加速器 | 大内存 GPU,适用于更大模型与训练 |
| 新用户额度 | $100 免费 | 一次性 | 注册时一次性发放 |
🔧 API 与开发者体验
- •API 接口: Anyscale Endpoints 通过 OpenAI 兼容的 HTTP API 提供无服务器推理(聊天补全 + 嵌入)。同一接口也可服务于 Anyscale Platform 上的 Ray 任务,让你无需更换技术栈即可在托管推理与 Ray 分布式计算之间切换。
- •模型: 端点目录以开源权重模型为主:Llama 3.3 70B、Llama 3.1 405B、Mixtral 8x22B、DeepSeek-R1、CodeLlama 70B 与 Qwen 2.5 72B。收购后,更新的第三方旗舰模型通过 Nscale 的 Inference Endpoints(「通过 API 运行模型」)提供。
- •Ray 集成: Anyscale 的差异化在于 Ray——你可以用 @ray.remote 将单个 Python 脚本从笔记本扩展到多节点 GPU 集群。平台在 Ray 之上提供托管调度、自动扩缩与可观测性,用于分布式训练与批量推理。
- •SDK 与工具链: 基于 Ray 的一流 Python SDK;OpenAI Python SDK 也可通过将 base_url 指向 Anyscale 端点用于接口。提供 Notebook 与代码模板,覆盖 LLM 微调、批量推理与多模态负载。
- •部署选项: Hosted(全托管,无需配置)或 Bring-Your-Own-Cloud(BYOC,在你自己的 VPC 内,支持 AWS/GCP/Azure 或本地)。Hosted 按月计费;BYOC 可通过云市场开票。
- •认证: 从 Anyscale 控制台获取 API key + token,Python SDK 通过环境变量读取。项目级 key 限定访问范围,控制台支持团队成员与用量看板。
- •限速与 SLA: 企业级 SLA 提供 24x7 支持与无限制工单;较低档位仅工作时间支持并有工单上限。托管档位按用量计费,无月度最低要求。
🧠 Ray 与 Nscale 收购
Anyscale 的标志性资产是 Ray,这个事实上的 AI 开源分布式计算引擎已部署到几乎所有主流云平台。2026 年 7 月 30 日,英伟达支持的英国 neocloud 厂商 Nscale 同意以约 16.5 亿美元收购 Anyscale,将 Endpoints 与 Ray 平台并入 Nscale 的全栈 AI 云(数据中心覆盖挪威、英国、德州与葡萄牙)。官方目标是多云中立:Ray 负载现在可同时运行在 Nscale 自有的 NVIDIA 基础设施以及 AWS/GCP/Azure 上,为团队提供一个跨厂商统一的 Ray 控制平面。对开发者而言,近期实际影响是连续性——Anyscale 的 API、SDK 与定价保持不变——外加一条更深的路径:当 Ray 任务超出托管档位时,可进入 Nscale 的托管 Slurm、Kubernetes Service 与 Inference Endpoints。
🌐 区域可用性与延迟
Anyscale 是美国公司,API 从托管区域以及你自己的云(BYOC)VPC 提供服务,延迟取决于你部署的区域。中国大陆无直连端点,也无官方中国访问计划,因此中国生产环境需要稳定的海外代理或前置 Anyscale API 的聚合器。在 Nscale 收购后,基础设施扩展到北欧、英国、德州与葡萄牙的 Nscale 数据中心,缩短了欧盟与美国东部负载的延迟,并为需要数据驻留的企业提供了主权 AI 选项。面向中国终端用户的团队应为代理基础设施预留预算,并评估国产开源权重端点(如阿里百炼或腾讯混元)作为延迟敏感推理的备用方案。