Nscale Serverless 推理 API 价格 2026:开源模型与欧盟主权
2026 年大多数"AI API"评测都从某个专有前沿模型出发,然后一路谈到价格。Nscale 相反:它是一家全栈 AI 基础设施公司——数据中心、GPU、Kubernetes、Slurm 训练、微调,以及位于 https://inference.api.nscale.com/v1 的 serverless 推理 API——并且只提供开源权重模型。目录(据 nscale.com/product/inference,2026-08-27 抓取)为 Qwen3 4B/8B、OpenAI GPT OSS 20B/120B、Meta Llama 4 Scout、Moonshot Kimi K2.5、Mistral 8x22B Instruct,图像生成含 FLUX.1 [schnell] 与 Stable Diffusion XL。卖点是欧洲数据主权:在英国与挪威数据中心做在国境内处理、对齐 GDPR、并提供 OpenAI 兼容端点——开发者只需改 base_url 就能把官方 OpenAI SDK 指向 Nscale。本评测覆盖已验证的 API 表面、充值制计价模型,以及团队在开源模型聚合商(如 Fireworks / Groq)与专有厂商之间如何选择 Nscale。
/v1/models 展示。没有永久免费档也没有公开定价页,透明度低于 OpenAI/Anthropic。差异化在于主权算力:英国、挪威、美国数据中心做在国境内处理以满足 GDPR 与数据驻留负载,加上 9 亿美元信贷额度与 2026 年 7 月底收购 Anyscale,彰显激进扩张。Nscale 到底是什么
Nscale 不是模型厂商,而是一家拥有自有数据中心的基础设施公司。首页自述为"the engine of superintelligence",产品分为四层:AI Services(推理端点、微调、Prompt Workbench)、平台服务(托管 Slurm、Kubernetes、实例)、基础设施服务(计算、网络、存储)、Fleet 运维(可观测性、Radar API)。自有数据中心位于英国 Loughton、挪威 Glomfjord/Narvik、美国德州/西弗吉尼亚,另有葡萄牙 Sines、冰岛 Keflavik、挪威 Stavanger/Oslo 等伙伴站点。CEO 兼创始人 Josh Payne 领导公司,newsroom 始终围绕主权 AI、在国境内数据驻留与亚 30ms 边缘推理展开叙事。
对 AI API 用户而言,入口是 serverless 推理——完全托管、用 Bearer service token 和 OpenAI 兼容载荷即可调用的端点。/v1 表面与 OpenAI 对齐:/v1/chat/completions、/v1/completions、/v1/embeddings、/v1/images/generations,以及带每模型价格与上下文长度的 /v1/models。我实测该端点无 token 时返回 HTTP 401 Unauthorized——这是端点真实存在、需要 API key 的干净信号,与失效或占位接口不同。
Nscale 模型目录(已验证)
| 模型 | 厂商 | 类型 |
|---|---|---|
| Qwen3 8B / Qwen3 4B Instruct / Qwen3 4B Thinking | 阿里云 | 对话 + 推理 |
| GPT OSS 20B / GPT OSS 120B | OpenAI | 对话(开源权重) |
| Llama 4 Scout | Meta | 多模态对话 |
| Kimi K2.5 | Moonshot AI | 对话 |
| Mistral 8x22B Instruct | Mistral AI | 专家混合对话 |
| FLUX.1 [schnell] | Black Forest Labs | 图像生成 |
| Stable Diffusion XL Base 1.0 | Stability AI | 图像生成 |
目录刻意只含开源模型。除开源 GPT OSS 系列外,没有专有前沿模型(无 GPT-5、无 Claude、无 Gemini)。这让 Nscale 成为"想用受管基础设施跑开源权重并付费"的团队的直接替代——与 Fireworks AI、Groq、Together AI 同赛道——但额外优势是 Nscale 自有 GPU 与数据中心而非租赁,对主权放置阈值有更紧的控制。
计价模型(结构已验证)
Nscale 采用预付充值制计费:用 Google SSO 注册、在控制台通过 Stripe 充值、再按模型扣费。计费结构经公开的 serverless-openapi.yaml 中 ModelPricing schema 验证:文本模型 input 按每 1M 输入 token、output 按每 1M 输出 token;图像模型输入计 0、输出按每百万像素。各模型美元单价本身在控制台与已鉴权的 /v1/models 端点返回,而非公开定价页。
/v1/models 调用。这是做成本对比评测的主要摩擦点——结构已验证,精确数字不公开。API 与开发者体验
- OpenAI 兼容端点:
base_url=https://inference.api.nscale.com/v1;官方 OpenAI Python/TypeScript SDK 改 base_url 并传 service token 即可用。 - 一个表面四种模态:chat completions、text completions、embeddings、图像生成都在
/v1下,形状对齐 OpenAI,现有工具大多可直接迁移。 - Service token 鉴权:在 Settings → Service Tokens 创建带作用域、限时的 JWT,仅在创建时显示一次——比普通 API key 更现代的鉴权模型。
- Serverless vs 专属:自动扩缩的 serverless 端点内置可观测性;或提供严格客户隔离的专属端点,适合注重合规的团队。
- 微调 + Prompt Workbench:基于自有数据定制基础模型,并在带版本化与成本查看的浏览器工作台迭代提示。
- 全栈可选性:同一账户可开 GPU 实例、Kubernetes(NKS)、Slurm 训练集群、预留容量(GB300 NVL72)与对象存储——推理只是更大平台的一层。
主权推理与近期动态
战略差异化在于主权。Nscale 把"在国境内处理"定位为 GDPR 与数据驻留要求的答案:英国或挪威企业可以在自己司法管辖区内的 GPU 上跑推理,使用无需自行运维的专属基础设施。两条近期信号佐证扩张轨迹:其一,Nscale 获得 9 亿美元循环信贷额度(newsroom,2026);其二,Nscale 于 2026 年 7 月底宣布 收购 Anyscale——值得注意的是 Anyscale 已是 APIRank 收录的(Ray 生态 + serverless serving)provider。收购叠加信贷额度,表明 Nscale 意在成为美国超大规模云之外的顶级欧盟主权替代。
Nscale 适合谁
Nscale 是最优选择的场景:
- 你需要欧盟数据主权:在英/挪 GPU 上跑开源模型并做在国境内处理,是仅美国厂商难以匹配的。
- 你要 OpenAI 兼容的开源模型服务:Qwen3、GPT OSS、Llama 4、Kimi、Mistral 归到一个
/v1免胶水接入,可比 Fireworks/Together,但基础设施自有。 - 你要一个受控的一体化平台:serverless + 按需 GPU + 微调 + workbench 归入同一账户与同一余额,而非拼装多家。
Nscale 较弱的选择:
- 你需要公开、可验证的定价:缺少公开定价页,预算与基准比对比 OpenAI/Anthropic/OpenRouter 更难。
- 你需要专有前沿模型:无 GPT-5、无 Claude——仅开源权重。
- 你服务中国大陆:无中国区端点,预计 200-350ms 代理延迟。
- 你要零摩擦注册:仅 Google SSO、首次调用前需充值、无永久免费档。
结论
Nscale 是一个可靠、欧盟主权、全栈的 AI 云,其 serverless 推理 API 真正与 OpenAI 兼容,并提供扎实的开源模型目录(Qwen3、GPT OSS、Llama 4、Kimi K2.5、Mistral、FLUX.1、SDXL——均已在 nscale.com/product/inference 验证,2026-08-27 抓取)。计价为预付充值制,结构上文本按每 1M 输入/输出 token、图像按每百万输出像素(已验证于公开的 serverless-openapi.yaml),单价在控制台与已鉴权的 /v1/models 展示。取舍真实且自洽:无公开定价页、仅开源模型、无中国端点、Google SSO 注册、无免费档。权威来源是 AI 服务页、quickstart、docs 索引,以及 Anyscale 与 9 亿美元相关更新的 newsroom。对重视主权开源模型推理、且愿意在控制台管理余额的团队,Nscale 是真正差异化的选择。