Nscale (Nscale)

收录于 https://www.nscale.com

综合排名 # ⭐ 可考虑
❌ 无中国大陆直连端点。inference.api.nscale.com 是单一全球端点,数据中心集中于欧洲(英国 Loughton、挪威 Glomfjord/Narvik)与美国(德州、西弗吉尼亚);大陆生产流量需代理或中转,跨大西洋/跨太平洋首字节延迟通常 200-350ms。主打 EU 数据主权与在国境内处理,适合欧洲合规场景而非中国区低延迟。 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Nscale 采用充值余额(credit)按量计费,价格按模型分列,在 Nscale 控制台 AI Services → Models 与 /v1/models API 中按每 1M 输入 token 报价(文本模型);图像模型输入按 0 计费。定价结构经 serverless-openapi.yaml ModelPricing schema 验证(input = 每 1M 输入 token 美元价)。 每百万 tokens
输出 (Output) 输出按每 1M 输出 token 计费(文本模型);图像模型按每百万像素计费(ModelPricing.output 定义为 per-million output pixels)。具体美元单价在控制台与 /v1/models 端点内按模型展示,注册充值后可查。 每百万 tokens
缓存读取 Nscale 文档未单独公布"缓存输入"折扣档——计费以 model 为单位按 input/output 两档计(对照 OpenAI/Anthropic 的缓存输入差价,Nscale 暂无独立缓存价格线)。 享折扣
💡 免费额度

无永久免费档。新用户注册后通过 Google SSO 登录,官方提示早期用户可能获得免费信用额度(promotional offer,非保证)。默认需先充值(credit)才能调用 serverless 推理 API。

🤖 支持模型(共 10 个)

Moonshot AI Kimi K2.5 — open chat model via serverless inference; per-1M input/output token pricing (verified on nscale.com/product/inference featured model list) Alibaba Cloud Qwen3 8B / Qwen3 4B Thinking / Qwen3 4B Instruct — open chat models with reasoning variants; per-1M token pricing OpenAI GPT OSS 20B / GPT OSS 120B — OpenAI's open-weights chat models served on Nscale-managed GPUs Meta Llama 4 Scout — open multimodal chat model via serverless inference Mistral 8x22B Instruct — open mixture-of-experts chat model Black Forest Labs FLUX.1 [schnell] and Stability AI Stable Diffusion XL Base 1.0 — image generation models via /v1/images/generations (billed per output pixels) Fine-tuning workspaces + Prompt Workbench for adapting and iterating on the above models

✨ 优势

  • Serverless 推理:无需管理集群/GPU,托管端点按 API 调用即可上线,支持自动扩缩
  • OpenAI 兼容:base_url=https://inference.api.nscale.com/v1,官方 OpenAI SDK 直接可用
  • 模型库:Qwen3、GPT OSS、Llama 4、Kimi K2.5、Mistral 8x22B、FLUX.1、SDXL 等开源模型
  • 一流微调 + Prompt Workbench:浏览器内提示调试、版本化、成本查看
  • EU 数据主权:英国/挪威/冰岛数据中心,在国境内处理满足 GDPR 与数据驻留合规
  • 全栈:按需 GPU 实例、Kubernetes(NKS)、Slurm 训练、GB300 预占容量

⚠️ 不足

  • × 定价不公开:模型单价需登录控制台或调 /v1/models(需 key)查看,无公开定价页,比 OpenAI/Anthropic 透明度低
  • × 知名度较新:品牌与生态(第三方 SDK、教程、社区)远不如 OpenAI/Anthropic/Google
  • × 无中国大陆直连端点,主打欧洲/美国区域
  • × 需要先充值(credit)才能用 API,且仅支持 Google SSO 注册
  • × 无公开免费档(仅可能的新用户促销额度,非保证)

🎯 适合场景

需要 OpenAI 兼容、托管 serverless 推理来跑开源模型(Qwen3、GPT OSS、Llama、Kimi、Mistral)的欧洲团队;重视 EU 数据主权、在国境内处理与 GDPR 合规的政企客户;想要 serverless + 按需 GPU + 微调一站式全栈、且能接受充值制与 Google SSO 注册的开发者。

💰 价格与方案

方案 / 模型档计费输入输出备注
Serverless 文本模型按每 1M token(充值余额)按模型单价按模型单价Qwen3、GPT OSS、Llama 4、Kimi K2.5、Mistral 8x22B
图像生成按输出像素0每 1M 像素FLUX.1 [schnell]、SDXL Base 1.0,经 /v1/images/generations
专属推理预留端点按模型按模型严格客户隔离,满足合规
微调按任务/用量基于企业数据定制基础模型;规范化上线流程
计算实例按 GPU 小时按需 GPU/CPU 虚拟机、Kubernetes(NKS)、Slurm

🔧 API 与开发者体验

  • 接口风格: OpenAI 兼容 REST API,base_url=https://inference.api.nscale.com/v1 —— 官方 OpenAI Python/TypeScript SDK 改 base_url 即可直接用。
  • 端点: Chat Completions(/v1/chat/completions)、Completions(/v1/completions)、Embeddings(/v1/embeddings)、图像生成(/v1/images/generations),以及带每模型价格与上下文长度的 /v1/models。
  • 鉴权: Bearer service token(JWT),在 Settings → Service Tokens 创建;token 带作用域与时限,仅在创建时显示一次。
  • Serverless vs 专属: Serverless 自动扩缩端点几分钟即可上线并内置可观测性;专属端点提供严格客户隔离,适合注重合规的团队。
  • 微调: 基于自有数据定制基础模型,流程简洁,并将调优后的模型以可重复、受控的方式推进到生产。
  • Prompt Workbench: 浏览器内提示实验,支持版本化、预设保存与成本查看——无需烧 GPU 小时即可获得可复现的运行。
  • 模型库: 仅开源模型(Qwen3、GPT OSS、Llama 4、Kimi K2.5、Mistral、FLUX.1、SDXL)——不含 GPT-5、Claude 等专有前沿模型;目录按组织管理。

🧠 主权级 Serverless 推理

Nscale 的差异化在于围绕欧洲数据主权构建的全栈 AI 云。Serverless 推理运行于 Nscale 托管的 GPU 上,数据中心分布在英国(Loughton)、挪威(Glomfjord、Narvik)与美国(德州、西弗吉尼亚),通过在国家境内处理来满足 GDPR 与数据驻留要求。模型库只含开源权重——Qwen3、GPT OSS、Llama 4、Kimi K2.5、Mistral 8x22B、FLUX.1、SDXL——并提供微调与 Prompt Workbench,团队可以在一个受控平台上从实验推进到生产。Nscale 获得 9 亿美元循环信贷额度并在 2026 年 7 月底宣布收购 Anyscale,彰显其对这一主权 AI 版图的激进扩张。

🌐 区域可用性与延迟

Nscale 的算力集中在欧洲与北美:自有数据中心位于英国 Loughton、挪威 Glomfjord/Narvik、美国德州/西弗吉尼亚,另有葡萄牙 Sines、冰岛 Keflavik、挪威 Stavanger/Oslo 等伙伴运营站点。inference.api.nscale.com 是单一全球端点,欧洲与美国客户端首字节延迟低至几十毫秒,而中国大陆需要代理,跨大西洋/跨太平洋延迟通常在 200-350ms。目前没有亚太或中国区端点。优先考虑在国境内数据处理、GDPR 合规或英/北欧主权的团队适合选 Nscale;中国区低延迟负载更适合国内厂商。