Nscale (Nscale)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Nscale 采用充值余额(credit)按量计费,价格按模型分列,在 Nscale 控制台 AI Services → Models 与 /v1/models API 中按每 1M 输入 token 报价(文本模型);图像模型输入按 0 计费。定价结构经 serverless-openapi.yaml ModelPricing schema 验证(input = 每 1M 输入 token 美元价)。 | 每百万 tokens |
| 输出 (Output) | 输出按每 1M 输出 token 计费(文本模型);图像模型按每百万像素计费(ModelPricing.output 定义为 per-million output pixels)。具体美元单价在控制台与 /v1/models 端点内按模型展示,注册充值后可查。 | 每百万 tokens |
| 缓存读取 | Nscale 文档未单独公布"缓存输入"折扣档——计费以 model 为单位按 input/output 两档计(对照 OpenAI/Anthropic 的缓存输入差价,Nscale 暂无独立缓存价格线)。 | 享折扣 |
无永久免费档。新用户注册后通过 Google SSO 登录,官方提示早期用户可能获得免费信用额度(promotional offer,非保证)。默认需先充值(credit)才能调用 serverless 推理 API。
🤖 支持模型(共 10 个)
✨ 优势
- ✓ Serverless 推理:无需管理集群/GPU,托管端点按 API 调用即可上线,支持自动扩缩
- ✓ OpenAI 兼容:base_url=https://inference.api.nscale.com/v1,官方 OpenAI SDK 直接可用
- ✓ 模型库:Qwen3、GPT OSS、Llama 4、Kimi K2.5、Mistral 8x22B、FLUX.1、SDXL 等开源模型
- ✓ 一流微调 + Prompt Workbench:浏览器内提示调试、版本化、成本查看
- ✓ EU 数据主权:英国/挪威/冰岛数据中心,在国境内处理满足 GDPR 与数据驻留合规
- ✓ 全栈:按需 GPU 实例、Kubernetes(NKS)、Slurm 训练、GB300 预占容量
⚠️ 不足
- × 定价不公开:模型单价需登录控制台或调 /v1/models(需 key)查看,无公开定价页,比 OpenAI/Anthropic 透明度低
- × 知名度较新:品牌与生态(第三方 SDK、教程、社区)远不如 OpenAI/Anthropic/Google
- × 无中国大陆直连端点,主打欧洲/美国区域
- × 需要先充值(credit)才能用 API,且仅支持 Google SSO 注册
- × 无公开免费档(仅可能的新用户促销额度,非保证)
🎯 适合场景
需要 OpenAI 兼容、托管 serverless 推理来跑开源模型(Qwen3、GPT OSS、Llama、Kimi、Mistral)的欧洲团队;重视 EU 数据主权、在国境内处理与 GDPR 合规的政企客户;想要 serverless + 按需 GPU + 微调一站式全栈、且能接受充值制与 Google SSO 注册的开发者。
💰 价格与方案
| 方案 / 模型档 | 计费 | 输入 | 输出 | 备注 |
|---|---|---|---|---|
| Serverless 文本模型 | 按每 1M token(充值余额) | 按模型单价 | 按模型单价 | Qwen3、GPT OSS、Llama 4、Kimi K2.5、Mistral 8x22B |
| 图像生成 | 按输出像素 | 0 | 每 1M 像素 | FLUX.1 [schnell]、SDXL Base 1.0,经 /v1/images/generations |
| 专属推理 | 预留端点 | 按模型 | 按模型 | 严格客户隔离,满足合规 |
| 微调 | 按任务/用量 | — | — | 基于企业数据定制基础模型;规范化上线流程 |
| 计算实例 | 按 GPU 小时 | — | — | 按需 GPU/CPU 虚拟机、Kubernetes(NKS)、Slurm |
🔧 API 与开发者体验
- •接口风格: OpenAI 兼容 REST API,base_url=https://inference.api.nscale.com/v1 —— 官方 OpenAI Python/TypeScript SDK 改 base_url 即可直接用。
- •端点: Chat Completions(/v1/chat/completions)、Completions(/v1/completions)、Embeddings(/v1/embeddings)、图像生成(/v1/images/generations),以及带每模型价格与上下文长度的 /v1/models。
- •鉴权: Bearer service token(JWT),在 Settings → Service Tokens 创建;token 带作用域与时限,仅在创建时显示一次。
- •Serverless vs 专属: Serverless 自动扩缩端点几分钟即可上线并内置可观测性;专属端点提供严格客户隔离,适合注重合规的团队。
- •微调: 基于自有数据定制基础模型,流程简洁,并将调优后的模型以可重复、受控的方式推进到生产。
- •Prompt Workbench: 浏览器内提示实验,支持版本化、预设保存与成本查看——无需烧 GPU 小时即可获得可复现的运行。
- •模型库: 仅开源模型(Qwen3、GPT OSS、Llama 4、Kimi K2.5、Mistral、FLUX.1、SDXL)——不含 GPT-5、Claude 等专有前沿模型;目录按组织管理。
🧠 主权级 Serverless 推理
Nscale 的差异化在于围绕欧洲数据主权构建的全栈 AI 云。Serverless 推理运行于 Nscale 托管的 GPU 上,数据中心分布在英国(Loughton)、挪威(Glomfjord、Narvik)与美国(德州、西弗吉尼亚),通过在国家境内处理来满足 GDPR 与数据驻留要求。模型库只含开源权重——Qwen3、GPT OSS、Llama 4、Kimi K2.5、Mistral 8x22B、FLUX.1、SDXL——并提供微调与 Prompt Workbench,团队可以在一个受控平台上从实验推进到生产。Nscale 获得 9 亿美元循环信贷额度并在 2026 年 7 月底宣布收购 Anyscale,彰显其对这一主权 AI 版图的激进扩张。
🌐 区域可用性与延迟
Nscale 的算力集中在欧洲与北美:自有数据中心位于英国 Loughton、挪威 Glomfjord/Narvik、美国德州/西弗吉尼亚,另有葡萄牙 Sines、冰岛 Keflavik、挪威 Stavanger/Oslo 等伙伴运营站点。inference.api.nscale.com 是单一全球端点,欧洲与美国客户端首字节延迟低至几十毫秒,而中国大陆需要代理,跨大西洋/跨太平洋延迟通常在 200-350ms。目前没有亚太或中国区端点。优先考虑在国境内数据处理、GDPR 合规或英/北欧主权的团队适合选 Nscale;中国区低延迟负载更适合国内厂商。