Nebius (Nebius)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Per-token OpenAI-compatible inference: DeepSeek-V4-Flash $0.14/M input, $0.28/M output; Kimi K3 $3/$15; MiniMax M3 $0.30/$1.20; Llama 3.3 70B $0.13/$0.40 | 每百万 tokens |
| 输出 (Output) | Two flavors per model - Base and Fast (-fast suffix) - same outputs, Fast trades higher token price for lower latency via speculative decoding | 每百万 tokens |
注册即可起步,无月费;按量付费(pay-as-you-go)按 token 计费;弹性动态限流,随用量自动扩容至基础额度 20 倍,无需预购容量
🤖 支持模型(共 29 个)
✨ 优势
- ✓ 云雀(Yandex)拆分出的专注 AI 云;英伟达持股约 9.3%,季度营收同比大增 684%
- ✓ Token Factory 提供 OpenAI 兼容推理 API,29 个开源模型含 DeepSeek V4 / Kimi K3 / Qwen3 / GLM-5.2
- ✓ 同源 GPU 云:可在同一账号从托管推理扩展到按需 H100/H200/B200 GPU 与微调
- ✓ Base/Fast 双 flavor,Fast 用投机解码降延迟;动态限流自动扩容至 20 倍
- ✓ 全平台即买即用,注册即可拿 API Key,无配额审批
⚠️ 不足
- × 中国大陆无区域端点,需代理或聚合商
- × 主力模型都是第三方开源权重,无第一方旗舰闭源模型(对比 GPT-5、Claude)
- × Token Factory 文档以 JS 渲染,全英文、技术向
- × 按 token 价格随模型/GPU 配置(B200 vs H100)浮动,Base/Fast 价差需自行评估
- × 品牌在美国/欧洲市场更知名,中文资料与社区较少
🎯 适合场景
需要 OpenAI 兼容推理 API + 同账号可扩展 GPU/微调能力的国际化团队;偏好生态中立、开源权重全的开发者;能接受代理访问的非大陆用户
💰 价格与方案
| 模型 | 输入 ($/百万) | 输出 ($/百万) | 上下文 | 备注 |
|---|---|---|---|---|
| DeepSeek-V4-Flash | $0.14 | $0.28 | 1024K | 100 万上下文推理模型,292 tps(us-central1) |
| DeepSeek-V4-Pro | $1.75 | $3.50 | 1000K | Pro 级推理/编码档(uk-south1) |
| Kimi-K3 | $3.00 | $15.00 | 1024K | 月之暗面前沿开源 MoE(eu-west2) |
| MiniMax-M3 | $0.30 | $1.20 | 1049K | 428B MoE,跑在 B200,vLLM + EAGLE3(us-central1) |
| Qwen3-235B-A22B-Instruct-2507 | $0.20 | $0.60 | 262K | Qwen 旗舰均衡对话模型(eu-north1) |
| GLM-5.2 | $1.40 | $4.40 | 1024K | 智谱多模态旗舰(uk-south1) |
| Llama-3.3-70B-Instruct | $0.13 | $0.40 | 128K | Meta 开源通用模型(eu-north1) |
| Qwen3-Embedding-8B | $0.01 | $0.00 | 41K | Embedding 模型,仅按输入计费(eu-north1) |
🔧 API 与开发者体验
- •API 接口: Token Factory 在 https://api.tokenfactory.nebius.com/v1/ 提供 OpenAI 兼容 API,标准 OpenAI SDK 只需替换 base_url 与 api_key 即可。文本、视觉(image2text)与 embedding 三类模型都走同一接口。
- •认证与注册: 用 Google 或 GitHub 账号在 tokenfactory.nebius.com 注册,再在控制台生成 API Key。无需配额审批或销售流程——创业档完全自助。
- •双 Flavor 档位: 大多数文本模型提供 Base 与 Fast 两档。Fast(模型名后加 -fast)使用更小批量、更多算力与投机解码来降低延迟,输出质量相同,但按 token 单价更高。
- •动态限流: 限流是弹性的:按 15 分钟滚动窗口计量,当平均用量维持在当前上限 80%+ 时下一窗口扩容 1.2 倍,否则回缩,最高可到基础额度的 20 倍,超出才需要 Enterprise 计划。
- •Playground 与后训练: UI Playground 可测试与对比模型。微调(LoRA 与全量)与 Data Lab 数据集工具都是一方功能,并提供 LangChain、LlamaIndex 与 Hugging Face 生态集成。
🤖 开源权重目录与 GPU 云
Nebius 是从 Yandex 拆分出来的 AI 云公司,截至 2026 年 7 月英伟达持股约 9.3%——持股披露令其纳斯达克上市股票(NBIS)单日大涨近 19%,其 Q1 营收因 AI 数据中心需求同比大增约 684%。Token Factory 是其托管推理产品,提供来自 DeepSeek V4、Kimi K3、MiniMax M3、Qwen3、GLM-5.2 与 NVIDIA Nemotron 系列等 29 个开源权重模型,以及 embedding 模型。同一账号还能扩展到底层 GPU 容量与微调,使 Token Factory 成为 Nebius 更大规模 GPU 云的 API 入口——一个中立开源模型市场与直接硬件访问在同一屋檐下的少见组合。其自我定位是「在从芯片到 API 打造的目的型 AI 云上更快地构建与扩展」。
🌐 区域可用性与延迟
Token Factory 从分布在美国与欧洲的区域 GPU 集群提供模型——公开模型目录中当前活跃的区域有 us-central1(美国)、eu-north1 与 eu-west2(欧洲)以及 uk-south1(英国),不同旗舰模型固定在特定位置(例如 DeepSeek-V4-Flash 在 us-central1、Kimi-K3 在 eu-west2、GLM-5.2 在 uk-south1)。中国大陆无区域端点,也无官方中国访问计划,因此国内生产使用需要稳定的海外代理或前置 Token Factory API 的聚合商。OpenAI 兼容接口让客户端集成延迟保持在较低水平;对延迟敏感的服务,每个模型还提供 Fast 档与可固定到所选区域的专用端点,以获得更可预测的性能。