Nebius Token Factory API 2026:开源权重 GPU 云的 API 入口测评
Nebius 是从 Yandex 拆分出的 AI 云公司,截至 2026 年 7 月英伟达持股约 9.3%——持股披露推动其纳斯达克股票(NBIS)单日大涨近 19%,其 Q1 营收也因 AI 数据中心需求同比大增约 684%。Nebius Token Factory 是其托管推理产品:将 GPU 云能力转化为一个 OpenAI 兼容 API,覆盖 DeepSeek V4、Kimi K3、MiniMax M3、Qwen3、GLM-5.2 与 NVIDIA Nemotron 系列等 29 个开源权重模型,外加 embedding,且每款模型都有 Base 与 Fast 两档。本测评覆盖 API、2026 年 8 月核实的价格、双档位、动态限流、背后的 GPU 云、区域可用性与竞品格局。
🤖 模型目录
Token Factory 的目录全部是开源权重,因而刻意保持厂商中立:一个 API Key 即可路由到 DeepSeek V4、月之暗面的 Kimi K3、MiniMax M3、阿里的 Qwen3、智谱的 GLM-5.2 与 Meta 的 Llama 3.3,以及 NVIDIA Nemotron 3 系列和 Nous Research 的 Hermes-4。模型类型涵盖文本、视觉(image2text)与 embedding。它没有第一方前沿闭源模型,因此如果你明确需要 GPT-5、Claude 或 Gemini,可把 Token Factory 与其他厂商组合使用——我们的 OpenAI 兼容 API 指南介绍了如何跨厂商路由。
| 模型 | 类型 | 上下文 | 适用场景 |
|---|---|---|---|
| DeepSeek-V4-Flash | 推理 | 1024K | 100 万上下文编码与智能体负载,292 tps |
| DeepSeek-V4-Pro | 推理 | 1000K | 高级推理、数学、长程智能体 |
| Kimi-K3 | 多模态 MoE | 1024K | 月之暗面前沿开源模型,智能体与图像 |
| MiniMax-M3 | 推理 MoE | 1049K | 428B MoE 跑在 B200,EAGLE3 投机解码 |
| Qwen3-235B-A22B-2507 | 对话 | 262K | 阿里旗舰均衡对话与推理 |
| GLM-5.2 | 多模态 | 1024K | 智谱中英双语旗舰 |
| Llama-3.3-70B-Instruct | 对话 | 128K | Meta 通用模型,智能体与 RAG |
| Qwen3-Embedding-8B | Embedding | 41K | 高精度密集检索,仅按输入计费 |
关于开源权重的低价服务对比,我们的 DeepInfra、Together AI 与 Groq 测评覆盖了「又快又便宜」的一端;最便宜 LLM API 合集统一排名了它们。
💰 价格(2026-08-12 核实)
Token Factory 采用按 token 按量付费——无设置费、无月最低消费。以下价格取自 Nebius 官方公开模型目录,其机器可读的 model-catalog 是权威来源。
| 模型 | 输入 ($/百万) | 输出 ($/百万) | 上下文 | 备注 |
|---|---|---|---|---|
| DeepSeek-V4-Flash | $0.14 | $0.28 | 1024K | 100 万上下文推理,292 tps(us-central1) |
| DeepSeek-V4-Pro | $1.75 | $3.50 | 1000K | Pro 级推理/编码档(uk-south1) |
| MiniMax-M3 | $0.30 | $1.20 | 1049K | 428B MoE 跑在 B200,EAGLE3(us-central1) |
| Qwen3-235B-2507 | $0.20 | $0.60 | 262K | Qwen 旗舰均衡(eu-north1) |
| Llama-3.3-70B | $0.13 | $0.40 | 128K | Meta 通用模型(eu-north1) |
| GLM-5.2 | $1.40 | $4.40 | 1024K | 智谱多模态旗舰(uk-south1) |
| Kimi-K3 | $3.00 | $15.00 | 1024K | 月之暗面前沿开源 MoE(eu-west2) |
| Qwen3-Embedding-8B | $0.01 | $0.00 | 41K | Embedding,仅按输入计费(eu-north1) |
低价区间是 Token Factory 竞争最激烈的地方:DeepSeek-V4-Flash 的 $0.14/$0.28 与 Qwen3-235B 的 $0.20/$0.60 落入了最便宜开源权重厂商的价格带。每款模型还有 Fast 档(模型 id 后加 -fast),通过投机解码以更高的按 token 单价换取更低延迟——对交互式应用很实用。关于跨厂商管理这些单 token 成本,见我们的 AI API 成本控制指南。
🔌 OpenAI 兼容推理 API
from openai import OpenAI
client = OpenAI(
base_url="https://api.tokenfactory.nebius.com/v1/",
api_key="YOUR_NEBIUS_API_KEY"
)
response = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V4-Flash",
messages=[{"role": "user", "content": "用一句话总结 Nebius。"}]
)
print(response.choices[0].message.content)
因为接口是 OpenAI 兼容的,任何使用 OpenAI SDK 的工具——LangChain、LlamaIndex、AutoGen、CrewAI、Vercel AI SDK——只需替换 base_url 与 api_key 即可。官方文档覆盖端点、模型列表与限流。注册完全自助:用 Google 或 GitHub 账号在 tokenfactory.nebius.com 创建账号,生成 API Key 即可开始调用。想对比 Python 原生的 Serverless 方案,可看 Modal;同为「GPU 云 + API」的混合方案,还可以参考我们本月初发布的 Hyperbolic 测评。
🚀 快速上手
最快的方式是在 tokenfactory.nebius.com 用 Google 或 GitHub 账号注册,从控制台复制 API Key,然后用上面的代码把标准 OpenAI client 指向 https://api.tokenfactory.nebius.com/v1/。由于限流会自动扩容、且查看目录无需绑定信用卡,你可以在 Playground 里以接近零成本花几小时对比 DeepSeek-V4-Flash 与 Qwen3-235B 或 GLM-5.2 在你自己的提示词上的表现。当负载稳定后,评估交互延迟是否需要 Fast 档,再决定是否把微调或裸 GPU 工作负载迁入同一 Nebius 账号。
⚙️ Base/Fast 双档与动态限流
有两个细节让 Token Factory 的开发者体验与众不同。第一,双档位:大多数文本模型的 Base 档以成本优先,Fast 档(加 -fast)使用更小批量、更多算力与投机解码来降低延迟,输出保持不变——让你只为实际需要的响应速度付费。第二,动态限流:平台按 15 分钟滚动窗口计量用量,当持续使用达到上限的 80%+ 时,下一窗口将上限上调 1.2 倍,否则回缩,最高可达基础额度的 20 倍,超出才需要 Enterprise 计划。实践中创业档大多数团队几乎不用考虑限流,这与固定 RPM 的厂商有明显区别。微调(LoRA 与全量)与 Data Lab 数据集工具也是一方功能,原型可以在不换平台的情况下升级为微调后的模型。
🖥️ API 背后的 GPU 云
Token Factory 是 Nebius 更大规模 GPU 云的 API 入口:调用托管端点的同一账号,也能按需拉起 H100/H200/B200 GPU 容量用于训练、微调与批量任务。Nebius 自我定位为「从芯片到 API 打造的目的型 AI 云」,684% 的营收增长正反映了对这种基础设施的需求。英伟达约 9.3% 的持股(2026 年 7 月披露)既是资本也是生态信号:Nebius 既位于英伟达硬件的供给侧,又以有竞争力的价格提供开源推理。这种纵向一体化是它与纯推理主机如 Together AI、Fireworks 的结构性差异,而更接近把 OpenAI 兼容层与裸 GPU 访问结合的 RunPod 或 Hyperbolic。
🆚 对比 DeepInfra / Together AI / Groq / Hyperbolic
| 厂商 | 开源权重目录 | 裸 GPU + 微调 | OpenAI 兼容 API | 国内直连 |
|---|---|---|---|---|
| Nebius Token Factory | ✅ 29 个模型(含 Kimi K3、GLM、Nemotron) | ✅ 同一账号 | ✅ | ❌ 需代理 |
| DeepInfra | ✅ 广 | 有限 | ✅ | ❌ 需代理 |
| Together AI | ✅ 广 | GPU + 微调 | ✅ | ❌ 需代理 |
| Groq | 精选(极快) | ❌ | ✅ | ❌ 需代理 |
| Hyperbolic | ✅ 开源权重 | ✅ 市场 | ✅ | ❌ 需代理 |
最接近的对比是开源权重厂商。DeepInfra 与 Together AI 是纯推理优先的平台,目录广、价格激进;Groq 以其 LPU 硬件占据极低延迟的生态位。Nebius 在两个维度上差异化:一是同一账号可直接升级到裸 GPU 与微调;二是目录真正中立——DeepSeek、月之暗面、智谱与 Qwen 的模型与 NVIDIA 自家的 Nemotron 系列并列。Hyperbolic 是最接近的 GPU 云混合方案,但 Nebius 增加了微调与更大的第一方基础设施叙事。若你主要需要中国大陆直连,我们的 DeepSeek 与 Qwen/百炼 测评覆盖了有大陆端点的厂商。
🌐 区域可用性与延迟
Token Factory 从分布在北美与欧洲的 GPU 集群提供模型。公开目录当前活跃的区域为 us-central1(美国)、eu-north1 与 eu-west2(欧洲)以及 uk-south1(英国),不同旗舰模型固定在特定位置——例如 DeepSeek-V4-Flash 在 us-central1、Kimi-K3 在 eu-west2、GLM-5.2 在 uk-south1。中国大陆无区域端点,也无官方中国访问计划,因此国内生产使用需要稳定的海外代理或前置该 API 的聚合商。对延迟敏感的工作,Fast 档与专用端点(可固定到所选区域)能提供比共享多租户调度更可预测的服务。
🎯 适合谁
三类用户最合适。想要厂商中立开源模型的团队用一个 OpenAI 兼容 Key 就能拿到 DeepSeek、Qwen、GLM、Kimi 与 Nemotron——当你希望在不换厂商的情况下切换权重时很有用。会超出代理推理规模的初创团队可以先从托管 API 起步,之后把微调或裸 GPU 工作负载迁入同一 Nebius 账号,而非移植到另一朵云。对延迟敏感的构建者受益于 Base/Fast 拆分与去除固定 RPM 上限的动态限流。代价是它并非前沿闭源模型厂商,也没有中国大陆直连路径。
⚠️ 需注意的局限
- 中国大陆无端点——生产访问需代理或聚合商。
- 仅开源权重:无第一方前沿闭源模型(对比 GPT-5、Claude、Gemini)。
- 按 token 价格随每款模型背后的 GPU 配置(B200 vs H100)浮动,Base/Fast 价差需按你的负载评估。
- 文档与控制台面向开发者、仅英文。
- 品牌在美国/欧洲市场更知名,中文资料与社区较少。
- 限流自动扩容是动态的——按 20 倍弹性上限规划,而非假设固定 RPM。
- 专用端点与裸 GPU 容量与托管推理分别计价。
🎯 结论
当你想要一个真正中立的开源权重目录、以低成本价格提供服务,并且能在同一账号内增长到 GPU 计算与微调时,Nebius Token Factory 是合适的选择。DeepSeek-V4-Flash 的 $0.14/$0.28 与 Qwen3-235B 的 $0.20/$0.60 把它稳稳放入最便宜档,英伟达的持股与 684% 的营收增长则指向其背后有实力的基础设施。Fast 档与 20 倍动态限流对延迟敏感与突发负载都很友好。若追求最便宜的纯开源推理与最广目录,DeepInfra 与 Together AI 依然强劲;若要带裸 GPU 市场的 GPU 云混合方案,可对比 Hyperbolic 与 RunPod。想要开源模型与直接硬件访问在同一屋檐下的团队,Nebius 是差异化之选。
🔗 官方资源
- Nebius Token Factory(应用、模型目录、API Key)
- Token Factory 文档(快速上手、端点、限流)
- Nebius — 目的型 AI 云(公司主页)
FAQ
Nebius Token Factory 是否 OpenAI 兼容?
是。将 OpenAI client 的 base_url 指向 https://api.tokenfactory.nebius.com/v1/,使用标准 chat-completions 调用即可。
Nebius Token Factory 如何计费?
按 token 按量付费:DeepSeek-V4-Flash $0.14/$0.28、Qwen3-235B $0.20/$0.60、MiniMax-M3 $0.30/$1.20、Llama-3.3-70B $0.13/$0.40、GLM-5.2 $1.40/$4.40、Kimi-K3 $3/$15(每百万)。无设置费、无月最低消费。
有免费档吗?
没有永久免费档,但无设置费、无月费——按用量付费,动态限流自动扩容至 20 倍。
什么是 Fast 档?
在模型 id 后加 -fast,用更高的按 token 单价换取更低延迟(更小批量 + 投机解码),输出质量不变。
国内能用吗?
不能直接使用——需代理或聚合商,无大陆区域端点(活跃区域为 us-central1、eu-north1、eu-west2、uk-south1)。
Nebius 提供 GPU 与微调吗?
提供——同一账号可按需拉起 H100/H200/B200 GPU,并运行 LoRA 或全量微调及 Data Lab 数据集工具。