Nebius Token Factory API 2026:开源权重 GPU 云的 API 入口测评

Nebius 是从 Yandex 拆分出的 AI 云公司,截至 2026 年 7 月英伟达持股约 9.3%——持股披露推动其纳斯达克股票(NBIS)单日大涨近 19%,其 Q1 营收也因 AI 数据中心需求同比大增约 684%Nebius Token Factory 是其托管推理产品:将 GPU 云能力转化为一个 OpenAI 兼容 API,覆盖 DeepSeek V4、Kimi K3、MiniMax M3、Qwen3、GLM-5.2 与 NVIDIA Nemotron 系列等 29 个开源权重模型,外加 embedding,且每款模型都有 Base 与 Fast 两档。本测评覆盖 API、2026 年 8 月核实的价格、双档位、动态限流、背后的 GPU 云、区域可用性与竞品格局。

🌍 快速结论:当你想要一个真正中立、覆盖多家开源模型的市场,并希望在同一账号内生级到裸 GPU 容量与微调时,Nebius Token Factory 是合适的选择。它本质上是 GPU 云派生的 API——开源权重的价格贴近低价区间、管理透明,但并非前沿闭源模型厂商。国内访问需代理。

🤖 模型目录

Token Factory 的目录全部是开源权重,因而刻意保持厂商中立:一个 API Key 即可路由到 DeepSeek V4、月之暗面的 Kimi K3、MiniMax M3、阿里的 Qwen3、智谱的 GLM-5.2 与 Meta 的 Llama 3.3,以及 NVIDIA Nemotron 3 系列和 Nous Research 的 Hermes-4。模型类型涵盖文本、视觉(image2text)与 embedding。它没有第一方前沿闭源模型,因此如果你明确需要 GPT-5、Claude 或 Gemini,可把 Token Factory 与其他厂商组合使用——我们的 OpenAI 兼容 API 指南介绍了如何跨厂商路由。

模型类型上下文适用场景
DeepSeek-V4-Flash推理1024K100 万上下文编码与智能体负载,292 tps
DeepSeek-V4-Pro推理1000K高级推理、数学、长程智能体
Kimi-K3多模态 MoE1024K月之暗面前沿开源模型,智能体与图像
MiniMax-M3推理 MoE1049K428B MoE 跑在 B200,EAGLE3 投机解码
Qwen3-235B-A22B-2507对话262K阿里旗舰均衡对话与推理
GLM-5.2多模态1024K智谱中英双语旗舰
Llama-3.3-70B-Instruct对话128KMeta 通用模型,智能体与 RAG
Qwen3-Embedding-8BEmbedding41K高精度密集检索,仅按输入计费

关于开源权重的低价服务对比,我们的 DeepInfraTogether AIGroq 测评覆盖了「又快又便宜」的一端;最便宜 LLM API 合集统一排名了它们。

💰 价格(2026-08-12 核实)

Token Factory 采用按 token 按量付费——无设置费、无月最低消费。以下价格取自 Nebius 官方公开模型目录,其机器可读的 model-catalog 是权威来源。

模型输入 ($/百万)输出 ($/百万)上下文备注
DeepSeek-V4-Flash$0.14$0.281024K100 万上下文推理,292 tps(us-central1)
DeepSeek-V4-Pro$1.75$3.501000KPro 级推理/编码档(uk-south1)
MiniMax-M3$0.30$1.201049K428B MoE 跑在 B200,EAGLE3(us-central1)
Qwen3-235B-2507$0.20$0.60262KQwen 旗舰均衡(eu-north1)
Llama-3.3-70B$0.13$0.40128KMeta 通用模型(eu-north1)
GLM-5.2$1.40$4.401024K智谱多模态旗舰(uk-south1)
Kimi-K3$3.00$15.001024K月之暗面前沿开源 MoE(eu-west2)
Qwen3-Embedding-8B$0.01$0.0041KEmbedding,仅按输入计费(eu-north1)

低价区间是 Token Factory 竞争最激烈的地方:DeepSeek-V4-Flash 的 $0.14/$0.28 与 Qwen3-235B 的 $0.20/$0.60 落入了最便宜开源权重厂商的价格带。每款模型还有 Fast 档(模型 id 后加 -fast),通过投机解码以更高的按 token 单价换取更低延迟——对交互式应用很实用。关于跨厂商管理这些单 token 成本,见我们的 AI API 成本控制指南。

🔌 OpenAI 兼容推理 API

from openai import OpenAI

client = OpenAI(
    base_url="https://api.tokenfactory.nebius.com/v1/",
    api_key="YOUR_NEBIUS_API_KEY"
)
response = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V4-Flash",
    messages=[{"role": "user", "content": "用一句话总结 Nebius。"}]
)
print(response.choices[0].message.content)

因为接口是 OpenAI 兼容的,任何使用 OpenAI SDK 的工具——LangChain、LlamaIndex、AutoGen、CrewAI、Vercel AI SDK——只需替换 base_urlapi_key 即可。官方文档覆盖端点、模型列表与限流。注册完全自助:用 Google 或 GitHub 账号在 tokenfactory.nebius.com 创建账号,生成 API Key 即可开始调用。想对比 Python 原生的 Serverless 方案,可看 Modal;同为「GPU 云 + API」的混合方案,还可以参考我们本月初发布的 Hyperbolic 测评

🚀 快速上手

最快的方式是在 tokenfactory.nebius.com 用 Google 或 GitHub 账号注册,从控制台复制 API Key,然后用上面的代码把标准 OpenAI client 指向 https://api.tokenfactory.nebius.com/v1/。由于限流会自动扩容、且查看目录无需绑定信用卡,你可以在 Playground 里以接近零成本花几小时对比 DeepSeek-V4-Flash 与 Qwen3-235B 或 GLM-5.2 在你自己的提示词上的表现。当负载稳定后,评估交互延迟是否需要 Fast 档,再决定是否把微调或裸 GPU 工作负载迁入同一 Nebius 账号。

⚙️ Base/Fast 双档与动态限流

有两个细节让 Token Factory 的开发者体验与众不同。第一,双档位:大多数文本模型的 Base 档以成本优先,Fast 档(加 -fast)使用更小批量、更多算力与投机解码来降低延迟,输出保持不变——让你只为实际需要的响应速度付费。第二,动态限流:平台按 15 分钟滚动窗口计量用量,当持续使用达到上限的 80%+ 时,下一窗口将上限上调 1.2 倍,否则回缩,最高可达基础额度的 20 倍,超出才需要 Enterprise 计划。实践中创业档大多数团队几乎不用考虑限流,这与固定 RPM 的厂商有明显区别。微调(LoRA 与全量)与 Data Lab 数据集工具也是一方功能,原型可以在不换平台的情况下升级为微调后的模型。

🖥️ API 背后的 GPU 云

Token Factory 是 Nebius 更大规模 GPU 云的 API 入口:调用托管端点的同一账号,也能按需拉起 H100/H200/B200 GPU 容量用于训练、微调与批量任务。Nebius 自我定位为「从芯片到 API 打造的目的型 AI 云」,684% 的营收增长正反映了对这种基础设施的需求。英伟达约 9.3% 的持股(2026 年 7 月披露)既是资本也是生态信号:Nebius 既位于英伟达硬件的供给侧,又以有竞争力的价格提供开源推理。这种纵向一体化是它与纯推理主机如 Together AIFireworks 的结构性差异,而更接近把 OpenAI 兼容层与裸 GPU 访问结合的 RunPodHyperbolic

🆚 对比 DeepInfra / Together AI / Groq / Hyperbolic

厂商开源权重目录裸 GPU + 微调OpenAI 兼容 API国内直连
Nebius Token Factory✅ 29 个模型(含 Kimi K3、GLM、Nemotron)✅ 同一账号❌ 需代理
DeepInfra✅ 广有限❌ 需代理
Together AI✅ 广GPU + 微调❌ 需代理
Groq精选(极快)❌ 需代理
Hyperbolic✅ 开源权重✅ 市场❌ 需代理

最接近的对比是开源权重厂商。DeepInfraTogether AI 是纯推理优先的平台,目录广、价格激进;Groq 以其 LPU 硬件占据极低延迟的生态位。Nebius 在两个维度上差异化:一是同一账号可直接升级到裸 GPU 与微调;二是目录真正中立——DeepSeek、月之暗面、智谱与 Qwen 的模型与 NVIDIA 自家的 Nemotron 系列并列。Hyperbolic 是最接近的 GPU 云混合方案,但 Nebius 增加了微调与更大的第一方基础设施叙事。若你主要需要中国大陆直连,我们的 DeepSeekQwen/百炼 测评覆盖了有大陆端点的厂商。

🌐 区域可用性与延迟

Token Factory 从分布在北美与欧洲的 GPU 集群提供模型。公开目录当前活跃的区域为 us-central1(美国)、eu-north1eu-west2(欧洲)以及 uk-south1(英国),不同旗舰模型固定在特定位置——例如 DeepSeek-V4-Flash 在 us-central1、Kimi-K3 在 eu-west2、GLM-5.2 在 uk-south1。中国大陆无区域端点,也无官方中国访问计划,因此国内生产使用需要稳定的海外代理或前置该 API 的聚合商。对延迟敏感的工作,Fast 档与专用端点(可固定到所选区域)能提供比共享多租户调度更可预测的服务。

🎯 适合谁

三类用户最合适。想要厂商中立开源模型的团队用一个 OpenAI 兼容 Key 就能拿到 DeepSeek、Qwen、GLM、Kimi 与 Nemotron——当你希望在不换厂商的情况下切换权重时很有用。会超出代理推理规模的初创团队可以先从托管 API 起步,之后把微调或裸 GPU 工作负载迁入同一 Nebius 账号,而非移植到另一朵云。对延迟敏感的构建者受益于 Base/Fast 拆分与去除固定 RPM 上限的动态限流。代价是它并非前沿闭源模型厂商,也没有中国大陆直连路径。

⚠️ 需注意的局限

  • 中国大陆无端点——生产访问需代理或聚合商。
  • 仅开源权重:无第一方前沿闭源模型(对比 GPT-5、Claude、Gemini)。
  • 按 token 价格随每款模型背后的 GPU 配置(B200 vs H100)浮动,Base/Fast 价差需按你的负载评估。
  • 文档与控制台面向开发者、仅英文。
  • 品牌在美国/欧洲市场更知名,中文资料与社区较少。
  • 限流自动扩容是动态的——按 20 倍弹性上限规划,而非假设固定 RPM。
  • 专用端点与裸 GPU 容量与托管推理分别计价。

🎯 结论

当你想要一个真正中立的开源权重目录、以低成本价格提供服务,并且能在同一账号内增长到 GPU 计算与微调时,Nebius Token Factory 是合适的选择。DeepSeek-V4-Flash 的 $0.14/$0.28 与 Qwen3-235B 的 $0.20/$0.60 把它稳稳放入最便宜档,英伟达的持股与 684% 的营收增长则指向其背后有实力的基础设施。Fast 档与 20 倍动态限流对延迟敏感与突发负载都很友好。若追求最便宜的纯开源推理与最广目录,DeepInfraTogether AI 依然强劲;若要带裸 GPU 市场的 GPU 云混合方案,可对比 HyperbolicRunPod。想要开源模型与直接硬件访问在同一屋檐下的团队,Nebius 是差异化之选。

🔗 官方资源

FAQ

Nebius Token Factory 是否 OpenAI 兼容?
是。将 OpenAI client 的 base_url 指向 https://api.tokenfactory.nebius.com/v1/,使用标准 chat-completions 调用即可。

Nebius Token Factory 如何计费?
按 token 按量付费:DeepSeek-V4-Flash $0.14/$0.28、Qwen3-235B $0.20/$0.60、MiniMax-M3 $0.30/$1.20、Llama-3.3-70B $0.13/$0.40、GLM-5.2 $1.40/$4.40、Kimi-K3 $3/$15(每百万)。无设置费、无月最低消费。

有免费档吗?
没有永久免费档,但无设置费、无月费——按用量付费,动态限流自动扩容至 20 倍。

什么是 Fast 档?
在模型 id 后加 -fast,用更高的按 token 单价换取更低延迟(更小批量 + 投机解码),输出质量不变。

国内能用吗?
不能直接使用——需代理或聚合商,无大陆区域端点(活跃区域为 us-central1、eu-north1、eu-west2、uk-south1)。

Nebius 提供 GPU 与微调吗?
提供——同一账号可按需拉起 H100/H200/B200 GPU,并运行 LoRA 或全量微调及 Data Lab 数据集工具。