DeepInfra (DeepInfra)

收录于 https://deepinfra.com

综合排名 #15 ⭐ 可考虑
❌ 需代理 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Llama 3.3 70B: $0.49/M, DeepSeek-V3: $0.99/M, DeepSeek-R1: $1.09/M 每百万 tokens
输出 (Output) Llama 3.3 70B: $0.73/M, DeepSeek-V3: $0.99/M, DeepSeek-R1: $1.09/M 每百万 tokens
💡 免费额度

注册即送免费额度(每日有限免费调用)

🤖 支持模型(共 50 个)

Meta-Llama-3.3-70B-Instruct Meta-Llama-3.1-405B-Instruct Qwen2.5-72B-Instruct Qwen2.5-Coder-32B-Instruct DeepSeek-R1 DeepSeek-V3 Mistral-Large-2407 Mistral-Nemo Mixtral-8x22B-Instruct-v0.1 WizardLM-2-8x22B

✨ 优势

  • 极具竞争力的定价(Llama 3.3 70B $0.49/M)
  • 模型种类丰富(50+ 开源模型)
  • 单 Key 访问所有模型
  • API 稳定性表现良好口碑
  • 大部分模型支持 Function Calling
  • OpenAI 兼容 API,零改造迁移

⚠️ 不足

  • × 国内需代理访问
  • × 不支持多模态模型
  • × 免费额度有限
  • × 非一线品牌,品牌信任度有待积累
  • × 不支持企业级 SLA

🎯 适合场景

成本敏感的开源模型推理部署;需要快速切换多个模型的开发测试场景;Function Calling 开源方案

💰 价格与方案

模型输入 ($/百万)输出 ($/百万)最佳用途
Llama 3.3 70B Instruct$0.49$0.73通用开源聊天,低成本推理
Llama 3.1 405B Instruct$1.79$1.79对标 OpenAI 级别的前沿开源推理
DeepSeek-V3$0.99$0.99对称 MoE — 代码 + 推理 + RAG 平价计费
DeepSeek-R1$1.09$1.09推理链生成,思维链输出
Qwen2.5 72B Instruct$0.49$0.49英中双语聊天,128K 上下文
Qwen2.5-Coder 32B Instruct$0.18$0.18目录上最便宜的编程模型
Mistral Large (2407)$1.99$5.99欧洲托管的前沿 Mistral 推理
Mixtral 8x22B$0.65$0.65Llama 不可用时的 MoE 备选
全模型 — 免费试用每日刷新,约 1k tokens无需注册即可沙盒测试

🔧 API 与开发者体验

  • API 风格: 兼容 OpenAI /chat/completions 端点 — OpenAI SDK 客户端可直接替换。无需单独的 DeepInfra SDK。
  • Base URL: https://api.deepinfra.com/v1/openai — 单一全球端点,无需区域选择。
  • 模型选择: 50+ 开源模型共用一个 API Key — 通过 `model` 参数切换,无需更改账号或凭据。
  • 流式输出: 所有聊天模型支持 SSE token 流;嵌入模型返回批量数组;图像模型通过 HTTP chunked 流式推送进度。
  • 函数调用: Llama 3.x、Qwen2.5、Mistral、DeepSeek-V3 支持 JSON-schema 工具定义;旧版 Mixtral 与老 WizardLM 检查点不支持。
  • 嵌入: BGE / E5 / sentence-transformers 系列经 /v1/embeddings 端点提供 — 与 OpenAI 形状一致;向量维度按模型变化。
  • 异步推理 API: 长上下文 / 批量任务经异步端点接收;结果可在 24 小时内凭 request_id 轮询。

🏗️ Day-One 模型托管

DeepInfra 的核心产品是 day-one 模型托管 — 让新发布的开源权重在公开后数小时内通过 API 提供给用户,通常比一线超大规模云厂商更快。2026 年的目录印证了这一模式:Llama 3.3 70B、DeepSeek-V3、DeepSeek-R1 与 Qwen2.5 系列都在上游发布后 1-7 天内在 DeepInfra 上线。对于想在签约 Bedrock / Vertex / Azure 之前先测试新模型的开发者,DeepInfra 是阻力最小的路径:没有企业销售电话、没有月最低消费、没有区域限制。定价采用统一的每百万 token 费率,与实际上下文长度无关 — 没有 >100K 上下文的溢价、没有批量折扣悬崖、没有预置吞吐量合同。取舍在于 DeepInfra 运行在通用 GPU 池(主要是 H100 + H200)且不发布正式 SLA;可用性是尽力而为,通常 99.5-99.9%,在热门模型发布时突发容量可能受限。对于生产负载,典型模式是先用 DeepInfra 原型,再用同样的 OpenAI 兼容请求迁移到 Bedrock / Vertex 以获得 SLA 等级。

🌐 区域可用性 & 延迟

DeepInfra 的 API(api.deepinfra.com)无法从中国大陆直接访问 — 推理端点与异步轮询端点都需要稳定的代理或 VPN。非中国大陆区域延迟稳定:Llama 70B 级模型在 H100 硬件上首 token 时间通常 250-400 ms,流式补全吞吐约 80 tokens/sec。没有区域选择或多区域路由 — DeepInfra 运行单一全球池,因此延迟取决于调用方到最近 US/EU 边缘的网络路径,而非区域集群。北京 / 上海 / 深圳开发者的常见变通方案有三:(1) 通过已为 OpenAI / Anthropic 流量做代理的美国区域 VPS 转发;(2) 使用聚合器(OpenRouter、Portkey、Cloudflare AI Gateway)— 它们部署 CN 边缘节点并替你签署上游合同;(3) 若中国数据驻留是首要约束,在阿里云 PAI / 腾讯 TI-ONE 自托管同样的开源权重。DeepInfra 不提供企业级数据驻留等级。