DeepInfra (DeepInfra)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Llama 3.3 70B: $0.49/M, DeepSeek-V3: $0.99/M, DeepSeek-R1: $1.09/M | 每百万 tokens |
| 输出 (Output) | Llama 3.3 70B: $0.73/M, DeepSeek-V3: $0.99/M, DeepSeek-R1: $1.09/M | 每百万 tokens |
注册即送免费额度(每日有限免费调用)
🤖 支持模型(共 50 个)
✨ 优势
- ✓ 极具竞争力的定价(Llama 3.3 70B $0.49/M)
- ✓ 模型种类丰富(50+ 开源模型)
- ✓ 单 Key 访问所有模型
- ✓ API 稳定性表现良好口碑
- ✓ 大部分模型支持 Function Calling
- ✓ OpenAI 兼容 API,零改造迁移
⚠️ 不足
- × 国内需代理访问
- × 不支持多模态模型
- × 免费额度有限
- × 非一线品牌,品牌信任度有待积累
- × 不支持企业级 SLA
🎯 适合场景
成本敏感的开源模型推理部署;需要快速切换多个模型的开发测试场景;Function Calling 开源方案
💰 价格与方案
| 模型 | 输入 ($/百万) | 输出 ($/百万) | 最佳用途 |
|---|---|---|---|
| Llama 3.3 70B Instruct | $0.49 | $0.73 | 通用开源聊天,低成本推理 |
| Llama 3.1 405B Instruct | $1.79 | $1.79 | 对标 OpenAI 级别的前沿开源推理 |
| DeepSeek-V3 | $0.99 | $0.99 | 对称 MoE — 代码 + 推理 + RAG 平价计费 |
| DeepSeek-R1 | $1.09 | $1.09 | 推理链生成,思维链输出 |
| Qwen2.5 72B Instruct | $0.49 | $0.49 | 英中双语聊天,128K 上下文 |
| Qwen2.5-Coder 32B Instruct | $0.18 | $0.18 | 目录上最便宜的编程模型 |
| Mistral Large (2407) | $1.99 | $5.99 | 欧洲托管的前沿 Mistral 推理 |
| Mixtral 8x22B | $0.65 | $0.65 | Llama 不可用时的 MoE 备选 |
| 全模型 — 免费试用 | 每日刷新,约 1k tokens | — | 无需注册即可沙盒测试 |
🔧 API 与开发者体验
- •API 风格: 兼容 OpenAI /chat/completions 端点 — OpenAI SDK 客户端可直接替换。无需单独的 DeepInfra SDK。
- •Base URL: https://api.deepinfra.com/v1/openai — 单一全球端点,无需区域选择。
- •模型选择: 50+ 开源模型共用一个 API Key — 通过 `model` 参数切换,无需更改账号或凭据。
- •流式输出: 所有聊天模型支持 SSE token 流;嵌入模型返回批量数组;图像模型通过 HTTP chunked 流式推送进度。
- •函数调用: Llama 3.x、Qwen2.5、Mistral、DeepSeek-V3 支持 JSON-schema 工具定义;旧版 Mixtral 与老 WizardLM 检查点不支持。
- •嵌入: BGE / E5 / sentence-transformers 系列经 /v1/embeddings 端点提供 — 与 OpenAI 形状一致;向量维度按模型变化。
- •异步推理 API: 长上下文 / 批量任务经异步端点接收;结果可在 24 小时内凭 request_id 轮询。
🏗️ Day-One 模型托管
DeepInfra 的核心产品是 day-one 模型托管 — 让新发布的开源权重在公开后数小时内通过 API 提供给用户,通常比一线超大规模云厂商更快。2026 年的目录印证了这一模式:Llama 3.3 70B、DeepSeek-V3、DeepSeek-R1 与 Qwen2.5 系列都在上游发布后 1-7 天内在 DeepInfra 上线。对于想在签约 Bedrock / Vertex / Azure 之前先测试新模型的开发者,DeepInfra 是阻力最小的路径:没有企业销售电话、没有月最低消费、没有区域限制。定价采用统一的每百万 token 费率,与实际上下文长度无关 — 没有 >100K 上下文的溢价、没有批量折扣悬崖、没有预置吞吐量合同。取舍在于 DeepInfra 运行在通用 GPU 池(主要是 H100 + H200)且不发布正式 SLA;可用性是尽力而为,通常 99.5-99.9%,在热门模型发布时突发容量可能受限。对于生产负载,典型模式是先用 DeepInfra 原型,再用同样的 OpenAI 兼容请求迁移到 Bedrock / Vertex 以获得 SLA 等级。
🌐 区域可用性 & 延迟
DeepInfra 的 API(api.deepinfra.com)无法从中国大陆直接访问 — 推理端点与异步轮询端点都需要稳定的代理或 VPN。非中国大陆区域延迟稳定:Llama 70B 级模型在 H100 硬件上首 token 时间通常 250-400 ms,流式补全吞吐约 80 tokens/sec。没有区域选择或多区域路由 — DeepInfra 运行单一全球池,因此延迟取决于调用方到最近 US/EU 边缘的网络路径,而非区域集群。北京 / 上海 / 深圳开发者的常见变通方案有三:(1) 通过已为 OpenAI / Anthropic 流量做代理的美国区域 VPS 转发;(2) 使用聚合器(OpenRouter、Portkey、Cloudflare AI Gateway)— 它们部署 CN 边缘节点并替你签署上游合同;(3) 若中国数据驻留是首要约束,在阿里云 PAI / 腾讯 TI-ONE 自托管同样的开源权重。DeepInfra 不提供企业级数据驻留等级。