硅基流动 (SiliconFlow)

收录于 https://siliconflow.cn

综合排名 #12 ⭐ 可考虑
✅ 国内直连 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) ¥0.4-2/1M tokens (Qwen2.5-7B ~¥0.4,Llama 3.3 70B ~¥2) 每百万 tokens
输出 (Output) ¥0.4-2/1M tokens 每百万 tokens
缓存读取 部分模型支持 享折扣
💡 免费额度

注册送 ¥1-200 免费额度(按活动调整),足够跑 1-20M tokens

🤖 支持模型(共 100 个)

Qwen/Qwen3.5-Plus Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-Coder-32B-Instruct deepseek-ai/DeepSeek-R1 deepseek-ai/DeepSeek-V3 THUDM/glm-4-9b-chat meta-llama/Meta-Llama-3.3-70B-Instruct meta-llama/Meta-Llama-3.1-405B-Instruct BAAI/Aquila-7B NexFlow/Nex-N2-Pro

✨ 优势

  • 国内一站式模型托管,100+ 开源模型在线
  • Qwen3.5 / DeepSeek / GLM-4 / Llama 3 全覆盖
  • 国内直连,无需代理
  • 首发 Nex-N2-Pro(397B MoE 推理模型)
  • ¥0.4/1M tokens 起,价格低于 OpenAI 官方价 80%
  • 支持 OpenAI 兼容 API

⚠️ 不足

  • × 海外访问需走代理
  • × 不支持 GPT/Claude 系列
  • × 模型更新滞后官方 1-2 周
  • × 无 Function Calling 一等公民支持
  • × 价格对汇率波动敏感

🎯 适合场景

国内开发者;想一站式调用国产开源模型(Qwen3.5/DeepSeek/GLM)的团队;追求极致性价比的 RAG/推理场景

💰 价格与方案

模型输入 (¥/百万)输出 (¥/百万)缓存命中备注
DeepSeek-V4-Flash1.002.000.02旗舰 MoE,1M 上下文(约)
DeepSeek-V4-Pro12.0024.001.00预留资源高端档
DeepSeek-V3.24.006.000.40上代全能模型
GLM-5.28.0028.002.00智谱前沿编程模型
Kimi-K2.7-Code6.5027.001.30月之暗面代码专项
Qwen3.5-122B-A10B0.806.40高性价比 MoE 主力
Nex-N2-Pro1.757.000.17397B MoE 推理模型
MiniMax-M2.52.108.400.21均衡通用模型

🔧 API 与开发者体验

  • OpenAI 兼容 API: 单一端点镜像 OpenAI chat-completions 格式,大多数 OpenAI SDK 更换 base URL(https://api.siliconflow.cn/v1)和 API key 后即可接入,迁移成本极低。
  • 统一模型目录: 100+ 开源模型(DeepSeek、Qwen、GLM、Kimi、Llama、MiniMax 等)共用一个 key、一个计费账户;无需逐模型注册或独立凭据。
  • 免费额度与免费模型: 新用户注册即送免费额度,且一批 serverless 模型以 ¥0 提供(bge 向量、GLM-Z1-9B、OCR),适合零成本原型与嵌入/RAG 场景。
  • Pro 档: 付费 'Pro' 预留档可购买更高吞吐(TPQ)与优先首 Token 延迟,缓解共享免费池的并发上限,适合生产流量。
  • Serverless 按量计费: 无需管理 GPU——硅基流动在共享集群上托管 100+ 模型,按每百万 token(输入/输出/缓存)计费,流量爆发时自动扩缩。
  • 微调与向量嵌入: 支持模型微调,并提供完整的嵌入套件(bge-m3、重排序器),不仅是对话补全,更能一站式构建 RAG 流水线。
  • 实时与多模态: 实时语音与视觉模型与文本并列提供,流式/语音与 RAG 场景共用同一套 API。

🧠 中国本土开源模型托管

硅基流动的核心优势在于:一个中国本土、无需自建基础设施的开源模型平台。它将 100+ 模型——DeepSeek、Qwen、GLM、Kimi、Llama、MiniMax 等——加载到共享 GPU 集群上,通过同一个 OpenAI 兼容 API 按 token 出售。这消除了中国团队常遇到的两大摩擦:注册并管理租用 GPU、以及跨境延迟。新用户注册即送免费额度,并提供一批真正的 ¥0 模型(bge 向量、小型 GLM、OCR)用于零成本原型。这种广度换来的代价是深度:因为同时镜像多个模型家族而非押注单一模型,对单模型的优化与首 Token 性能会落后于专注的自有厂商,最快的 'Pro' 吞吐也需要付费预留档。

🌐 中国访问与延迟

硅基流动是原生面向中国大陆的服务:api.siliconflow.cn 端点从国内无需代理即可直连,无 GFW 规避需求、无跨境出口费用,访问其阿里云托管的集群延迟通常为个位数到十几毫秒 RTT。以人民币预充值计费,同一个账户即可使用整个开源模型目录。对中国大陆以外的团队,访问方向相反——海外一般需通过代理访问大陆托管的 API,且英文文档比中文文档单薄,非中文团队可能在配置与支持上略滞后。该平台更适合被看作开源模型生态之上、面向中国优先的服务层,而非全球分布式 API。