硅基流动 (SiliconFlow)
综合排名 #12 ⭐ 可考虑
✅ 国内直连 | 🌍 国际
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | ¥0.4-2/1M tokens (Qwen2.5-7B ~¥0.4,Llama 3.3 70B ~¥2) | 每百万 tokens |
| 输出 (Output) | ¥0.4-2/1M tokens | 每百万 tokens |
| 缓存读取 | 部分模型支持 | 享折扣 |
💡 免费额度
注册送 ¥1-200 免费额度(按活动调整),足够跑 1-20M tokens
🤖 支持模型(共 100 个)
Qwen/Qwen3.5-Plus Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-Coder-32B-Instruct deepseek-ai/DeepSeek-R1 deepseek-ai/DeepSeek-V3 THUDM/glm-4-9b-chat meta-llama/Meta-Llama-3.3-70B-Instruct meta-llama/Meta-Llama-3.1-405B-Instruct BAAI/Aquila-7B NexFlow/Nex-N2-Pro
✨ 优势
- ✓ 国内一站式模型托管,100+ 开源模型在线
- ✓ Qwen3.5 / DeepSeek / GLM-4 / Llama 3 全覆盖
- ✓ 国内直连,无需代理
- ✓ 首发 Nex-N2-Pro(397B MoE 推理模型)
- ✓ ¥0.4/1M tokens 起,价格低于 OpenAI 官方价 80%
- ✓ 支持 OpenAI 兼容 API
⚠️ 不足
- × 海外访问需走代理
- × 不支持 GPT/Claude 系列
- × 模型更新滞后官方 1-2 周
- × 无 Function Calling 一等公民支持
- × 价格对汇率波动敏感
🎯 适合场景
国内开发者;想一站式调用国产开源模型(Qwen3.5/DeepSeek/GLM)的团队;追求极致性价比的 RAG/推理场景
💰 价格与方案
| 模型 | 输入 (¥/百万) | 输出 (¥/百万) | 缓存命中 | 备注 |
|---|---|---|---|---|
| DeepSeek-V4-Flash | 1.00 | 2.00 | 0.02 | 旗舰 MoE,1M 上下文(约) |
| DeepSeek-V4-Pro | 12.00 | 24.00 | 1.00 | 预留资源高端档 |
| DeepSeek-V3.2 | 4.00 | 6.00 | 0.40 | 上代全能模型 |
| GLM-5.2 | 8.00 | 28.00 | 2.00 | 智谱前沿编程模型 |
| Kimi-K2.7-Code | 6.50 | 27.00 | 1.30 | 月之暗面代码专项 |
| Qwen3.5-122B-A10B | 0.80 | 6.40 | — | 高性价比 MoE 主力 |
| Nex-N2-Pro | 1.75 | 7.00 | 0.17 | 397B MoE 推理模型 |
| MiniMax-M2.5 | 2.10 | 8.40 | 0.21 | 均衡通用模型 |
🔧 API 与开发者体验
- •OpenAI 兼容 API: 单一端点镜像 OpenAI chat-completions 格式,大多数 OpenAI SDK 更换 base URL(https://api.siliconflow.cn/v1)和 API key 后即可接入,迁移成本极低。
- •统一模型目录: 100+ 开源模型(DeepSeek、Qwen、GLM、Kimi、Llama、MiniMax 等)共用一个 key、一个计费账户;无需逐模型注册或独立凭据。
- •免费额度与免费模型: 新用户注册即送免费额度,且一批 serverless 模型以 ¥0 提供(bge 向量、GLM-Z1-9B、OCR),适合零成本原型与嵌入/RAG 场景。
- •Pro 档: 付费 'Pro' 预留档可购买更高吞吐(TPQ)与优先首 Token 延迟,缓解共享免费池的并发上限,适合生产流量。
- •Serverless 按量计费: 无需管理 GPU——硅基流动在共享集群上托管 100+ 模型,按每百万 token(输入/输出/缓存)计费,流量爆发时自动扩缩。
- •微调与向量嵌入: 支持模型微调,并提供完整的嵌入套件(bge-m3、重排序器),不仅是对话补全,更能一站式构建 RAG 流水线。
- •实时与多模态: 实时语音与视觉模型与文本并列提供,流式/语音与 RAG 场景共用同一套 API。
🧠 中国本土开源模型托管
硅基流动的核心优势在于:一个中国本土、无需自建基础设施的开源模型平台。它将 100+ 模型——DeepSeek、Qwen、GLM、Kimi、Llama、MiniMax 等——加载到共享 GPU 集群上,通过同一个 OpenAI 兼容 API 按 token 出售。这消除了中国团队常遇到的两大摩擦:注册并管理租用 GPU、以及跨境延迟。新用户注册即送免费额度,并提供一批真正的 ¥0 模型(bge 向量、小型 GLM、OCR)用于零成本原型。这种广度换来的代价是深度:因为同时镜像多个模型家族而非押注单一模型,对单模型的优化与首 Token 性能会落后于专注的自有厂商,最快的 'Pro' 吞吐也需要付费预留档。
🌐 中国访问与延迟
硅基流动是原生面向中国大陆的服务:api.siliconflow.cn 端点从国内无需代理即可直连,无 GFW 规避需求、无跨境出口费用,访问其阿里云托管的集群延迟通常为个位数到十几毫秒 RTT。以人民币预充值计费,同一个账户即可使用整个开源模型目录。对中国大陆以外的团队,访问方向相反——海外一般需通过代理访问大陆托管的 API,且英文文档比中文文档单薄,非中文团队可能在配置与支持上略滞后。该平台更适合被看作开源模型生态之上、面向中国优先的服务层,而非全球分布式 API。