通义千问(阿里) (Qwen (Alibaba))
收录于 https://qwen.ai
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Qwen3.8-Max: ¥8/M, Qwen3.5-Max: ¥4/M, Qwen3.5-Plus: ¥2/M | 每百万 tokens |
| 输出 (Output) | Qwen3.8-Max: ¥24/M, Qwen3.5-Max: ¥12/M, Qwen3.5-Plus: ¥6/M | 每百万 tokens |
新用户 100万 tokens 免费额度(90天有效);Qwen3.5 系列开源可自部署
🤖 支持模型(共 16 个)
✨ 优势
- ✓ Qwen3.8-Flash(托管版,2026-08-26):$0.15/$0.47 per 1M tokens,多模态,1M 上下文,OpenAI 兼容
- ✓ Qwen3.8-Flash-Next(开放权重,2026-08-26):125B/6B MoE,Gated DeltaNet + Qwen Sparse Attention 混合注意力,Qwen4 架构预览,qwen-community-1.0 协议
- ✓ Qwen3.8-Max 2.4T 参数开源旗舰(2026-08-03 发布),编码+多 Agent 协作基准双榜首
- ✓ Qwen 系列开源生态最好(海外 HuggingFace 排行领先,自部署可选 7B-110B 全档)
- ✓ 百炼平台:模型服务 + RAG + Agent 全栈,国内直连稳定
- ✓ Qwen-Omni-Turbo 多模态(图文音频全支持),Qwen-VL-Plus 视觉理解
- ✓ 国际通道:OpenRouter / HuggingFace / 阿里云国际站多入口
⚠️ 不足
- × Qwen3.8-Max 价格高于 Qwen3.5-Plus(4× 倍率,旗舰定位)
- × 百炼平台功能复杂(百炼 > 模型服务 > 应用搭建),学习曲线陡
- × 海外用户访问百炼需走国际站(bailian-ss.aliyun.com 有独立定价)
- × Qwen 系列原生 Function Calling 不如 OpenAI / Anthropic 稳定
- × Stream 模式在长上下文下偶发延迟抖动
🎯 适合场景
国内企业级 AI 应用;需要 Qwen-Max 最高质量输出的场景;阿里云既有客户;自部署开源权重
💰 价格与方案
| 模型 | 输入 ($/百万 token) | 输出 ($/百万 token) | 备注 |
|---|---|---|---|
| Qwen3.8-Max | $1.10 | $3.30 | 2.4T 旗舰,2026-08-03 发布 |
| Qwen3.8-Max-Preview | $1.10 | $3.30 | Preview 档(同价) |
| Qwen3.5-Max | $0.55 | $1.65 | 上一代旗舰 |
| Qwen3.5-Plus | $0.28 | $0.83 | 中端,性价比最佳 |
| Qwen3.5-72B-Instruct | $0.55 | $1.65 | 开源权重,可自部署 |
| Qwen3.5-7B-Instruct | $0.07 | $0.21 | 开源权重,边缘部署 |
| QwQ-32B | $0.28 | $0.83 | 推理专精 |
| Qwen-Coder-Plus | $0.28 | $0.83 | 代码微调变体 |
🔧 API 与开发者体验
- •API 风格: 阿里云百炼与 OpenRouter 均提供 OpenAI 兼容 /v1/chat/completions;高级功能(function calling、多模态)需用原生 DashScope SDK。
- •SDK 可用性: 官方 DashScope Python/Node SDK;社区 SDK 覆盖 Go、Java、Rust;OpenAI SDK 通过 base_url 替换即可直接使用。
- •工具调用: 通过 Qwen-Agent 框架调用 function;单工具流程稳定,多工具选择可能需要提示工程。
- •上下文长度: Qwen3.8-Max:128K;Qwen3.5-Max/Plus:128K;长上下文基准强(100K 时 Needle-in-Haystack >99%)。
- •开源权重: Qwen3.5 系列全面开源(多数 Apache 2.0);7B/14B/32B/72B/110B 规格;支持 vLLM / TGI / llama.cpp 部署。
- •流式输出: 支持 SSE 流式;DashScope SDK 自动处理重连;Qwen-VL-Plus 支持视觉流式推理。
- •Batch API: 通过 DashScope batch 端点可用,5 折;24 小时 SLA 完成。
🧠 代码与 Agent 能力
Qwen3.8-Max(2.4T 参数,2026-08-03 开源发布)在 HN/Reddit 讨论中登顶代码与多 Agent 协作基准,成为首个在 SWE-bench Polyglot 和 Aider polyglot 评测中领跑的开源权重模型。该模型支持 128K 上下文,长上下文检索(100K 时 Needle-in-Haystack >99%)表现强,与 Claude Opus 5 / GPT-5.6 在长上下文 Agent 任务中具备竞争力。 Agent 工作流方面,Qwen3.8-Max 与 Qwen-Agent 框架(开源 Python SDK)集成,原生提供工具调用、记忆与多 Agent 编排能力。Qwen-Coder-Plus 变体针对代码补全与重构微调。Qwen3.5-72B-Instruct 仍是自部署场景的甜点规格 —— 强劲代码性能,云端 API 成本的几分之一即可跑起来。
🌐 区域可用性与延迟
Qwen 是所有主流大模型厂商中中国大陆直连体验最强的 —— 阿里云百炼(bailian.console.aliyun.com)从国内稳定低延迟访问,短 prompt 典型响应时间 50-150 毫秒。海外用户可通过阿里云国际站(bailian-ss.aliyun.com)使用同款模型,定价独立;OpenRouter 与 HuggingFace Inference Endpoints 提供全球访问。 从欧美直连阿里云国际站一般 200-400 毫秒;OpenRouter 增加约 50-100 毫秒路由开销,但提供跨厂商统一计费。对面向中国大陆用户的大规模生产负载,阿里云百炼仍是标准方案。在 4×A100 集群上自部署 Qwen3.5(Apache 2.0)可彻底消除 API 延迟,适合高吞吐场景。