Qwen3.8-Flash-Next API 评测 2026:125B MoE + GDN/QSA 混合注意力
2026-08-26,阿里巴巴发布 Qwen3.8-Flash-Next——一个开放权重、125B 总参数的 Mixture-of-Experts 模型,每个 token 只激活 6B 参数,是首个在同一混合栈中组合 Gated DeltaNet (GDN) 与 Qwen Sparse Attention (QSA) 的 Qwen 模型。Hugging Face config.json 将架构类声明为 Qwen4ExpForConditionalGeneration,GitHub README 明确把它描述为「Qwen4 将使用架构的早期预览」。同日上线的是 Qwen3.8-Flash——OpenRouter 列出的仅托管生产版本,$0.15/M 输入 + $0.47/M 输出。本评测覆盖已核实的架构、训练成本声明(「约 1/9」于 Qwen3.7-Plus)、qwen-community-1.0 协议、各版本的访问入口,以及 Flash-Next 在 Qwen3.8-Max(2.4T 旗舰)和 Qwen3.7-Plus 之间,长上下文工作负载中的定位。
Qwen3.8 系列一览(2026-08-26)
| 版本 | 总参数 | 每 token 激活 | 协议 | 权重 | 访问入口 |
|---|---|---|---|---|---|
| Qwen3.8-Flash-Next | 125B(+ 51B N-gram + 4B MTP) | 6B | qwen-community-1.0 | ✅ HF + ModelScope | 自部署、QwenChat、DashScope(暂无公开定价) |
| Qwen3.8-Flash | 同族(托管) | 同 | 仅托管(专有) | ❌ 鉴权墙后 | QwenCloud $0.15/$0.47 · OpenRouter qwen/qwen3.8-flash · DashScope |
| Qwen3.8-Max(先发,2026-08-03) | 2.4T (MoE) | 约 256B | Qwen 开放权重 | ✅ HF | 阿里云百炼 $1.10/$3.30 · OpenRouter |
命名约定可能误导:「Flash-Next」是 Flash 的开放权重实验兄弟,不是后继。「Next」后缀表明这是一个预览 Qwen4 将用架构的研究线。无后缀的「Flash」是托管、即用、面向现有 Qwen API 表面的生产版本。
架构:GDN + QSA 混合注意力
头条创新是注意力栈。Qwen3-Next-80B-A3B-Instruct(前一条实验线)用的是 Gated Attention(带可学习 value 门的窗口化全注意力)和标准全注意力的混合。Qwen3.8-Flash-Next 把 Gated Attention 替换为 Gated DeltaNet (GDN)——一种对序列长度 O(n) 的线性注意力块,以牺牲部分精度为代价;搭配 Qwen Sparse Attention (QSA)——只在选定 token 位置运行的窗口化/稀疏全注意力块。从 Hugging Face 的 config.json 已核实:
- 48 个总层,组织为 12 个宏块,每块 4 层
- 每宏块为 3× (GDN → MoE) 后接 1× (QSA → MoE)
- MoE:每层 512 个专家(每个 token 激活 10 路由 + 1 共享)
- 其它组件:Gated Residual 连接、N-gram 嵌入(51B 额外参数,用于 next-token 感知嵌入)、Multi-Token Prediction(4B 额外)、Muon + AdamW 优化器
这与 API 成本的关系:线性注意力(GDN)在序列长度上是 O(n),密集注意力是 O(n²)。每 4 层中有 3 层是线性的,长上下文中占主导的费用就坍缩下来。QSA 这个稀疏全注意力块只在每 4 层跑一次,阿里把它定位为精度恢复步骤,捕捉纯线性注意力会丢召回的场景。结果,按 README 中阿里的声明,训练成本仅是 Qwen3.7-Plus 的「约 1/9」,能力却相当。
已核实事实(截至 2026-08-28)
| 字段 | 已核实值 |
|---|---|
| 发布日期 | 2026-08-26(GitHub README News 段) |
| HF 仓库创建时间 | 2026-08-24T08:24:59Z |
| 主参数 | 125B(MoE;每层 512 路由 + 1 共享) |
| 每 token 激活参数 | 6B(10 路由专家 + 1 共享) |
| N-gram 嵌入参数 | 51B(独立于主 125B) |
| 多 token 预测参数 | 4B |
| 三项总参 | 约 180B |
| 原生上下文 | 262,144 tokens(256K) |
| 扩展上下文(YaRN) | 1,000,000 tokens(1M) |
| 协议 | qwen-community-1.0(非 Apache 2.0) |
| 架构类(config.json) | Qwen4ExpForConditionalGeneration / model_type qwen4_exp |
| OpenRouter 列名(Flash-Next) | ❌ 截至 2026-08-28 未列出 |
| OpenRouter 列名(Flash,非 Next) | ✅ qwen/qwen3.8-flash,创建时间 2026-08-26T19:37:40Z |
| Flash(非 Next)定价 | $0.15/M 输入、$0.47/M 输出(QwenCloud、OpenRouter) |
| Flash-Next 公开定价 | 无公开定价页(QwenCloud /models/qwen3.8-flash-next 返回 404) |
为什么 Qwen4 预览对 API 用户重要
开放权重的预览发布在这个品类里很少见。大部分实验室先发论文、再发 API、几个月后才发权重。阿里第一天就把 config.json 中的 model_type: qwen4_exp 一起发了——这本身是一个强烈信号:该架构会登陆 Qwen4 生产。对 API 用户来说,这意味着三件事:
- 蒸馏目标稳定。需要在 Flash-Next 输出上微调一个更小 Qwen3.5 / Qwen3.7 模型的团队可以做,等 Qwen4 上线时这条流水线直接续上。在 125B MoE 上做微调不便宜,但 Qwen3.5-7B-Instruct 或 Qwen3.5-14B-Instruct 从 Flash-Next 输出蒸馏是可行的。
- 线性注意力经济性先行到达。如果 GDN+QSA 栈在 Qwen4 生产里站住脚,长上下文 API 经济性就会改善。Flash-Next 是金丝雀——只要长上下文召回在 benchmark 上撑住,同一套注意力布局就会以旗舰价位登陆 Qwen4 闭源权重。
- 托管定价页是今天的生产入口。如果你不需要开放权重,Flash(非 Next)以 $0.15/M 输入 + $0.47/M 输出 是入口——同架构、多模态(文本 + 图片 + 视频 → 文本)、默认 1M 上下文、无需自部署。
OpenAI 兼容接入(DashScope)
托管面是 OpenAI 兼容的 DashScope 端点。Flash 生产版本在 DashScope 和 OpenRouter 上的模型 ID 是 qwen3.8-flash;截至 2026-08-28,Flash-Next 两个面都没有。
from openai import OpenAI
client = OpenAI(
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
api_key="YOUR_DASHSCOPE_API_KEY",
)
response = client.chat.completions.create(
model="qwen3.8-flash",
messages=[
{"role": "system", "content": "你是一名严谨的金融分析师。"},
{"role": "user", "content": "总结这段 10-K 摘录中的 2026 Q2 风险因素。"},
],
max_tokens=800,
temperature=0.2,
)
print(response.choices[0].message.content)
多模态调用(图片或视频 URL → 文本)时,把 content 作为 parts 数组传入。长上下文调用时,max_tokens 设宽裕一些——Flash 生产版本默认 1M 上下文,但输出 token 仍按每 1M 输出价计费。
自部署 Flash-Next(开放权重)
HF 仓库是 Qwen/Qwen3.8-Flash-Next。125B MoE 加上 51B N-gram 嵌入和 4B MTP,总参数约 180B;fp16 下磁盘占用约 360 GB,把 N-gram 嵌入留在 fp8 后实际加载 220-260 GB。生产托管意味着 4×H100 或 4×A100-80GB 节点;研究用托管一台 8×H100 即可。vLLM 0.6+ 或 SGLang 都支持 Qwen4ExpForConditionalGeneration 架构类。
# vLLM serve 示例(以 HF 仓库 README 当前 flag 为准)
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen3.8-Flash-Next \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--enable-prefix-caching \
--port 8000
qwen-community-1.0 协议允许带署名的商用;部署前请查看仓库 LICENSE 文件了解完整使用范围边界。Qwen3.5 Apache-2.0 的部分宽松条款(无限制微调、带修改再分发)在 qwen-community-1.0 下受到限制,因此上线前做一次法务复核是值得的。
价格对比(已核实 2026-08-28)
| 模型 | 输入 ($/M) | 输出 ($/M) | 上下文 | 开放权重 |
|---|---|---|---|---|
| Qwen3.8-Flash(托管) | 0.15 | 0.47 | 1M | ❌ |
| Qwen3.8-Flash-Next(开放) | 自部署 | 自部署 | 256K 原生 / 1M 扩展 | ✅ qwen-community-1.0 |
| Qwen3.8-Max | 1.10 | 3.30 | 128K | ✅ Qwen 协议 |
| Qwen3.5-Plus | 0.28 | 0.83 | 128K | ✅ Apache 2.0 |
| Qwen3.5-Max | 0.55 | 1.65 | 128K | ✅ Apache 2.0 |
托管 Flash 的输入价大约是 Qwen3.5-Plus 的 1/1.87、Qwen3.8-Max 的 1/7.3。1M 上下文默认值是从 Plus 切到 Flash 的最强单一理由。
何时选 Flash-Next vs Flash vs Plus
要 1M 上下文 + 最低单价 + 不需要检查或微调权重:选 Qwen3.8-Flash(托管)。OpenRouter 的 qwen/qwen3.8-flash 直接配 OpenAI Python SDK;DashScope 原生支持多模态。
要 权重本身:选 Qwen3.8-Flash-Next(开放)——蒸馏流水线、自有数据微调、数据驻留合规的本地部署,或研究 GDN+QSA 架构。生产推理预算 4×H100,部署前评估 qwen-community-1.0 协议条款。
要 单轮质量优先:选 Qwen3.8-Max。2.4T 旗舰在硬推理和代码生成 benchmark 上仍领先;Flash 定位不同。
要 Apache 2.0 协议:选 Qwen3.5-Plus。价格略高于 Flash,但避免 qwen-community-1.0 的协议摩擦。Apache 2.0 是当前 Qwen 系列最宽松的协议。
限制与风险
- 截至 2026-08-28 无 Flash-Next 公开定价。自部署是当前唯一有可核实经济性的路径,对任何第三方报价保持警惕。
- 协议是 qwen-community-1.0,不是 Apache 2.0。多数 Qwen3.5 权重用的 Apache 2.0 不适用于 Flash-Next。商用部署前请阅读 HF 仓库 LICENSE 文件。
- OpenRouter 不列 Flash-Next。只有 Flash(托管)上了 OpenRouter。如果你的栈只走 OpenRouter,会路由到
qwen/qwen3.8-flash,不是开放权重版本。 - 自部署成本不小。180B 参数 fp16 = 至少 360 GB 显存;生产服务建议 4×H100 或 4×A100-80GB。
- 长上下文扩展走 YaRN。原生 256K 是阿里完整验证过的;1M 扩展是 YaRN 风格,公开文档里 benchmark 不如原生版深。
- 多模态在托管 Flash 上,不在开放 Flash-Next 上。需要图片或视频 → 文本的话,走 DashScope 或 OpenRouter,不要走自部署权重。
结论
Qwen3.8-Flash-Next 是一个可信的、开放权重的预览——预览阿里将在 Qwen4 中发布的架构。GDN+QSA 混合是 Qwen3-Next Gated Attention 之上的实质进步:线性块主导长上下文,稀疏全注意力块每 4 层恢复精度,README 中已核实的「比 Qwen3.7-Plus 训练成本 1/9」声明正是那种效率数学——如果它在生产里站住脚,将重塑 2026 下半年的长上下文 API 经济性。
对 API 用户来说,决策树很短。要今天的廉价长上下文,Qwen3.8-Flash(托管)以 $0.15/$0.47 在 DashScope 或 OpenRouter 上是入口——多模态、1M 上下文、OpenAI 兼容。要权重用于蒸馏、微调或本地部署,Qwen3.8-Flash-Next 在 Hugging Face 上是唯一开放选项,预算 4×H100 自部署和 qwen-community-1.0 协议条款。
旗舰 Qwen3.8-Max 在硬推理 benchmark 上仍以 7× 的输入价胜出;Qwen3.5-Plus 的 Apache-2.0 线在协议摩擦比价格更重要时是合适选择。
如果要把 Qwen3.8-Flash 跟 OpenAI、Anthropic、Groq 一起路由到同一个 OpenAI 兼容密钥并做跨区故障切换,FreeModel 是最简单的衔接:一个仪表盘、一份账单关系、没有胶水代码的路由控制。
参考资料
披露声明
APIRank 文章中的合作伙伴链接可能产生联盟佣金。编辑判断独立。