Qwen 3.8 27B 落地 Cloudflare Workers AI:边缘视觉、推理与 262K 上下文

2026 年 8月17日 — 在 Cloudflare 上线 DeepSeek V4 Flash 与 Pro 仅三天之后 — Workers AI 又新增了 Qwen 3.8 27B,模型句柄 @cf/qwen/qwen3.8-27b。这是阿里通义千问家族的 270 亿参数视觉语言模型,具备推理、函数调用与 262,144 token 上下文窗口,定价为每百万输入 token $0.45、输出 $3.20。本文围绕实际发布的特性、可验证的边缘定价、典型 Agent 场景,以及 Workers AI 与阿里百炼直连、FreeModel 这类聚合器之间的取舍展开。

🌍 一句话结论: 当你已经在用 Cloudflare Workers、需要视觉+推理+函数调用、且不需要 1M 上下文或 prompt-cache 折扣时,Workers AI Qwen 3.8 27B 是同档位中最省心的入口。它的局限在于:价位介于 Workers AI 上的纯文本 Llama 与较贵的 DeepSeek V4 Pro 之间,且阿里仍优先在百炼首发 Qwen 新变种。

8 月 17 日发生了什么

Cloudflare 的 8 月 17 日 changelog 确认只有一个新模型 id:@cf/qwen/qwen3.8-27b,标签为 "Cloudflare-hosted" 并具备视觉、函数调用、推理三项徽章。模型页面将其描述为「a 27-billion-parameter instruction-tuned language model from Alibaba's Qwen family, designed for vision, efficient general-purpose text generation and agentic workloads」。与 frontier 限速清单(Kimi K2.6 / GLM-5.2 / DeepSeek V4 那一档)不同,Qwen 3.8 27B 不在受限名单 — 它沿用默认的 Text Generation 300 req/min 限速,并可以使用 Workers Free 套餐每日 10,000 Neurons 免费额度

模型同时接受文本与图像输入(在 Cloudflare 分类里叫 Image-Text-to-Text),支持 thinking/reasoning 模式做逐步推理,并提供 function calling 让 Agent 在多轮会话里调用工具。262K 上下文与 Workers AI 上的 Mistral Small 3.1、GLM 4.7 Flash 同档 — 足以容纳一整块代码库、较长的 Agent 轨迹,或者多章节 RAG 段落,但远不及同平台 DeepSeek V4 Pro/Flash 的 1M。

美元与 Neurons 双轨定价

Workers AI 展示按模型的单位定价,但内部仍以 Neurons 计费。2026 年 8 月 18 日官方定价表中 Qwen 3.8 27B 的条目:

档位每百万 token每百万 Neurons
输入$0.4540,909
输出$3.20290,909

两点值得注意:

  1. 没有缓存输入行。 与 DeepSeek V4 Pro($0.044/M 缓存)、Kimi K2.6($0.10/M 缓存)、GLM-5.2($0.26/M 缓存)不同,Qwen 3.8 27B 没有公开的 prompt-cache 价。如果你主要做的是大量重复 system prompt 的请求,缓存缺失会主导成本 — 这时候开启缓存的 DeepSeek V4 Pro 在 Workers AI 上的实际成本反而可能更划算。
  2. 免费额度够小。 10,000 Neurons/天大约对应 244K 输入 token 或 34K 输出 token — 够几次开发测试,撑不住生产流量。超过免费额度后按 $0.011 / 1,000 Neurons 收费。

Qwen 3.8 27B 在 Workers AI 模型矩阵中的位置

对比 2026 年 8 月 18 日 Workers AI 上视觉/推理类模型的每百万输入价:

模型输入 / M输出 / M上下文备注
@cf/qwen/qwen3.8-27b$0.45$3.20262K视觉 + 推理 + 工具
@cf/deepseek-ai/deepseek-v4-flash-0731$0.44$1.321M缓存 $0.014,需付费
@cf/deepseek-ai/deepseek-v4-pro-0813$1.32$3.961M缓存 $0.044,需付费
@cf/zai-org/glm-4.7-flash$0.06$0.40128K低价纯文本
@cf/mistralai/mistral-small-3.1-24b-instruct$0.35$0.55128K无视觉
@cf/meta/llama-3.2-11b-vision-instruct$0.049$0.676128K最便宜视觉

2026 年 8 月的 Agent 负载在 Workers AI 上的决策树大致收敛到三条: (a) Llama 3.2 11B Vision ($0.049 / $0.676 每百万) — 如果你能接受更小上下文和 11B 参数且不需要 thinking 模式; (b) Qwen 3.8 27B ($0.45 / $3.20 每百万) — 当你需要视觉 + 推理 + 函数调用 + 262K 上下文四合一; (c) DeepSeek V4 Flash ($0.44 / $1.32 每百万) — 当你能放弃视觉但需要 1M 上下文以及 prompt-cache 来支撑重复 system prompt 的 Agent。

三种调用方式

三种调用面均被 Cloudflare 官方文档化。

1. Workers AI 绑定 (Worker 内代码首选)。

export default {
  async fetch(request, env) {
    const response = await env.AI.run('@cf/qwen/qwen3.8-27b', {
      messages: [
        { role: 'system', content: '你是一个具备视觉能力的 Agent,需要时调用工具。' },
        { role: 'user', content: [
          { type: 'text', text: '图里有什么?我下一步该做什么?' },
          { type: 'image_url', image_url: { url: 'https://example.com/upload/photo.jpg' } }
        ]}
      ],
      max_tokens: 800,
    });
    return Response.json(response);
  }
};

2. REST API (/ai/run)。

curl -X POST "https://api.cloudflare.com/client/v4/accounts/$CF_ACCOUNT_ID/ai/run/@cf/qwen/qwen3.8-27b" \
  -H "Authorization: Bearer *** \
  -H "Content-Type: application/json" \
  -d '{"messages":[{"role":"user","content":"总结代码库的第三章内容。"}],"max_tokens":512}'

3. OpenAI 兼容端点 (/ai/v1/chat/completions)。 与 OpenAI Chat Completions API 同形 — 当你已经接入 OpenAI SDK 或想把 Qwen 3.8 27B 直接塞进 Vercel AI SDK、LangChain、LlamaIndex 时几乎不用改代码:

import OpenAI from 'openai';
const client = new OpenAI({
  apiKey: process.env.CF_API_TOKEN,
  baseURL: `https://api.cloudflare.com/client/v4/accounts/${'$'}{process.env.CF_ACCOUNT_ID}/ai/v1`,
});
const resp = await client.chat.completions.create({
  model: '@cf/qwen/qwen3.8-27b',
  messages: [{ role: 'user', content: '为什么 Workers AI 免费额度是每天 10,000 Neurons?' }],
});
console.log(resp.choices[0].message.content);

三种调用面前都可以再串一层 AI Gateway — gateway 的统一计费模式让你一次性购买 Neurons 或预付额度然后路由到任意模型,同时拿到日志、缓存与限速控制。

Qwen 3.8 27B 真正擅长的场景

270 亿参数 + 指令微调让 Qwen 3.8 27B 落在「带视觉的通用模型」档位 — 它不是 Kimi K2.6 / GLM-5.2 / DeepSeek V4 Pro 那种 frontier 推理怪物,但在生产 Agent 实际打交道的多数负载上是有竞争力的:

  • 图像锚定的对话和 OCR 重负载。 视觉 + 262K 上下文意味着一次请求就能塞下截图、PDF 渲染图加长篇指令集,不会被截断。更便宜的 Llama 3.2 11B Vision 也具备这个形态,但在多步指令上的推理深度稍逊。
  • 小工具集的函数调用 Agent。 5-10 个工具、结构化 JSON 输出、会话级修复。函数调用 API 复刻 OpenAI 的工具 schema,因此任何支持 OpenAI 工具的 Agent 框架都可以直接接 Qwen 3.8 27B 而无需胶水代码。
  • 不付 DeepSeek 1M 价格的长上下文 RAG。 262K 足以容纳 150K token 的代码 chunk + 多页规范; 你放弃了 DeepSeek V4 Flash 的 prompt-cache 折扣,但也避开了 DeepSeek 的受限名单。
  • 逐步工具链的 thinking 模式。 Cloudflare 模型页面写着 "Reasoning: Yes" 并支持 thinking 模式 — 当 Agent 需要在调用工具前先思考时很有用,但代价远低于 Kimi K2.6 或 DeepSeek V4 Pro。

Workers AI Qwen 3.8 27B vs 阿里百炼直连

阿里的官方 百炼 (Model Studio) 平台 — 完整端点参考可以看我们的百炼 API 指南 — 也售卖 Qwen 3.8 接入,而且 Qwen 本就是阿里自家的模型家族,百炼一般会首发新变种。两条路线之间的取舍很直白:

维度Workers AI @cf/qwen/qwen3.8-27b阿里百炼 Qwen 3.8
定价$0.45 / $3.20 每百万百炼按 token 计费; Qwen 3.8 免费 + 付费档
上下文262,144 token同 Qwen 3.8 上下文
视觉 / 工具是 / 是是 / 是
免费额度10K Neurons/天 (≈ 244K 输入 token)百炼免费额度 + DashScope 试用金
可观测性AI Gateway 日志、缓存、限速百炼控制台 + DashScope 调用链
中国路由Cloudflare 边缘 (从中国周边可用)原生国内 + 全球端点
首发新变种比百炼晚约 1-3 周是 (Qwen 家族)
适合Workers + AI Gateway 流水线最新 Qwen 变种、国内原生、最便宜 ¥/$

如果已经在 Cloudflare Workers 上跑业务,并且要的是视觉 + 推理 + 工具三合一,Workers AI Qwen 3.8 27B 是阻力最小的入口:绑定一行引入、AI Gateway 免费提供日志与缓存、模型跑在默认 300 req/min 上没有 frontier-model 的摩擦。如果你要的是最新 Qwen 变种、最便宜的 CNY/USD 定价,或希望模型本身就在国内独立部署,选百炼。

限速与摩擦

把 Qwen 3.8 27B 接进生产 Worker 之前有三个限速要了解:

  1. 默认 300 req/min 文本生成限速。 既没有 frontier-model 那种 50 req/min 收紧,也没有大幅放宽 — 就是平台默认的 300 req/min。超过会 429;用 AI Gateway 的限速规则前置一层可以平滑毛刺。
  2. 免费额度太小。 10,000 Neurons/天 大约等于 244K 输入 token ($0.45/M) — 够几次开发测试,不够 staging 流量。上生产前先升级到 Workers Paid 计划 ($0.011 / 1,000 Neurons)。
  3. 没有缓存输入价。 Workers AI 上的 DeepSeek V4 与 Kimi K2.6 都有 prompt-cache 折扣,Qwen 3.8 27B 还没有。重复 system prompt 的 Agent 每次都要按 $0.45/M 全价输入 — 这是同场景下偏向 DeepSeek V4 Flash 的最重要理由。

FAQ

Qwen 3.8 27B 跟 Qwen 3 Max 旗舰是同一个吗? 不是。Qwen 3.8 27B 是 270 亿参数指令微调的视觉语言模型; Qwen 3 Max (以及 Qwen 3.8 Max) 旗舰是数千亿参数。Qwen 3.8 27B 是边缘档模型,单卡可跑,配视觉+推理+工具; Max 旗舰处理最重负载,仅在百炼和合作云上线。Qwen 3.8 家族在 2026-07-19 于百炼首发,Workers AI 在 8 月 17 日拿下 27B 这一档。

能在 Qwen 3.8 27B 上用 AI Gateway 缓存吗? 可以 — AI Gateway 的通用缓存层放在任何 Workers AI 模型前都生效,无论该模型自身有没有缓存输入价。你仍然按模型价 ($0.45 / $3.20) 付费,但缓存命中时省掉了重复 token 的费用,主要收益在长 system prompt 场景。想要进一步省钱,可以把模型接到开启统一计费的 gateway 上。

Qwen 3.8 27B 支持 JSON 模式与结构化输出吗? 支持。Workers AI 提供跨模型的 JSON Mode beta,与函数调用搭配可以做严格 schema 的 Agent 输出。

Cloudflare 之后会加缓存输入价吗? Workers AI 8 月 18 日定价表里只有 DeepSeek V4 Pro / Flash、GLM-5.2、Kimi K2.6 / K2.7-code 列出了缓存输入行。新的 Qwen 变种后续可能补上缓存价; 在那之前,按全额输入价预算即可。

结论

对于不需要 1M 上下文或 DeepSeek V4 prompt-cache 折扣的负载,Workers AI Qwen 3.8 27B 是当前平台上视觉 + 推理 + 函数调用三合一的最低价入口。 $0.45 / $3.20 每百万,价位低于 DeepSeek V4 Pro ($1.32 / $3.96),远高于 Llama 3.2 11B Vision ($0.049 / $0.676)。262K 上下文与免费 Neurons 额度让它成为已经会 OpenAI Chat Completions、又不想为 Agent 引入新基础设施的 Worker 内代码默认选择。在 Workers AI Qwen 3.8 27B 与百炼直连之间取舍很简单:留在 Cloudflare 生态选 Workers AI; 要最新 Qwen 变种或最便宜 CNY/USD 选百炼。Cloudflare 官方的 Qwen 3.8 27B 模型页面 上有实时定价、Neurons 换算与 OpenAI 兼容端点参考。如果想要一个已经帮你把 Qwen、DeepSeek、OpenAI、Anthropic、Google 接在同一个 OpenAI 兼容 Key 后面的多厂商抽象,FreeModel 是最简单的入口:一个后台、一个账单、没有跨厂商的胶水代码。