Liquid AI LFM2.5 2026 评测:DSpark 端侧推理与开源定价
Liquid AI(liquid.ai)是一家波士顿 AI 公司——估值约 $2.4B 的独角兽,2023 年创立,2026 年 8 月获 NBC Boston 与 Business Journals 报道——它采取了与 OpenAI 相反的商业模式:不卖按 token 的云推理,而是在免版税开源许可下发布设备原生基础模型(LFM),让你在自己的硬件上运行。其 LFM2.5 家族覆盖 230M 到 8B-A1B 参数,横跨文本、视觉、音频;2026 年 8 月 20 日的 LFM2.5-DSpark 发布为模型添加投机解码草稿检查点,GPU 解码最高提升 3.18×、端侧 2.87×,且无损。完整 4 段对比见 Liquid AI 厂商页面,或对比 Groq、Modal、DeepSeek。
Liquid AI 是什么?2026 年为何边缘推理重要?
Liquid AI 创立时的信念是:下一波 AI 跑在设备上,而不是按 token 的云 API 里。多数提供商在数据中心延迟和 token 价格上竞争,Liquid 则在「一个能本地跑的模型能有多小、多快」上面竞争。其 LFM2.5 家族刻意做在 230M 到 8B-A1B 参数,就是为了装进手机、笔记本、汽车和嵌入式硬件——350M 模型训练了 28T tokens、<1GB 即可运行,以极小的体积承载「1GB 内的前沿 AI」。公司在 Hugging Face 累计 4130 万+ 模型下载,企业客户包括 Mercedes-Benz(嵌入式车载智能)和 Shopify。
这也是它如今在 AI API 生态中重要的原因。云推理的成本与延迟让团队开始追问:是否每个负载都需要往返一次 OpenAI?边缘推理彻底消除了按 token 账单,并让数据留在设备上——对隐私敏感、离线、或持续高频负载是决定性的。Liquid 在 定价页 上的明确提问值得每个 API 买家细品:「为何要为云 API 按 token 付费,而不在本地推理?」其回答是:本地运行消除按 token 的 API 成本、把延迟压到毫秒级、离线也能用。这正是与我们在 Qwen Workers AI 边缘推理 中覆盖的云端边缘推理浪潮相对的、开源许可的边缘方案。
LFM2.5-DSpark:投机解码让解码快 3.18×
2026 年 8 月 20 日的 LFM2.5-DSpark 发布(MarkTechPost、Unite.AI、GIGAZINE、TUN 等多家报道)为三款 LFM2.5 模型——LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B——添加 DSpark 草稿检查点,即在既有权重上挂一个轻量草稿模块。官方 Hugging Face 博客 给出经核实的数字:H100 上吞吐最高提升 3.18×(MATH500:428 → 1362 tok/s)、端侧最高 2.87×(M4 Max)、LFM2.5-2.6B 函数调用延迟平均降低 57%、输出精确无损——因为目标模型验证每个候选 token,贪心输出与目标模型本身完全一致。
这对 API 选型为何重要:解码阶段传统上受内存带宽限制——大部分延迟来自把权重从 DRAM 读入 SRAM,而不是计算。投机解码用单次前向验证 k 个候选 token,把权重加载成本分摊到所有 token 上。对 API 提供商(以及我们此前 DeepSeek DSpark 分析 的主题)来说,同一技术正是 DeepSeek 用来把单用户生成速度提升 60-85% 的手段。Liquid 的贡献在于把它做到能部署在边缘的小模型上,且 llama.cpp 与 SGLang 首日支持、集成开源——于是手机或笔记本上的 1.2B-8B 模型能有更大引擎的解码速度。
Liquid AI 定价:免费开源权重,而非按 token 计费
Liquid 不卖按 token API——这正是它的定价模式。所有 LFM 模型在 LFM Open License 下免费下载、运行、微调(包括商用):免版税使用、修改、分发,直到公司年收入超过 1000 万美元。无 copyleft,微调结果可私有。研究、教育与非营利使用永久免费、无收入上限。超过门槛后需商业授权;LEAP 企业版(Mercedes-Benz、Shopify 为代表的企业客户)按部署规模与支持需求定价。
| 模型 | 参数 | 上下文 | 价格 | 备注 |
|---|---|---|---|---|
| LFM2.5-350M | 350M | — | 免费 | 训练 28T tokens;<1GB;最快边缘 |
| LFM2.5-1.2B-Instruct | 1.2B | — | 免费 | 推荐对话模型;+ Thinking/Base/JP |
| LFM2.5-2.6B | 2.6B dense | 128K | 免费 | Agentic——原生工具调用 |
| LFM2.5-8B-A1B | 8B / 1.5B active(MoE) | 128K | 免费 | 推理 MoE,端侧 agent 任务 |
| LFM2-24B-A2B | 24B / 2B active(MoE) | — | 免费 | 最大模型;笔记本 / 单 GPU |
| LFM2.5-VL-3B/1.6B/450M | 视觉 | — | 免费 | OCR、grounding、视觉工具调用 |
| LEAP 企业版 | — | — | 联系销售 | 商用授权 + OEM/on-prem 支持 + SLA |
实际的成本账与任何按 token 提供商都不同。没有输入/输出/缓存输入价目表;你唯一的成本是已拥有的硬件和电费。对持续或高频负载,经济账完全反转——完全没有循环按 token 账单。但前提是你能自己跑模型:Liquid 不是 通过 URL 调用 DeepSeek 或 OpenAI 的即插即用替代。你是在用「无 API 加价」换「自己运维服务」——想要托管式开源权重服务,Modal 或 Fireworks 是桥梁。
开发者体验:LEAP SDK、OpenAI 兼容服务与 DSpark 集成
Liquid 的开发者体验以 LEAP SDK 为核心,它把 LFM 模型编译到 iOS、macOS、Android、JVM、Linux 和 Windows,处处同一 API——包括函数调用(LeapFunction)、编译期校验的约束式 JSON 生成,以及即插即用的语音助手组件。偏好标准工具的团队可用 llama.cpp、SGLang、vLLM、MLX、ONNX 或 Ollama 服务模型(后两者暴露 OpenAI 兼容端点),完整文档见 Liquid 文档。核心开发者功能:
- DSpark 投机解码——1.2B / 2.6B / 8B-A1B 草稿检查点,GPU 最快 3.18×、端侧 2.87×,无损,llama.cpp + SGLang 首日支持。
- LEAP SDK 跨平台——一套 API 覆盖 iOS、Android、JVM、桌面与原生 Linux/Windows,负责模型加载、生成与工具使用。
- 工具调用与结构化输出——原生函数调用(LeapFunction,Hermes/Pythonic 解析器)与编译期校验的约束式 JSON。
- OpenAI 兼容服务——SGLang/vLLM 提供低延迟 OpenAI 兼容端点;SDK 的 OpenAI 兼容客户端支持端侧+云端混合路由。
- LEAP Finetune——准备、训练、评估、导出定制 LFM(SFT、DPO、VLM);无 copyleft,微调可私有;量化感知蒸馏(Q4_0)面向边缘。
- 边缘优先体积——350M 低于 1GB,8B-A1B MoE 可在单 GPU 笔记本运行,CPU/GPU/NPU 支持从手机到汽车。
谁该选 Liquid AI——谁又该跳过
选 Liquid AI,如果你 (a) 跑高频、持续或离线推理,按 token API 账单会占大头;(b) 需要数据永不出设备(隐私、合规、数据主权——包括完全在中国大陆境内运行);(c) 想要免版税开源权重、无 copyleft、可私有微调;或 (d) 在 iOS/Android/JVM/桌面构建端侧 agent,重视统一 SDK。跳过它,如果你 (a) 需要托管式按 token API、不想自己运维;(b) 想要 GPT-5.6 / Claude / Gemini 级别的完整前沿模型;(c) 没有商业授权就要企业级 SLA 与规模化支持;或 (d) 想要即插即用的 OpenAI 替代——那种情况用 DeepSeek(API)或 Fireworks(托管开源模型服务)。
区域可用性与延迟
因为 Liquid 没有托管云 API,可用性与延迟取决于你在哪里运行模型,而不是 Liquid 的数据中心。权重可从 Hugging Face 全球免费下载——包括中国大陆——推理运行在你自己的 CPU、GPU 或 NPU 上,因此没有跨太平洋 API 往返,也不需要按区域预置端点。这让 Liquid 对中国部署异常数据主权友好:整个推理管线完全留在本地设备、零数据外泄。在性能不错的笔记本或手机上,token 本地生成,延迟毫秒级;350M 与 450M-VL 面向最快边缘延迟调优,8B-A1B 面向单 GPU 笔记本。想要托管部署路径,LEAP SDK 与 Bundle CLI 提供跨 iOS/Android/JVM/桌面的可复现路线,企业版提供 OEM 与 on-prem 支持。你可以在我们的最便宜 LLM API 定价盘点 中对比这种边缘优先模型与按 token 选项。
Liquid AI 常见问题
A: Liquid AI 是一家波士顿 AI 公司(est. 2023,估值约 $2.4B),构建设备原生基础模型。其 LFM2.5 家族覆盖 230M 到 8B-A1B 参数,涵盖文本、视觉与音频,专为手机、笔记本、汽车和嵌入式硬件上的端侧与边缘推理而设计。
A: LFM2.5-DSpark(2026 年 8 月 20 日发布)为 LFM2.5-1.2B-Instruct、2.6B、8B-A1B 模型添加投机解码草稿检查点。轻量草稿模块先提出候选 token,目标模型在单次前向中验证,GPU 解码吞吐最高提升 3.18x、端侧 2.87x,输出精确无损,函数调用延迟平均降低 57%。
A: 没有按 token 的云 API。所有 LFM 模型在免版税的 LFM Open License 下免费下载、运行、微调——包括商用——直到公司年收入超过 1000 万美元。超过后需商业授权;LEAP 企业版按部署规模与支持需求定价。
A: 没有托管的按 token API。你从 Hugging Face 下载权重(Safetensors + GGUF)自行服务——通过 llama.cpp、SGLang、vLLM、MLX、ONNX 或 Ollama(后者暴露 OpenAI 兼容端点)。LEAP SDK 在 iOS、Android、JVM、Linux、Windows 上提供统一 API。
A: 适合——边缘正是它的核心。350M 模型训练 28T tokens、<1GB 即可运行;8B-A1B MoE 有 128K 上下文用于端侧 agent 工具调用。DSpark 投机解码让 GPU 解码快 3.18x、端侧 2.87x,llama.cpp 与 SGLang 首日支持。
A: Liquid 无按 token 收费、完全本地运行,消除了循环 API 账单并让数据留在设备上——非常适合高频、离线或隐私敏感负载。代价是你必须有自有硬件;绝对能力落后于 GPT-5.6、Claude 等前沿闭源旗舰。
A: 可以,且对数据主权友好。权重可从 Hugging Face 全球免费下载(包括中国大陆),推理运行在你自己的 CPU、GPU 或 NPU 上,因此没有跨太平洋 API 往返。这是把推理完全保留在中国境内设备上、而非调用美国托管端点的选项。