Liquid AI (Liquid AI)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | 无按 token 云 API 定价——LFM 权重免费下载/运行/微调(LFM Open License,公司年收入超过 1000 万美元前免版税)。推理要么在自有硬件上自托管,要么通过 LEAP SDK 本地部署;无 per-token 请求费用。 | 每百万 tokens |
| 输出 (Output) | 无 per-token 输出计费。模型在 CPU/GPU/NPU 上本地或自托管运行,适合对延迟与隐私敏感的高频或离线工作负载(Liquid 的定位:「为何为云 API 按 token 付费,而非本地推理」)。 | 每百万 tokens |
| 缓存读取 | 不适用——无按 token API 缓存计费。提示缓存成本由你的本地/自托管运行时不产生(自托管无请求费),DSpark 投机解码以更少权重流量提升解码吞吐。 | 享折扣 |
全部 14+ 个 LFM 模型在 LFM Open License 下免费下载/运行/微调——包括商用(公司年收入 ≤ 1000 万美元)。研究、教育与非营利使用永久免费、无收入上限。
🤖 支持模型(共 14 个)
✨ 优势
- ✓ 开源、免版税的 LFM Open License——年收入 ≤ 1000 万美元前模型免费商用,无 copyleft,微调可私有化
- ✓ 全栈端侧/边缘优先:LEAP SDK(iOS/Android/JVM/Linux/Windows 同一 API)+ llama.cpp/SGLang/vLLM/MLX/ONNX/Ollama 直接部署
- ✓ 2026-08-20 发布 LFM2.5-DSpark 投机解码草稿模型:GPU 吞吐最高 3.18×、端侧 2.87×,函数调用延迟平均降低 57%,无损(精确)解码
- ✓ 小模型大能力:LFM2.5-350M 训练 28T tokens、<1GB 即可运行;MoE 8B-A1B 128K 上下文,端侧 agent 工具调用
- ✓ 无 per-token 成本——高频、离线、隐私敏感工作负载无限请求
- ✓ 多模态覆盖:LFM2.5-VL(视觉)与 LFM2.5 音频模型,OCR/grounding/视觉工具调用
- ✓ 波士顿 AI 独角兽(est. 2023,~$2.4B 估值),Mercedes-Benz、Shopify 等企业采用,8 月获 NBC Boston / Business Journals 报道
⚠️ 不足
- × 无托管云 API——不能像 OpenAI/DeepSeek 那样按 token 调用,需自有 GPU/设备或自托管
- × 免费商用有收入门槛——公司年收入超过 1000 万美元后需购买商业授权
- × 模型规模主打端侧重推理(≤24B MoE),与前沿闭源旗舰(GPT-5.6、Claude、Gemini 2.5 级)在绝对能力上有差距
- × DSpark 草稿模型需要额外部署步骤(llama.cpp/SGLang 集成),并非开箱即用
🎯 适合场景
开发者和团队在自有硬件上构建本地/端侧推理:需要免版税开源权重、数据不出设备、超高吞吐解码(DSpark)和跨设备(iOS/Android/JVM/桌面)统一 SDK 的隐私敏感、离线或高频 agent 工作负载。
💰 价格与方案
| 模型 | 参数 | 上下文 | 价格 | 备注 |
|---|---|---|---|---|
| LFM2.5-350M | 350M | — | 免费 | 训练 28T tokens;<1GB 可运行;边缘/低延迟 |
| LFM2.5-1.2B-Instruct | 1.2B | — | 免费 | 推荐的对话模型;另有 Thinking、Base、JP 变体 |
| LFM2.5-2.6B | 2.6B dense | 128K | 免费 | Agentic——为端侧 agent 提供原生工具调用 |
| LFM2.5-8B-A1B | 8B / 1.5B active(MoE) | 128K | 免费 | 推理 MoE,用于端侧工具调用与 agent 任务 |
| LFM2-24B-A2B | 24B / 2B active(MoE) | — | 免费 | 最大模型;笔记本 / 单 GPU |
| LFM2.5-VL-3B / 1.6B / 450M | 3B / 1.6B / 450M | — | 免费 | 视觉-语言;OCR、grounding、视觉工具调用 |
| LEAP 企业版 | — | — | 联系销售 | 商用授权 + OEM/on-prem 支持 + SLA(年收入超 1000 万美元) |
🔧 API 与开发者体验
- •无托管云 API: Liquid 不像 OpenAI 或 DeepSeek 那样售卖按 token 托管。你从 Hugging Face 下载权重(Safetensors + GGUF)自行运行——通过 llama.cpp、SGLang、vLLM、MLX、ONNX 或 Ollama(后者提供 OpenAI 兼容端点)。
- •LEAP SDK: Liquid Edge AI Platform SDK 可将模型编译到 iOS、macOS、Android、JVM、Linux 和 Windows,处处同一 API,包括函数调用(LeapFunction)、约束式 JSON 生成和语音助手组件。
- •DSpark 投机解码: DSpark 草稿检查点(LFM2.5-1.2B-Instruct、2.6B、8B-A1B)添加一个草稿模块,在单次前向中由目标模型验证其生成的候选 token——GPU 吞吐最高 3.18×、端侧 2.87×,函数调用延迟平均降低 57%,输出精确无损。llama.cpp 与 SGLang 首日支持。
- •工具调用与结构化输出: LFM2.5 与 LFM2 支持 agent 工作流(API、数据库)的函数调用,以及通过 LEAP SDK 的约束式/结构化 JSON 生成(编译期校验)。
- •OpenAI 兼容服务: 用 SGLang 或 vLLM 服务 LFM,即可获得低延迟的 OpenAI 兼容端点;或使用 SDK 的 OpenAI 兼容 chat-completions 客户端做端侧+云端混合路由。
- •微调: LEAP Finetune 负责准备、训练、评估和导出定制 LFM(SFT、DPO、VLM);无 copyleft,微调结果可私有。量化感知蒸馏(LFM2.5 Q4_0)面向边缘部署。
- •生态触达: Hugging Face 模型下载量 4100 万+;支持手机、笔记本、汽车与嵌入式设备,横跨 CPU、GPU、NPU。
🧠 端侧与边缘优先推理
Liquid AI 的核心押注是:下一波 AI 跑在设备上,而不是按 token 付费的云 API。其 LFM2.5 家族覆盖 230M 到 8B-A1B 参数,正是为了让模型装进手机、笔记本和嵌入式硬件——350M 模型训练了 28T tokens,<1GB 即可运行。2026 年 8 月的 LFM2.5-DSpark 发布进一步强化了这个端侧叙事:为 1.2B、2.6B、8B-A1B 模型提供的投机解码草稿检查点,在 H100 上解码吞吐最高提升 3.18×,在 Apple M4 Max 上 2.87×,输出精确无损,函数调用延迟平均降低 57%——对设备驻留 agent 是实打实的提升。公司在定价页上把经济账说得直白:本地运行消除按 token 的 API 成本、把延迟压到毫秒级、离线也能用,因此高频或隐私敏感的工作负载不再产生循环账单。所有模型都采用免版税的 LFM Open License(年收入 1000 万美元前免费商用),这正是 Mercedes-Benz、Shopify 等团队选它做嵌入式和边缘推理的原因。
🌐 区域可用性与延迟
因为 Liquid AI 没有托管云 API,区域可用性与延迟取决于你在哪里运行模型,而不是 Liquid 的数据中心。权重可从 Hugging Face 全球免费下载(包括中国大陆),推理发生在你自己的 CPU、GPU 或 NPU 上——因此没有跨太平洋的 API 往返、也不需要按区域预置端点,这对中国部署是数据主权友好的。在性能不错的笔记本或手机上,token 本地生成,生成延迟在毫秒级;350M 与 450M-VL 面向最快的边缘延迟调优,较大的 8B-A1B 面向单 GPU 笔记本。若团队想要托管路径而非自托管,LEAP SDK 与 Bundle CLI 提供跨 iOS/Android/JVM/桌面的可复现部署路线,企业版额外提供 OEM 与 on-prem 部署支持。如果你今天就需要一个低延迟的中国境内端点,Liquid 不是那个选项——它是在中国境内把推理完全保留在设备上的选项。