Liquid AI (Liquid AI)

收录于 https://www.liquid.ai

综合排名 #40 ⭐ 可考虑
⚠️ 无托管云 API,因此无中国直连端点问题。模型权重自由下载并可在本地/自托管运行,包括在中国境内(对数据主权友好)。不需要云 API 网关或代理;token 处理完全在本地硬件上进行。 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) 无按 token 云 API 定价——LFM 权重免费下载/运行/微调(LFM Open License,公司年收入超过 1000 万美元前免版税)。推理要么在自有硬件上自托管,要么通过 LEAP SDK 本地部署;无 per-token 请求费用。 每百万 tokens
输出 (Output) 无 per-token 输出计费。模型在 CPU/GPU/NPU 上本地或自托管运行,适合对延迟与隐私敏感的高频或离线工作负载(Liquid 的定位:「为何为云 API 按 token 付费,而非本地推理」)。 每百万 tokens
缓存读取 不适用——无按 token API 缓存计费。提示缓存成本由你的本地/自托管运行时不产生(自托管无请求费),DSpark 投机解码以更少权重流量提升解码吞吐。 享折扣
💡 免费额度

全部 14+ 个 LFM 模型在 LFM Open License 下免费下载/运行/微调——包括商用(公司年收入 ≤ 1000 万美元)。研究、教育与非营利使用永久免费、无收入上限。

🤖 支持模型(共 14 个)

LFM2.5-8B-A1B (MoE, 8B total / 1.5B active, 128K context) — open weights, free download / run / fine-tune under the LFM Open License (royalty-free until $10M annual revenue) LFM2.5-2.6B (dense, 128K context, agentic tool calling) — DSpark draft variant up to 3.18× GPU / 2.87× on-device decode speedup LFM2.5-1.2B-Instruct / Thinking / Base / JP (1.2B) — instruction-tuned chat, math/reasoning, pre-trained, Japanese LFM2.5-350M / 230M — compact edge models; LFM2.5-350M trained on 28T tokens, runs under 1GB LFM2.5-VL-3B / 1.6B / 450M — vision-language, SigLIP2 backbone, OCR + grounding + vision tool calling LFM2-24B-A2B (MoE, 24B total / 2B active) — largest model, for laptops / single-GPU; LFM2-2.6B & 700M for phones and laptops Any LFM can be served via llama.cpp, SGLang, vLLM, MLX, ONNX, or Ollama (OpenAI-compatible), or deployed on-device with the LEAP SDK

✨ 优势

  • 开源、免版税的 LFM Open License——年收入 ≤ 1000 万美元前模型免费商用,无 copyleft,微调可私有化
  • 全栈端侧/边缘优先:LEAP SDK(iOS/Android/JVM/Linux/Windows 同一 API)+ llama.cpp/SGLang/vLLM/MLX/ONNX/Ollama 直接部署
  • 2026-08-20 发布 LFM2.5-DSpark 投机解码草稿模型:GPU 吞吐最高 3.18×、端侧 2.87×,函数调用延迟平均降低 57%,无损(精确)解码
  • 小模型大能力:LFM2.5-350M 训练 28T tokens、<1GB 即可运行;MoE 8B-A1B 128K 上下文,端侧 agent 工具调用
  • 无 per-token 成本——高频、离线、隐私敏感工作负载无限请求
  • 多模态覆盖:LFM2.5-VL(视觉)与 LFM2.5 音频模型,OCR/grounding/视觉工具调用
  • 波士顿 AI 独角兽(est. 2023,~$2.4B 估值),Mercedes-Benz、Shopify 等企业采用,8 月获 NBC Boston / Business Journals 报道

⚠️ 不足

  • × 无托管云 API——不能像 OpenAI/DeepSeek 那样按 token 调用,需自有 GPU/设备或自托管
  • × 免费商用有收入门槛——公司年收入超过 1000 万美元后需购买商业授权
  • × 模型规模主打端侧重推理(≤24B MoE),与前沿闭源旗舰(GPT-5.6、Claude、Gemini 2.5 级)在绝对能力上有差距
  • × DSpark 草稿模型需要额外部署步骤(llama.cpp/SGLang 集成),并非开箱即用

🎯 适合场景

开发者和团队在自有硬件上构建本地/端侧推理:需要免版税开源权重、数据不出设备、超高吞吐解码(DSpark)和跨设备(iOS/Android/JVM/桌面)统一 SDK 的隐私敏感、离线或高频 agent 工作负载。

💰 价格与方案

模型参数上下文价格备注
LFM2.5-350M350M免费训练 28T tokens;<1GB 可运行;边缘/低延迟
LFM2.5-1.2B-Instruct1.2B免费推荐的对话模型;另有 Thinking、Base、JP 变体
LFM2.5-2.6B2.6B dense128K免费Agentic——为端侧 agent 提供原生工具调用
LFM2.5-8B-A1B8B / 1.5B active(MoE)128K免费推理 MoE,用于端侧工具调用与 agent 任务
LFM2-24B-A2B24B / 2B active(MoE)免费最大模型;笔记本 / 单 GPU
LFM2.5-VL-3B / 1.6B / 450M3B / 1.6B / 450M免费视觉-语言;OCR、grounding、视觉工具调用
LEAP 企业版联系销售商用授权 + OEM/on-prem 支持 + SLA(年收入超 1000 万美元)

🔧 API 与开发者体验

  • 无托管云 API: Liquid 不像 OpenAI 或 DeepSeek 那样售卖按 token 托管。你从 Hugging Face 下载权重(Safetensors + GGUF)自行运行——通过 llama.cpp、SGLang、vLLM、MLX、ONNX 或 Ollama(后者提供 OpenAI 兼容端点)。
  • LEAP SDK: Liquid Edge AI Platform SDK 可将模型编译到 iOS、macOS、Android、JVM、Linux 和 Windows,处处同一 API,包括函数调用(LeapFunction)、约束式 JSON 生成和语音助手组件。
  • DSpark 投机解码: DSpark 草稿检查点(LFM2.5-1.2B-Instruct、2.6B、8B-A1B)添加一个草稿模块,在单次前向中由目标模型验证其生成的候选 token——GPU 吞吐最高 3.18×、端侧 2.87×,函数调用延迟平均降低 57%,输出精确无损。llama.cpp 与 SGLang 首日支持。
  • 工具调用与结构化输出: LFM2.5 与 LFM2 支持 agent 工作流(API、数据库)的函数调用,以及通过 LEAP SDK 的约束式/结构化 JSON 生成(编译期校验)。
  • OpenAI 兼容服务: 用 SGLang 或 vLLM 服务 LFM,即可获得低延迟的 OpenAI 兼容端点;或使用 SDK 的 OpenAI 兼容 chat-completions 客户端做端侧+云端混合路由。
  • 微调: LEAP Finetune 负责准备、训练、评估和导出定制 LFM(SFT、DPO、VLM);无 copyleft,微调结果可私有。量化感知蒸馏(LFM2.5 Q4_0)面向边缘部署。
  • 生态触达: Hugging Face 模型下载量 4100 万+;支持手机、笔记本、汽车与嵌入式设备,横跨 CPU、GPU、NPU。

🧠 端侧与边缘优先推理

Liquid AI 的核心押注是:下一波 AI 跑在设备上,而不是按 token 付费的云 API。其 LFM2.5 家族覆盖 230M 到 8B-A1B 参数,正是为了让模型装进手机、笔记本和嵌入式硬件——350M 模型训练了 28T tokens,<1GB 即可运行。2026 年 8 月的 LFM2.5-DSpark 发布进一步强化了这个端侧叙事:为 1.2B、2.6B、8B-A1B 模型提供的投机解码草稿检查点,在 H100 上解码吞吐最高提升 3.18×,在 Apple M4 Max 上 2.87×,输出精确无损,函数调用延迟平均降低 57%——对设备驻留 agent 是实打实的提升。公司在定价页上把经济账说得直白:本地运行消除按 token 的 API 成本、把延迟压到毫秒级、离线也能用,因此高频或隐私敏感的工作负载不再产生循环账单。所有模型都采用免版税的 LFM Open License(年收入 1000 万美元前免费商用),这正是 Mercedes-Benz、Shopify 等团队选它做嵌入式和边缘推理的原因。

🌐 区域可用性与延迟

因为 Liquid AI 没有托管云 API,区域可用性与延迟取决于你在哪里运行模型,而不是 Liquid 的数据中心。权重可从 Hugging Face 全球免费下载(包括中国大陆),推理发生在你自己的 CPU、GPU 或 NPU 上——因此没有跨太平洋的 API 往返、也不需要按区域预置端点,这对中国部署是数据主权友好的。在性能不错的笔记本或手机上,token 本地生成,生成延迟在毫秒级;350M 与 450M-VL 面向最快的边缘延迟调优,较大的 8B-A1B 面向单 GPU 笔记本。若团队想要托管路径而非自托管,LEAP SDK 与 Bundle CLI 提供跨 iOS/Android/JVM/桌面的可复现部署路线,企业版额外提供 OEM 与 on-prem 部署支持。如果你今天就需要一个低延迟的中国境内端点,Liquid 不是那个选项——它是在中国境内把推理完全保留在设备上的选项。