美团 LongCat (Meituan LongCat)

收录于 https://github.com/meituan-longcat

综合排名 #6 ⭐⭐ 推荐
✅ Domestic self-host + OpenRouter (proxy) | 🇨🇳 国内可用

💰 Token 价格

类型 价格 备注
输入 (Input) OpenRouter: $0.60/M token (48B active MoE) 每百万 tokens
输出 (Output) OpenRouter: $2.40/M token (48B active MoE) 每百万 tokens
💡 免费额度

MIT licensed weights on Hugging Face; self-host on 8x H100+ GPU cluster

🤖 支持模型(共 4 个)

LongCat-2.0 (1.6T MoE) LongCat-2.0 INT4 LongCat-2-140B LongCat-2-70B

✨ 优势

  • 1.6T 总参 + 48B 激活 MoE,运营成本接近 DeepSeek V3
  • 1M token 上下文,LongBench v2 领先 13 分
  • MIT 协议,无商业限制条款
  • OpenRouter 上 meituan/longcat-2-0-1.6t-moe 直接可用
  • 推理代码 vLLM 兼容,单节点 8x H100 INT4 部署
  • 蒸馏版本 70B / 140B 适配单/双节点预算

⚠️ 不足

  • × 不支持多模态(纯文本)
  • × Function Calling 评测尚未公开
  • × INT4 量化损失约 2-3 MMLU 分
  • × 完整 BF16 模型需多节点部署(~3.2 TB 显存)
  • × 中文文档与社区案例少
  • × 路由需 OpenRouter 或自建 vLLM 集群

🎯 适合场景

长上下文 RAG、代码库分析、多小时文档处理、自托管开源部署

💰 价格与方案

模型输入 ($/百万 token)输出 ($/百万 token)最佳用途
LongCat-2.0(1.6T MoE)$0.60$2.40前沿开源 MoE(OpenRouter 渠道)
LongCat-2.0 INT4 量化$0.30$1.20自部署,INT4 节省约 50% 成本
LongCat-2-140B仅自部署仅自部署中等规模蒸馏,单节点预算
LongCat-2-70B仅自部署仅自部署最小开源变体,双节点或单卡 H100
RunPod/Lambda/CoreWeave 自部署按 GPU 小时计费按 GPU 小时计费完全控制,按算力计费非按 token

🔧 API 与开发者体验

  • 分发渠道: OpenRouter 按量付费(meituan/longcat-2-0-1.6t-moe)用于托管推理;Hugging Face 开源权重用于自部署;无官方商业 API。
  • API 兼容性: 在 OpenRouter 上完全兼容 OpenAI /chat/completions,支持 tools 函数调用与 SSE 流式输出。自部署 vLLM 或 SGLang 提供相同接口。
  • 开源协议: Hugging Face 上采用 MIT 协议权重。无商业限制条款、无回传遥测、无用户版税 — 可直接用于闭源商业产品。
  • 上下文窗口: 旗舰模型 1M token 上下文,单次请求可容纳约 60 分钟视频字幕 + 1.5× 长篇小说文本,对标 Gemini 1M 上下文级别。
  • 推理栈: 兼容 vLLM 与 SGLang;1.6T MoE 可单节点 8×H100 INT4 部署;BF16 需多节点(约 3.2 TB 显存)。
  • 量化选项: INT4 开箱即用,相比 BF16 仅损失 ~2-3 MMLU 分;生产推荐 FP8 作为质量 / 成本的最佳平衡点。
  • 生态成熟度: 中文文档与社区案例落后于 DeepSeek/Qwen;英文教程稀疏,多数部署依赖官方仓库 vLLM 配置的复制。

🐾 稀疏 MoE 对标 DeepSeek V3 运营成本

LongCat-2.0 是 1.6T 总参数 / 48B 激活参数的稀疏激活 MoE 模型,美团明确将其运营成本对标 DeepSeek V3 —— INT4 量化版本约 ¥0.30 / ¥1.20 每百万 token,或 OpenRouter 按量付费 $0.60 / $2.40(接近 BF16 质量)。这些数字转化为实际部署经济性:单台 8×H100 INT4 节点每小时可服务的查询量相当于 DeepSeek V3 集群的三分之一 GPU 小时成本,并在 LongBench v2(美团参与维护的中文长上下文基准)上领先 13 分。 相比同等有效规模的稠密模型(Qwen3-72B、Llama-3.1-70B),其取舍在运维而非能力:开发者需要支持 MoE 的推理栈(vLLM 的 `enable_expert_parallelism`、SGLang 的 `--enable-ep`),并按激活专家而非总参数规划 KV 缓存容量。美团在权重发布的同时提供路由配置,集成工作主要是配置调优而非重新设计 —— 但对从未在生产中运维过稀疏 MoE 的团队而言,仍有一定迁移成本。

🌐 中国访问与延迟

LongCat 没有官方商业 API 端点 —— 接入分两条路径。在中国大陆,开发者通常从 Hugging Face(或镜像站)下载 MIT 权重,在 HK / SG / JP 区域的 RunPod 等价 H100 集群自部署;国内 GPU 云服务商(阿里百炼、腾讯云、火山引擎)间歇性地在其模型市场上架 1.6T MoE。海外用户可经由 OpenRouter 的 `meituan/longcat-2-0-1.6t-moe` 接入,价格 $0.60 / $2.40 每百万 token,无中国大陆路由。 延迟完全取决于部署区域。HK / SG 的自部署集群向中国大陆用户返回首 token 约 100-300ms(防火墙处罚后再加 50-100ms);通过 OpenAI 兼容聚合器(FreeModel、Portkey)走 OpenRouter 的方案,对中国用户通常再增加 200-400ms。面向中国流量的生产 API,标准建议为:(a) 在 HK 区域 H100 集群自部署,或 (b) 使用国内模型市场 —— 两条路径都能完全避开跨境路由处罚。