美团 LongCat (Meituan LongCat)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | OpenRouter: $0.60/M token (48B active MoE) | 每百万 tokens |
| 输出 (Output) | OpenRouter: $2.40/M token (48B active MoE) | 每百万 tokens |
MIT licensed weights on Hugging Face; self-host on 8x H100+ GPU cluster
🤖 支持模型(共 4 个)
✨ 优势
- ✓ 1.6T 总参 + 48B 激活 MoE,运营成本接近 DeepSeek V3
- ✓ 1M token 上下文,LongBench v2 领先 13 分
- ✓ MIT 协议,无商业限制条款
- ✓ OpenRouter 上 meituan/longcat-2-0-1.6t-moe 直接可用
- ✓ 推理代码 vLLM 兼容,单节点 8x H100 INT4 部署
- ✓ 蒸馏版本 70B / 140B 适配单/双节点预算
⚠️ 不足
- × 不支持多模态(纯文本)
- × Function Calling 评测尚未公开
- × INT4 量化损失约 2-3 MMLU 分
- × 完整 BF16 模型需多节点部署(~3.2 TB 显存)
- × 中文文档与社区案例少
- × 路由需 OpenRouter 或自建 vLLM 集群
🎯 适合场景
长上下文 RAG、代码库分析、多小时文档处理、自托管开源部署
💰 价格与方案
| 模型 | 输入 ($/百万 token) | 输出 ($/百万 token) | 最佳用途 |
|---|---|---|---|
| LongCat-2.0(1.6T MoE) | $0.60 | $2.40 | 前沿开源 MoE(OpenRouter 渠道) |
| LongCat-2.0 INT4 量化 | $0.30 | $1.20 | 自部署,INT4 节省约 50% 成本 |
| LongCat-2-140B | 仅自部署 | 仅自部署 | 中等规模蒸馏,单节点预算 |
| LongCat-2-70B | 仅自部署 | 仅自部署 | 最小开源变体,双节点或单卡 H100 |
| RunPod/Lambda/CoreWeave 自部署 | 按 GPU 小时计费 | 按 GPU 小时计费 | 完全控制,按算力计费非按 token |
🔧 API 与开发者体验
- •分发渠道: OpenRouter 按量付费(meituan/longcat-2-0-1.6t-moe)用于托管推理;Hugging Face 开源权重用于自部署;无官方商业 API。
- •API 兼容性: 在 OpenRouter 上完全兼容 OpenAI /chat/completions,支持 tools 函数调用与 SSE 流式输出。自部署 vLLM 或 SGLang 提供相同接口。
- •开源协议: Hugging Face 上采用 MIT 协议权重。无商业限制条款、无回传遥测、无用户版税 — 可直接用于闭源商业产品。
- •上下文窗口: 旗舰模型 1M token 上下文,单次请求可容纳约 60 分钟视频字幕 + 1.5× 长篇小说文本,对标 Gemini 1M 上下文级别。
- •推理栈: 兼容 vLLM 与 SGLang;1.6T MoE 可单节点 8×H100 INT4 部署;BF16 需多节点(约 3.2 TB 显存)。
- •量化选项: INT4 开箱即用,相比 BF16 仅损失 ~2-3 MMLU 分;生产推荐 FP8 作为质量 / 成本的最佳平衡点。
- •生态成熟度: 中文文档与社区案例落后于 DeepSeek/Qwen;英文教程稀疏,多数部署依赖官方仓库 vLLM 配置的复制。
🐾 稀疏 MoE 对标 DeepSeek V3 运营成本
LongCat-2.0 是 1.6T 总参数 / 48B 激活参数的稀疏激活 MoE 模型,美团明确将其运营成本对标 DeepSeek V3 —— INT4 量化版本约 ¥0.30 / ¥1.20 每百万 token,或 OpenRouter 按量付费 $0.60 / $2.40(接近 BF16 质量)。这些数字转化为实际部署经济性:单台 8×H100 INT4 节点每小时可服务的查询量相当于 DeepSeek V3 集群的三分之一 GPU 小时成本,并在 LongBench v2(美团参与维护的中文长上下文基准)上领先 13 分。 相比同等有效规模的稠密模型(Qwen3-72B、Llama-3.1-70B),其取舍在运维而非能力:开发者需要支持 MoE 的推理栈(vLLM 的 `enable_expert_parallelism`、SGLang 的 `--enable-ep`),并按激活专家而非总参数规划 KV 缓存容量。美团在权重发布的同时提供路由配置,集成工作主要是配置调优而非重新设计 —— 但对从未在生产中运维过稀疏 MoE 的团队而言,仍有一定迁移成本。
🌐 中国访问与延迟
LongCat 没有官方商业 API 端点 —— 接入分两条路径。在中国大陆,开发者通常从 Hugging Face(或镜像站)下载 MIT 权重,在 HK / SG / JP 区域的 RunPod 等价 H100 集群自部署;国内 GPU 云服务商(阿里百炼、腾讯云、火山引擎)间歇性地在其模型市场上架 1.6T MoE。海外用户可经由 OpenRouter 的 `meituan/longcat-2-0-1.6t-moe` 接入,价格 $0.60 / $2.40 每百万 token,无中国大陆路由。 延迟完全取决于部署区域。HK / SG 的自部署集群向中国大陆用户返回首 token 约 100-300ms(防火墙处罚后再加 50-100ms);通过 OpenAI 兼容聚合器(FreeModel、Portkey)走 OpenRouter 的方案,对中国用户通常再增加 200-400ms。面向中国流量的生产 API,标准建议为:(a) 在 HK 区域 H100 集群自部署,或 (b) 使用国内模型市场 —— 两条路径都能完全避开跨境路由处罚。