LongCat-2.0 是美团 LongCat 团队发布的大规模 MoE 语言模型,采用 1.6T 总参数、约 48B 激活参数,并支持超长上下文与代码/Agent 场景。项目主要提供模型介绍、评测结果、部署说明和模型入口,模型权重托管在 Hugging Face 与 ModelScope。它面向希望部署或评估国产前沿大模型的开发者、算法工程师和企业 AI 团队,重点能力包括代码理解、仓库级修改、Agent 自动任务执行、搜索与通用推理。
适用领域
大语言模型 / MoE 模型 / 代码智能 / AI Agent / 长上下文推理 / 模型推理部署 / GPU/NPU 推理 / 企业级 AI 基础设施
配置难度
高。该项目不是普通 Python 库,而是超大规模 MoE 模型部署与评估项目。仅在线体验难度较低,但本地或企业私有化部署需要 16 卡级别高端 GPU/NPU 资源、SGLang 适配版本、内核编译、多卡并行调优和大模型推理经验。
商业价值
对具备算力资源的企业和平台团队价值较高。LongCat-2.0 可用于构建私有代码助手、Agent 自动化研发平台、长上下文知识处理系统和企业级大模型服务。MIT 许可证降低了商业采用阻力,ModelScope 入口也方便国内团队获取。但由于硬件成本和部署复杂度很高,中小团队更适合先通过官方网站或 API/托管服务评估效果,再决定是否私有化部署。
01
技术亮点
- 1.6T 总参数、约 48B 激活参数的大规模 MoE 模型,属于前沿级别模型规模。
- 支持 1M-context 级别长上下文训练数据,适合长文档、长代码仓库和复杂 Agent 任务。
- 提出 LongCat Sparse Attention,包括 Streaming-aware Indexing、Cross-Layer Indexing、Hierarchical Indexing,目标是降低长上下文推理瓶颈。
- 引入 N-gram Embedding,README 称其可提升稀疏维度上的参数利用效率。
- 强调代码和 Agent 能力,在 Terminal-Bench、SWE-bench Pro、SWE-bench Multilingual、FORTE、BrowseComp、RWSearch 等任务上给出较强评测结果。
- 支持 GPU 和 NPU 平台,训练和大规模部署基于 AI ASIC superpods,体现对非传统 GPU 平台的探索。
- 采用 MIT License,对商业化和二次开发较友好。
- 提供 Hugging Face、ModelScope、官网聊天入口,国内开发者获取和体验门槛相对较低。
02
目标用户
- 希望评估国产前沿大模型能力的算法工程师
- 需要代码生成、代码理解、仓库级修改能力的研发团队
- 构建 Agent 工作流、自动化任务执行系统的开发者
- 具备多卡 GPU/NPU 资源的大模型平台团队
- 关注 MoE、稀疏注意力、超长上下文架构的研究人员
- 希望在国内环境通过 ModelScope 获取模型的企业开发者
03
配置要求
- 硬件:模型规模极大,本地部署需要高端多卡环境。README 推荐 GPU 部署使用 16x H20,并结合 Tensor Parallelism 与 Expert Parallelism。
- 模型版本:部署示例使用 meituan-longcat/LongCat-2.0-FP8,说明更适合 FP8 推理环境。
- 推理框架:需要支持 LongCat-2.0 结构的 SGLang 适配版本;普通 vLLM/SGLang 主线是否可直接运行需进一步验证。
- 编译环境:需要能够编译 sgl-kernel,依赖 Python、uv、CMake、CUDA/相关 GPU 编译工具链等。
- 启动参数:需要设置 --trust-remote-code,因为模型可能依赖自定义代码。
- 并行配置:需要配置 tp 等张量并行参数;专家并行相关参数需根据实际 SGLang 适配实现和硬件资源调整。
- 平台:README 声称支持 GPU 和 NPU,但给出的详细命令主要是 GPU/SGLang 路线,NPU 部署细节可能需要查看后续文档或官方渠道。
- 网络与存储:模型权重体积巨大,需要稳定下载通道和充足磁盘空间;国内用户可优先考虑 ModelScope。
04
适用场景
- 在企业内部部署 LongCat-2.0 作为代码助手或研发 Copilot
- 接入 Claude Code、OpenClaw、Hermes 等 Agent 工具链进行自动化软件工程任务
- 用于 SWE-bench 类仓库级 Bug 修复、代码修改、测试修复场景
- 构建长上下文问答、长文档分析、超长代码仓库理解应用
- 评估 MoE 模型在 GPU/NPU 平台上的推理性能和部署成本
- 作为研究对象分析 LongCat Sparse Attention、N-gram Embedding、MTP speculative decoding 等技术
05
部署与配置
- 从 Hugging Face 或 ModelScope 获取模型权重,例如 Hugging Face: meituan-longcat/LongCat-2.0 或 ModelScope: meituan-longcat/LongCat-2.0。
- 准备部署环境。官方说明支持 GPU 和 NPU,GPU 侧推荐使用 SGLang 适配分支。
- 安装或切换到支持 LongCat-2.0 的 SGLang 适配版本,README 中引用了 feature/longcat_dsa 分支。
- 编译并更新 sgl-kernel:进入 sgl-kernel 目录,执行 uv build 构建 wheel,并使用 pip 强制安装生成的 sgl_kernel wheel。
- 使用 sglang.launch_server 启动服务,示例参数包括 --model meituan-longcat/LongCat-2.0-FP8、--trust-remote-code、--host 0.0.0.0、--port 13423、--tp 16。
- 根据实际硬件调整 Tensor Parallelism、Expert Parallelism、端口、上下文长度、并发参数等部署配置。
- 服务启动后,通过兼容接口接入业务系统、Agent 框架或代码助手工具链。
06
风险与注意事项
- 模型体量极大,单机或普通多卡开发环境基本无法部署,硬件成本和运维门槛很高。
- README 中部署说明依赖特定 SGLang 适配分支和 sgl-kernel 编译,工程成熟度和主线兼容性需要验证。
- GPU 部署说明中提到 Hierarchical Indexing 为简化未支持,实际推理能力或效率可能与论文/博客中完整架构存在差异。
- 评测结果大量为官方自测或引用官方报告,需在自身业务数据和真实场景中重新评估。
- 仓库本身更像模型发布页,可能不包含完整训练代码、推理核心实现或详细 NPU 部署文档。
- 使用 --trust-remote-code 存在供应链和安全审计风险,企业内网部署前应审查模型代码。
- FP8、多卡并行、MoE 推理对驱动、CUDA、通信库、内核版本要求较高,排障成本可能较大。
- 截至当前仓库 stars 和 forks 较少,社区生态、Issue 经验和第三方教程可能还不充分。
2026-07-06
第22名
新收录 · github_search
2026-07-05
第22名
新收录 · github_search
2026-07-04
第28名
新收录 · github_search