项目 · 项目报告

meituan-longcat/LongCat-2.0

该仓库暂未提供 GitHub 项目描述。

已完成 打开 GitHub
M
242星标
23Fork
2Issue
MIT许可证

分析结果

项目分析

LongCat-2.0 是美团 LongCat 团队发布的大规模 MoE 语言模型,采用 1.6T 总参数、约 48B 激活参数,并支持超长上下文与代码/Agent 场景。项目主要提供模型介绍、评测结果、部署说明和模型入口,模型权重托管在 Hugging Face 与 ModelScope。它面向希望部署或评估国产前沿大模型的开发者、算法工程师和企业 AI 团队,重点能力包括代码理解、仓库级修改、Agent 自动任务执行、搜索与通用推理。

适用领域 大语言模型 / MoE 模型 / 代码智能 / AI Agent / 长上下文推理 / 模型推理部署 / GPU/NPU 推理 / 企业级 AI 基础设施
配置难度 高。该项目不是普通 Python 库,而是超大规模 MoE 模型部署与评估项目。仅在线体验难度较低,但本地或企业私有化部署需要 16 卡级别高端 GPU/NPU 资源、SGLang 适配版本、内核编译、多卡并行调优和大模型推理经验。
商业价值 对具备算力资源的企业和平台团队价值较高。LongCat-2.0 可用于构建私有代码助手、Agent 自动化研发平台、长上下文知识处理系统和企业级大模型服务。MIT 许可证降低了商业采用阻力,ModelScope 入口也方便国内团队获取。但由于硬件成本和部署复杂度很高,中小团队更适合先通过官方网站或 API/托管服务评估效果,再决定是否私有化部署。
01

技术亮点

  • 1.6T 总参数、约 48B 激活参数的大规模 MoE 模型,属于前沿级别模型规模。
  • 支持 1M-context 级别长上下文训练数据,适合长文档、长代码仓库和复杂 Agent 任务。
  • 提出 LongCat Sparse Attention,包括 Streaming-aware Indexing、Cross-Layer Indexing、Hierarchical Indexing,目标是降低长上下文推理瓶颈。
  • 引入 N-gram Embedding,README 称其可提升稀疏维度上的参数利用效率。
  • 强调代码和 Agent 能力,在 Terminal-Bench、SWE-bench Pro、SWE-bench Multilingual、FORTE、BrowseComp、RWSearch 等任务上给出较强评测结果。
  • 支持 GPU 和 NPU 平台,训练和大规模部署基于 AI ASIC superpods,体现对非传统 GPU 平台的探索。
  • 采用 MIT License,对商业化和二次开发较友好。
  • 提供 Hugging Face、ModelScope、官网聊天入口,国内开发者获取和体验门槛相对较低。
02

目标用户

  • 希望评估国产前沿大模型能力的算法工程师
  • 需要代码生成、代码理解、仓库级修改能力的研发团队
  • 构建 Agent 工作流、自动化任务执行系统的开发者
  • 具备多卡 GPU/NPU 资源的大模型平台团队
  • 关注 MoE、稀疏注意力、超长上下文架构的研究人员
  • 希望在国内环境通过 ModelScope 获取模型的企业开发者
03

配置要求

  • 硬件:模型规模极大,本地部署需要高端多卡环境。README 推荐 GPU 部署使用 16x H20,并结合 Tensor Parallelism 与 Expert Parallelism。
  • 模型版本:部署示例使用 meituan-longcat/LongCat-2.0-FP8,说明更适合 FP8 推理环境。
  • 推理框架:需要支持 LongCat-2.0 结构的 SGLang 适配版本;普通 vLLM/SGLang 主线是否可直接运行需进一步验证。
  • 编译环境:需要能够编译 sgl-kernel,依赖 Python、uv、CMake、CUDA/相关 GPU 编译工具链等。
  • 启动参数:需要设置 --trust-remote-code,因为模型可能依赖自定义代码。
  • 并行配置:需要配置 tp 等张量并行参数;专家并行相关参数需根据实际 SGLang 适配实现和硬件资源调整。
  • 平台:README 声称支持 GPU 和 NPU,但给出的详细命令主要是 GPU/SGLang 路线,NPU 部署细节可能需要查看后续文档或官方渠道。
  • 网络与存储:模型权重体积巨大,需要稳定下载通道和充足磁盘空间;国内用户可优先考虑 ModelScope。
04

适用场景

  • 在企业内部部署 LongCat-2.0 作为代码助手或研发 Copilot
  • 接入 Claude Code、OpenClaw、Hermes 等 Agent 工具链进行自动化软件工程任务
  • 用于 SWE-bench 类仓库级 Bug 修复、代码修改、测试修复场景
  • 构建长上下文问答、长文档分析、超长代码仓库理解应用
  • 评估 MoE 模型在 GPU/NPU 平台上的推理性能和部署成本
  • 作为研究对象分析 LongCat Sparse Attention、N-gram Embedding、MTP speculative decoding 等技术
05

部署与配置

  • 从 Hugging Face 或 ModelScope 获取模型权重,例如 Hugging Face: meituan-longcat/LongCat-2.0 或 ModelScope: meituan-longcat/LongCat-2.0。
  • 准备部署环境。官方说明支持 GPU 和 NPU,GPU 侧推荐使用 SGLang 适配分支。
  • 安装或切换到支持 LongCat-2.0 的 SGLang 适配版本,README 中引用了 feature/longcat_dsa 分支。
  • 编译并更新 sgl-kernel:进入 sgl-kernel 目录,执行 uv build 构建 wheel,并使用 pip 强制安装生成的 sgl_kernel wheel。
  • 使用 sglang.launch_server 启动服务,示例参数包括 --model meituan-longcat/LongCat-2.0-FP8、--trust-remote-code、--host 0.0.0.0、--port 13423、--tp 16。
  • 根据实际硬件调整 Tensor Parallelism、Expert Parallelism、端口、上下文长度、并发参数等部署配置。
  • 服务启动后,通过兼容接口接入业务系统、Agent 框架或代码助手工具链。
06

风险与注意事项

  • 模型体量极大,单机或普通多卡开发环境基本无法部署,硬件成本和运维门槛很高。
  • README 中部署说明依赖特定 SGLang 适配分支和 sgl-kernel 编译,工程成熟度和主线兼容性需要验证。
  • GPU 部署说明中提到 Hierarchical Indexing 为简化未支持,实际推理能力或效率可能与论文/博客中完整架构存在差异。
  • 评测结果大量为官方自测或引用官方报告,需在自身业务数据和真实场景中重新评估。
  • 仓库本身更像模型发布页,可能不包含完整训练代码、推理核心实现或详细 NPU 部署文档。
  • 使用 --trust-remote-code 存在供应链和安全审计风险,企业内网部署前应审查模型代码。
  • FP8、多卡并行、MoE 推理对驱动、CUDA、通信库、内核版本要求较高,排障成本可能较大。
  • 截至当前仓库 stars 和 forks 较少,社区生态、Issue 经验和第三方教程可能还不充分。

历史记录

热榜历史快照

2026-07-06 第22名 新收录 · github_search
2026-07-05 第22名 新收录 · github_search
2026-07-04 第28名 新收录 · github_search