Tencent-Hunyuan/Hy4-preview 是腾讯混元团队开源的新一代旗舰 MoE 大语言模型仓库,核心是 Hy4 preview 与 Hy4 preview-FP8 权重及部署说明。模型总参数约 770B,每 token 激活约 49B,支持最长 1M 上下文,面向代码、办公分析、游戏开发、科研推理等高复杂度生产力场景。仓库提供基于 vLLM 和 SGLang 的 OpenAI 兼容 API 部署方式,并提供微调与量化相关入口。
适用领域
大语言模型 / 生成式 AI / MoE 模型 / 代码智能 / 长上下文推理 / 企业级 AI 助手 / 模型部署 / 模型微调 / 模型量化
配置难度
高。该仓库不适合初学者直接本地运行,主要面向具备大模型推理部署经验、Docker/GPU 集群运维经验、vLLM 或 SGLang 使用经验的团队。客户端调用很简单,但服务端部署和成本控制复杂。
商业价值
商业价值较高,尤其适合需要私有化、国产化、长上下文和复杂推理能力的企业场景。它可作为代码助手、知识库问答、办公自动化、研发 Agent、游戏开发助手和科研分析平台的底座模型。Apache 2.0 许可和 FP8 权重提升了企业落地可行性,但由于模型规模巨大,最佳价值通常出现在有充足 GPU 资源、明确高价值业务场景和专业 AI Infra 团队的组织中。
01
技术亮点
- 腾讯混元团队开源的旗舰级 MoE 模型,Apache 2.0 许可证,商业使用友好。
- 770B 总参数、49B 激活参数,具备较强的推理和复杂任务处理能力。
- 支持最长 1M 上下文,适合长文档、多文件代码仓库和复杂项目级任务。
- 内置原生 MTP 层,可用于 speculative decoding 提升推理效率。
- 提供 FP8 量化版本,降低超大模型部署成本。
- 官方提供 vLLM 和 SGLang 镜像与启动示例,便于快速部署为 OpenAI 兼容 API。
- 面向真实生产力场景优化,包括软件工程、办公分析、游戏开发和科研。
- 支持工具调用解析和 reasoning parser,适合集成 Agent 框架。
- 提供微调入口和量化工具链方向,适合进一步定制。
02
目标用户
- 需要私有化部署大模型的企业 AI 团队
- 大模型推理服务开发者
- AI Infra / MLOps 工程师
- 代码助手、办公助手、科研助手产品团队
- 有多卡 GPU 集群资源的研究人员
- 希望评估国产开源旗舰模型能力的开发者
03
配置要求
- Python 客户端可使用 openai SDK 调用本地 OpenAI 兼容 API。
- 推理服务推荐使用 Docker、NVIDIA GPU、CUDA 运行时及 --gpus all。
- vLLM 推荐镜像:vllm/vllm-openai:hy4-preview。
- SGLang 推荐镜像:lmsysorg/sglang:hy4-preview,支持 x86 和 Arm 多架构。
- 推荐部署 FP8 版本 tencent/Hy4-preview-FP8,以降低显存压力。
- 示例部署使用 tensor parallel size / tp-size = 8,意味着至少需要 8 张 GPU 参与张量并行。
- vLLM 需配置 --attention-backend FLASHMLA_SPARSE、--speculative-config MTP、--tool-call-parser hy_v4、--reasoning-parser hy_v4。
- SGLang 可配置 --reasoning-parser auto、--tool-call-parser auto、NEXTN speculative decoding 等参数。
- 推荐推理参数:temperature=0.9,top_p=1.0。
- 默认 reasoning mode 为 high,适合复杂推理、数学和代码任务;若需要直接回答,可传 extra_body={"chat_template_kwargs":{"reasoning_effort":"no_think"}}。
04
适用场景
- 搭建 OpenAI 兼容的大模型 API 服务
- 构建代码生成、代码理解、调试和软件工程 Agent
- 处理超长文档、多文件项目、知识库问答和复杂上下文分析
- 生成办公文档、表格分析、金融模型、PPT 内容草稿
- 辅助游戏原型开发、游戏脚本生成和引擎工作流交互
- 科研问题推理、数学推导、AI 研究辅助、物理和分子动力学分析
- 基于 Hy4 preview 进行行业微调或压缩量化实验
05
部署与配置
- 准备支持 CUDA 的多 GPU 环境,推荐至少 8 卡用于 FP8 版本的张量并行部署。
- 选择模型来源:Hugging Face、ModelScope、GitCode 或 CNB 下载 Hy4-preview 或 Hy4-preview-FP8。
- 使用 vLLM 部署时,拉取或直接运行官方镜像 vllm/vllm-openai:hy4-preview。
- 执行 vLLM Docker 命令,挂载 Hugging Face 缓存目录,设置 --tensor-parallel-size 8、FLASHMLA_SPARSE attention backend、MTP speculative decoding 等参数。
- 或使用 SGLang 部署,拉取 lmsysorg/sglang:hy4-preview 镜像,并通过 python3 -m sglang.launch_server 启动服务。
- 服务启动后,使用 OpenAI Python SDK,将 base_url 指向 http://127.0.0.1:8000/v1,model 设置为 hy4-preview 即可调用。
- 如需微调,参考仓库 finetune/README.md;如需量化压缩,可关注 Tencent AngelSlim 工具链。
06
风险与注意事项
- 模型规模极大,真实部署门槛高,对 GPU 数量、显存、网络互联和运维能力要求很高。
- 仓库主要提供模型说明与部署入口,非轻量级 Python 库,普通开发者本地难以直接运行。
- README 中标注为 preview 早期版本,仍存在复杂任务推理耗时偏长、过度验证等已知问题。
- 1M 长上下文虽然能力强,但实际使用成本和延迟可能很高。
- 依赖 vLLM/SGLang 的特定镜像和后端能力,版本兼容性需要重点验证。
- GitHub 元数据中 license 显示 NOASSERTION,但 README 声明 Apache 2.0,企业合规使用前应核对 LICENSE 文件和模型权重许可。
- 超大模型的推理成本高,若没有高负载业务场景,ROI 可能不足。
- 作为新模型,生态、社区案例和第三方评测还需要时间积累。
2026-09-02
第29名
新收录 · github_search