Python · 项目报告

Tencent-Hunyuan/Hy4-preview

该仓库暂未提供 GitHub 项目描述。

已完成 打开 GitHub
T
323星标
18Fork
2Issue
NOASSERTION许可证

分析结果

项目分析

Tencent-Hunyuan/Hy4-preview 是腾讯混元团队开源的新一代旗舰 MoE 大语言模型仓库,核心是 Hy4 preview 与 Hy4 preview-FP8 权重及部署说明。模型总参数约 770B,每 token 激活约 49B,支持最长 1M 上下文,面向代码、办公分析、游戏开发、科研推理等高复杂度生产力场景。仓库提供基于 vLLM 和 SGLang 的 OpenAI 兼容 API 部署方式,并提供微调与量化相关入口。

适用领域 大语言模型 / 生成式 AI / MoE 模型 / 代码智能 / 长上下文推理 / 企业级 AI 助手 / 模型部署 / 模型微调 / 模型量化
配置难度 高。该仓库不适合初学者直接本地运行,主要面向具备大模型推理部署经验、Docker/GPU 集群运维经验、vLLM 或 SGLang 使用经验的团队。客户端调用很简单,但服务端部署和成本控制复杂。
商业价值 商业价值较高,尤其适合需要私有化、国产化、长上下文和复杂推理能力的企业场景。它可作为代码助手、知识库问答、办公自动化、研发 Agent、游戏开发助手和科研分析平台的底座模型。Apache 2.0 许可和 FP8 权重提升了企业落地可行性,但由于模型规模巨大,最佳价值通常出现在有充足 GPU 资源、明确高价值业务场景和专业 AI Infra 团队的组织中。
01

技术亮点

  • 腾讯混元团队开源的旗舰级 MoE 模型,Apache 2.0 许可证,商业使用友好。
  • 770B 总参数、49B 激活参数,具备较强的推理和复杂任务处理能力。
  • 支持最长 1M 上下文,适合长文档、多文件代码仓库和复杂项目级任务。
  • 内置原生 MTP 层,可用于 speculative decoding 提升推理效率。
  • 提供 FP8 量化版本,降低超大模型部署成本。
  • 官方提供 vLLM 和 SGLang 镜像与启动示例,便于快速部署为 OpenAI 兼容 API。
  • 面向真实生产力场景优化,包括软件工程、办公分析、游戏开发和科研。
  • 支持工具调用解析和 reasoning parser,适合集成 Agent 框架。
  • 提供微调入口和量化工具链方向,适合进一步定制。
02

目标用户

  • 需要私有化部署大模型的企业 AI 团队
  • 大模型推理服务开发者
  • AI Infra / MLOps 工程师
  • 代码助手、办公助手、科研助手产品团队
  • 有多卡 GPU 集群资源的研究人员
  • 希望评估国产开源旗舰模型能力的开发者
03

配置要求

  • Python 客户端可使用 openai SDK 调用本地 OpenAI 兼容 API。
  • 推理服务推荐使用 Docker、NVIDIA GPU、CUDA 运行时及 --gpus all。
  • vLLM 推荐镜像:vllm/vllm-openai:hy4-preview。
  • SGLang 推荐镜像:lmsysorg/sglang:hy4-preview,支持 x86 和 Arm 多架构。
  • 推荐部署 FP8 版本 tencent/Hy4-preview-FP8,以降低显存压力。
  • 示例部署使用 tensor parallel size / tp-size = 8,意味着至少需要 8 张 GPU 参与张量并行。
  • vLLM 需配置 --attention-backend FLASHMLA_SPARSE、--speculative-config MTP、--tool-call-parser hy_v4、--reasoning-parser hy_v4。
  • SGLang 可配置 --reasoning-parser auto、--tool-call-parser auto、NEXTN speculative decoding 等参数。
  • 推荐推理参数:temperature=0.9,top_p=1.0。
  • 默认 reasoning mode 为 high,适合复杂推理、数学和代码任务;若需要直接回答,可传 extra_body={"chat_template_kwargs":{"reasoning_effort":"no_think"}}。
04

适用场景

  • 搭建 OpenAI 兼容的大模型 API 服务
  • 构建代码生成、代码理解、调试和软件工程 Agent
  • 处理超长文档、多文件项目、知识库问答和复杂上下文分析
  • 生成办公文档、表格分析、金融模型、PPT 内容草稿
  • 辅助游戏原型开发、游戏脚本生成和引擎工作流交互
  • 科研问题推理、数学推导、AI 研究辅助、物理和分子动力学分析
  • 基于 Hy4 preview 进行行业微调或压缩量化实验
05

部署与配置

  • 准备支持 CUDA 的多 GPU 环境,推荐至少 8 卡用于 FP8 版本的张量并行部署。
  • 选择模型来源:Hugging Face、ModelScope、GitCode 或 CNB 下载 Hy4-preview 或 Hy4-preview-FP8。
  • 使用 vLLM 部署时,拉取或直接运行官方镜像 vllm/vllm-openai:hy4-preview。
  • 执行 vLLM Docker 命令,挂载 Hugging Face 缓存目录,设置 --tensor-parallel-size 8、FLASHMLA_SPARSE attention backend、MTP speculative decoding 等参数。
  • 或使用 SGLang 部署,拉取 lmsysorg/sglang:hy4-preview 镜像,并通过 python3 -m sglang.launch_server 启动服务。
  • 服务启动后,使用 OpenAI Python SDK,将 base_url 指向 http://127.0.0.1:8000/v1,model 设置为 hy4-preview 即可调用。
  • 如需微调,参考仓库 finetune/README.md;如需量化压缩,可关注 Tencent AngelSlim 工具链。
06

风险与注意事项

  • 模型规模极大,真实部署门槛高,对 GPU 数量、显存、网络互联和运维能力要求很高。
  • 仓库主要提供模型说明与部署入口,非轻量级 Python 库,普通开发者本地难以直接运行。
  • README 中标注为 preview 早期版本,仍存在复杂任务推理耗时偏长、过度验证等已知问题。
  • 1M 长上下文虽然能力强,但实际使用成本和延迟可能很高。
  • 依赖 vLLM/SGLang 的特定镜像和后端能力,版本兼容性需要重点验证。
  • GitHub 元数据中 license 显示 NOASSERTION,但 README 声明 Apache 2.0,企业合规使用前应核对 LICENSE 文件和模型权重许可。
  • 超大模型的推理成本高,若没有高负载业务场景,ROI 可能不足。
  • 作为新模型,生态、社区案例和第三方评测还需要时间积累。

历史记录

热榜历史快照

2026-09-02 第29名 新收录 · github_search