Python · 项目报告

Audio8-AI/Audio8_TTS

SOTA-Class TTS at Compact Scale

已完成 打开 GitHub
A
335星标
31Fork
1Issue
Apache-2.0许可证

分析结果

项目分析

Audio8_TTS 是一个 Apache-2.0 开源的多语言文本转语音(TTS)项目,提供约 0.6B 参数的 Preview 模型,支持零样本声音克隆、多语言语音生成、批量推理、CPU ONNX INT4 部署、SGLang Omni 高性能服务化以及监督微调(SFT)流程。模型采用类似 Fish Speech 的 DualAR 架构,内置神经音频 codec,支持中文、粤语、英语、日语、韩语、法语、德语、西班牙语等 11 种推荐语言。该项目适合希望在较小模型规模下实现高质量 TTS、声音克隆和私有化语音合成服务的开发者或团队。

适用领域 文本转语音 / 语音合成 / 零样本声音克隆 / 多语言语音生成 / AI 音频生成 / 语音模型部署 / ONNX 推理 / SGLang 服务化 / 监督微调
配置难度 中高。基础 CLI 推理难度中等,按 README 下载模型并运行即可;但要进行 ONNX CPU 部署、SGLang Omni 高性能服务化、流式接口或监督微调,需要熟悉 Python、PyTorch、CUDA、Hugging Face、ONNX Runtime、SGLang 以及音频处理。企业级部署需要额外处理稳定性、并发、切句、缓存、监控和合规问题。
商业价值 较高。该项目可以帮助团队快速构建私有化、多语言、可声音克隆的 TTS 能力,适用于 AI 客服、虚拟人、短视频配音、有声书、教育内容、游戏角色语音、智能硬件和实时语音助手等场景。Apache-2.0 许可证降低商业落地门槛,ONNX 和 SGLang Omni 两条部署路线也覆盖了轻量化和高性能服务化需求。但由于当前仍是 Preview 版本,商业化前应重点验证中文自然度、稳定性、长文本效果、并发性能、声音克隆合规性和部署维护成本。
01

技术亮点

  • 模型规模较紧凑,主模型约 601M 参数,但定位为 SOTA-Class TTS at Compact Scale。
  • 支持零样本声音克隆,无需为每个说话人单独训练即可模仿参考音色。
  • 内置 codec,参考音频编码和 waveform 解码不需要额外下载独立 codec 模型。
  • 支持中文和粤语,对中文开发者和中文语音应用较友好。
  • 提供基础 CLI 推理、批量推理、ONNX CPU 部署、SGLang Omni 服务化等多种使用路径。
  • ONNX Runtime INT4 版本适合无 PyTorch、无 Transformers 的轻量级 CPU 部署场景。
  • SGLang Omni adapter 提供 OpenAI 兼容接口,便于接入现有 AI 网关、Agent 或后端服务。
  • 支持流式 PCM 输出,适合实时语音交互场景。
  • 提供监督微调流程,便于基于私有数据做领域适配或说话人适配。
  • Apache-2.0 许可证对商业使用相对友好。
02

目标用户

  • 需要中文、多语言 TTS 能力的 AI 应用开发者
  • 希望私有化部署语音合成服务的企业团队
  • 从事 AIGC 音频、播客、有声书、虚拟人、客服语音的产品团队
  • 研究语音合成、声音克隆和自回归音频模型的算法工程师
  • 需要 OpenAI 兼容音频接口的后端开发者
  • 希望在 CPU 或低资源环境中尝试 TTS 部署的开发者
03

配置要求

  • Python 版本:基础推理要求 Python 3.10+;SGLang Omni 示例使用 Python 3.12。
  • 推荐硬件:CUDA-capable GPU;高性能服务化示例使用 NVIDIA H20,H100 等 Hopper GPU 更适合 fa3 attention backend。
  • CPU 部署:可使用 ONNX Runtime INT4 模型,README 中提到 Apple M2 测试在线 session 约占用 1 GiB 内存。
  • 模型路径:默认期望模型目录为 model/audio8_tts_0_6B_preview/,也可通过 --model 指定 Hugging Face 模型 ID。
  • 输入长度:建议每段文本控制在 150 个字符以内,较长文本应切分,否则可能降低生成质量。
  • 零样本克隆要求:reference_audio 和 reference_text 应匹配,参考文本应为参考音频的准确转写。
  • 支持语言:Preview 版本主要推荐 11 种语言,包括中文、粤语、英语、日语、韩语、法语、德语、意大利语、西班牙语、荷兰语、波兰语。
  • SGLang Omni 兼容性:需使用测试过的 SGLang Omni revision 68a572348837f7b004857b4b07993c20ade4c017,而不是最新 main 分支。
  • SGLang 关键依赖:SGLang 0.5.8、PyTorch 2.9.1+cu128、Transformers 4.57.1、BF16 精度。
  • Transformers 版本风险:README 明确提示 Transformers 5.x 可能导致该 custom-code 模型生成无效的全零 codes,应保持在 >=4.57.0,<5。
  • SGLang 服务限制:当前 adapter 支持 TP=1,每个请求支持一个参考声音。
  • 常用环境变量:MODEL、MODEL_NAME、SGLANG_OMNI_ROOT、AUDIO8_TTS_ENABLE_TORCH_COMPILE、AUDIO8_TTS_ATTENTION_BACKEND、AUDIO8_TTS_MEM_FRACTION_STATIC、AUDIO8_TTS_MAX_RUNNING_REQUESTS、AUDIO8_TTS_DISABLE_CUDA_GRAPH 等。
04

适用场景

  • 将中文、英文、日文、韩文等文本转换为自然语音
  • 基于一段参考音频和对应文本进行零样本声音克隆
  • 为虚拟人、数字客服、AI 助手生成个性化语音
  • 批量生成有声书、课程旁白、短视频配音或播客音频
  • 通过 SGLang Omni 提供 OpenAI 兼容的 /v1/audio/speech 接口
  • 使用 ONNX INT4 模型在 CPU 环境中进行轻量化部署
  • 对特定领域、特定说话人或企业数据进行监督微调
  • 构建支持流式 PCM 输出的实时语音合成服务
05

部署与配置

  • 准备 Python 3.10 或更高版本,推荐使用 CUDA GPU 进行 PyTorch 推理。
  • 克隆仓库:git clone https://github.com/Audio8-AI/Audio8_TTS.git && cd Audio8_TTS
  • 创建虚拟环境:python3 -m venv .venv && source .venv/bin/activate
  • 安装基础依赖:pip install -r requirements.txt
  • 从 Hugging Face 下载 Audio8-TTS-Preview-0.6b 模型权重。
  • 将模型放置到 model/audio8_tts_0_6B_preview/,或在命令中通过 --model 指定 Hugging Face 模型 ID。
  • 执行无参考语音推理:python audio8_tts_infer.py --text "This utterance does not use a reference voice." --output outputs/no_reference.wav
  • 执行零样本声音克隆:python audio8_tts_infer.py --text "目标文本" --reference-audio examples/reference.wav --reference-text "参考音频逐字稿" --output outputs/clone.wav
  • 如需批量推理,准备 JSONL manifest,并使用 --input-jsonl、--output-dir 和 --batch-size 参数。
  • 如需 CPU 部署,下载 ONNX INT4 模型并参考 onnx_runtime/README.md。
  • 如需高性能服务化部署,按 README 中的 SGLang Omni 指南安装指定版本 SGLang Omni、adapter 并启动服务。
06

风险与注意事项

  • 当前为 Preview 状态,语言覆盖有限,README 明确建议主要使用 11 种推荐语言。
  • 中文方言支持尚未完全展开,除粤语外的方言效果可能不稳定。
  • 输入文本过长会降低生成质量,需要业务侧自行做分句和拼接。
  • 声音克隆依赖参考音频和参考文本匹配度,转写不准确会影响效果。
  • SGLang Omni adapter 依赖内部接口,版本兼容性较脆弱,不建议直接使用最新 main 分支。
  • 高性能部署栈较复杂,涉及 CUDA、SGLang、FlashInfer、fa3、Torch compile、libnuma、nvcc 等环境问题。
  • Transformers 5.x 存在已知风险,可能产生无效全零 codes。
  • 当前 SGLang adapter 支持 TP=1 和单参考音频,超大规模多 GPU 并行或多参考融合能力有限。
  • 声音克隆存在合规和伦理风险,应在产品中加入授权、审核、水印或滥用防护机制。
  • 仓库 stars 约 304,生态和社区成熟度相比 Coqui TTS、Fish Speech 等项目仍需观察。

历史记录

热榜历史快照

2026-08-05 第28名 新收录 · github_search
2026-08-04 第28名 新收录 · github_search