产品推荐 2026-07-28

VyvoTTS:开源免费跨平台的语音合成训练框架(源码)

一个基于大语言模型的开源文本转语音模型训练与推理框架。

开源软件跨平台工具

产品简介

VyvoTTS 是一个开源的文本转语音(TTS)开发框架,允许研究人员和开发者利用大语言模型(LLM)训练和部署自定义语音合成模型。它支持多种音频编解码器和推理后端,提供从数据集处理到模型训练的全流程工具,适合AI语音研究人员、TTS开发者及需要定制语音解决方案的内容创作者。

VyvoTTS 主界面

核心功能

  • 基于LLM的端到端语音合成架构
  • 支持SNAC和Mimi两种音频编解码器
  • 跨平台运行(Windows/macOS/Linux)
  • 集成vLLM、SGLang等多种高性能推理后端
  • 提供从预训练到微调的完整模型训练流水线

快速开始

  1. 通过Git克隆仓库并创建Python 3.12虚拟环境。
  2. 使用uv安装基础包,并根据需要安装vLLM/SGLang等推理或训练依赖。
  3. 编写推理脚本,配置模型与编解码器参数,调用`generate`函数生成语音文件。
  4. (可选)使用`process_dataset`或`vyvotts.tokenize_emilia`命令准备训练数据。
  5. (可选)通过`accelerate`或`vyvotts.finetune`命令启动模型训练或微调。

界面预览

与其他方案对比

对比项VyvoTTS同类方案
输出延迟 (TTFT)集成vLLM后端,首次输出延迟可低至6ms基于传统语音合成模型的方案延迟通常较高
生成速度集成SGLang后端,生成速度可达308 tokens/s开源TTS框架的生成速度普遍在50-100 tokens/s范围
模型架构采用基于LLM(如LFM2.5, Qwen3)的先进架构许多传统工具仍依赖如Tacotron等非LLM模型

适合谁用

  • 从事语音合成、AI语音研究的科研人员与工程师
  • 需要为产品(如语音助手、有声读物)定制专属TTS模型的开发者
  • 对利用AI技术生成个性化语音内容感兴趣的技术爱好者

下载与版本

当前最新版本为 v1.0.0,发布于 2025-08-23。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/Vyvo-Labs/VyvoTTS