产品简介
VyvoTTS 是一个开源的文本转语音(TTS)开发框架,允许研究人员和开发者利用大语言模型(LLM)训练和部署自定义语音合成模型。它支持多种音频编解码器和推理后端,提供从数据集处理到模型训练的全流程工具,适合AI语音研究人员、TTS开发者及需要定制语音解决方案的内容创作者。

核心功能
- 基于LLM的端到端语音合成架构
- 支持SNAC和Mimi两种音频编解码器
- 跨平台运行(Windows/macOS/Linux)
- 集成vLLM、SGLang等多种高性能推理后端
- 提供从预训练到微调的完整模型训练流水线
快速开始
- 通过Git克隆仓库并创建Python 3.12虚拟环境。
- 使用uv安装基础包,并根据需要安装vLLM/SGLang等推理或训练依赖。
- 编写推理脚本,配置模型与编解码器参数,调用`generate`函数生成语音文件。
- (可选)使用`process_dataset`或`vyvotts.tokenize_emilia`命令准备训练数据。
- (可选)通过`accelerate`或`vyvotts.finetune`命令启动模型训练或微调。
界面预览
与其他方案对比
| 对比项 | VyvoTTS | 同类方案 |
|---|---|---|
| 输出延迟 (TTFT) | 集成vLLM后端,首次输出延迟可低至6ms | 基于传统语音合成模型的方案延迟通常较高 |
| 生成速度 | 集成SGLang后端,生成速度可达308 tokens/s | 开源TTS框架的生成速度普遍在50-100 tokens/s范围 |
| 模型架构 | 采用基于LLM(如LFM2.5, Qwen3)的先进架构 | 许多传统工具仍依赖如Tacotron等非LLM模型 |
适合谁用
- 从事语音合成、AI语音研究的科研人员与工程师
- 需要为产品(如语音助手、有声读物)定制专属TTS模型的开发者
- 对利用AI技术生成个性化语音内容感兴趣的技术爱好者
下载与版本
当前最新版本为 v1.0.0,发布于 2025-08-23。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/Vyvo-Labs/VyvoTTS