产品推荐 2026-07-28

ComfyUI-F5-TTS:声音克隆文本转语音工具(源码)

ComfyUI 文本转语音插件,用你自己的声音生成音频。

开源软件跨平台工具

产品简介

ComfyUI-F5-TTS 是基于 ComfyUI 的文本转语音插件,能克隆用户提供的声音样本生成音频,解决传统 TTS 声音不自然的痛点,适合需要个性化语音的内容创作者和开发者。

核心功能

  • 克隆用户声音进行文本转语音
  • 支持多种自定义语言模型
  • 支持多声音输出通过不同声音文件
  • 提供示例工作流快速上手
  • 跨平台支持 Windows、macOS、Linux

快速开始

  1. 安装 ffmpeg(Windows 使用 winget 命令,其他平台参考说明)
  2. 准备声音样本文件:一个 .wav 音频和同名 .txt 文本(内容为所说的话)
  3. 将文件放入 ComfyUI 的 input 文件夹(支持 F5-TTS、audio 子文件夹)
  4. 在 ComfyUI 中刷新节点并配置使用,可参考示例工作流

界面预览

与其他方案对比

对比项ComfyUI-F5-TTS同类方案
声音克隆能力能使用用户自己的声音样本克隆生成语音传统 TTS 通常使用预设声音,缺乏个性化定制
自定义模型支持支持多种语言自定义模型(如法语、德语等),通过简单文件添加可能只支持固定语言或自定义扩展有限

适合谁用

  • 需要个性化语音的内容创作者(如视频制作者、播客主播)
  • 开发者集成文本转语音功能到项目
  • 教育工作者制作多语言教学音频

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/niknah/ComfyUI-F5-TTS