产品推荐 2026-07-27

ComfyUI-FishAudioS2:高级文本转语音工具(

为ComfyUI集成的高级文本转语音工具,支持声音克隆与情绪控制。

开源软件跨平台工具

产品简介

ComfyUI-FishAudioS2 本工具将先进的Fish Audio S2-Pro语音合成模型无缝集成至ComfyUI。它解决了传统TTS工具难以精细控制语音情绪、难以实现多角色对话合成的痛点。适合内容创作者、配音工作者及开发者在可视化工作流中快速生成富有表现力的多语言语音内容。

ComfyUI-FishAudioS2 主界面

核心功能

  • 支持10-30秒参考音频的零样本声音克录
  • 内置1500+情绪标签进行精细化控制
  • 支持83种语言,无需音素预处理
  • 单次生成包含多个克隆声音的多说话人对话
  • 可为每个说话人生成独立音频轨道

快速开始

  1. 通过ComfyUI Manager搜索并安装"FishAudioS2"插件。
  2. 重启ComfyUI,插件首次使用时会自动从HuggingFace下载所需模型权重。
  3. 在ComfyUI工作流中添加相应的Fish Audio S2节点(如Voice Clone、TTS),连接音频输入和文本提示即可开始生成。

界面预览

与其他方案对比

对比项ComfyUI-FishAudioS2同类方案
情绪与表现力控制内置1500+情绪标签,通过[laugh]、[whisper]等标签在文本中直接精细控制语调、语速和情感。大多数在线或本地TTS工具仅提供有限的情绪风格选择(如“欢快”、“平静”),无法进行细粒度的行内控制。
多说话人对话合成支持在单次运行中,使用多个不同克隆的声音生成完整对话,并可为每个声音输出独立音轨。通常需要多次调用服务并手动拼接音频,且难以生成自然连贯的对话流,更无法为唇形同步分离音轨。

适合谁用

  • 需要为视频或播客快速生成多角色、富有感情配音的短视频创作者与播客制作人。
  • 希望复制特定声音(如亲人、名人)用于个性化内容创作的个人用户。
  • 需要在本地构建自动化、高可控语音合成流程的AI开发者与研究人员。

下载与版本

当前最新版本为 v0.5.3,发布于 2026-04-27。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项