产品推荐 2026-07-27

VoiceSculptor:免费的声音设计克隆工具(源码)

VoiceSculptor是一个基于指令的文本转语音工具,用于设计和克隆声音。

开源软件跨平台工具

产品简介

VoiceSculptor 是一款开源文本转语音软件,允许用户通过自然语言描述设计独特音色,并支持声音克隆。它提供对性别、年龄、语速等语音属性的精细控制,适合需要自定义语音生成的内容创作者、研究人员和开发者。

VoiceSculptor 主界面

核心功能

  • 自然语言描述生成音色
  • 检索增强生成(RAG)优化命令
  • 细粒度语音属性控制(性别、年龄、语速等)
  • 声音克隆功能
  • 跨平台支持(Windows、macOS、Linux)

快速开始

  1. 克隆VoiceSculptor仓库并创建Python环境(conda create)
  2. 下载预训练模型文件到本地(git clone)
  3. 修改infer.py中的模型路径并运行推理脚本(python infer.py)

界面预览

VoiceSculptor 界面截图

VoiceSculptor 界面截图

与其他方案对比

对比项VoiceSculptor同类方案
中文指令TTS评估平均得分VoiceSculptor得分67.6%,高于部分开源模型如MiMo-Audio-7B-Instruct(64.5%)商业模型如Gemini 2.5-Flash得分85.4%,性能更高但可能不免费

适合谁用

  • 需要自定义语音生成的内容创作者
  • 研究语音合成技术的研究人员
  • 开发集成语音功能应用的开发者

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/ASLP-lab/VoiceSculptor