产品简介
VoiceSculptor 是一款开源文本转语音软件,允许用户通过自然语言描述设计独特音色,并支持声音克隆。它提供对性别、年龄、语速等语音属性的精细控制,适合需要自定义语音生成的内容创作者、研究人员和开发者。
核心功能
- 自然语言描述生成音色
- 检索增强生成(RAG)优化命令
- 细粒度语音属性控制(性别、年龄、语速等)
- 声音克隆功能
- 跨平台支持(Windows、macOS、Linux)
快速开始
- 克隆VoiceSculptor仓库并创建Python环境(conda create)
- 下载预训练模型文件到本地(git clone)
- 修改infer.py中的模型路径并运行推理脚本(python infer.py)
界面预览


与其他方案对比
| 对比项 | VoiceSculptor | 同类方案 |
|---|---|---|
| 中文指令TTS评估平均得分 | VoiceSculptor得分67.6%,高于部分开源模型如MiMo-Audio-7B-Instruct(64.5%) | 商业模型如Gemini 2.5-Flash得分85.4%,性能更高但可能不免费 |
适合谁用
- 需要自定义语音生成的内容创作者
- 研究语音合成技术的研究人员
- 开发集成语音功能应用的开发者
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/ASLP-lab/VoiceSculptor