产品简介
Diffusion-Speech-Tokenizer 基于扩散模型的先进语音分词工具,能以极低码率(0.0875 kbps)将24kHz语音压缩为Token,同时结合文本信息提升重建质量。适用于从事语音大模型、零样本语音合成研究的科研人员与开发者。

核心功能
- 文本感知的扩散解码器,提升语音重建质量
- 实现超低帧率(6.25 Hz)与比特率(0.0875 kbps)压缩
- 支持基于Token的零样本语音合成(包括自回归与扩散模型)
- 提供在Hugging Face上托管的预训练模型,并支持自动下载
- 采用端到端的扩散自编码器架构进行优化
快速开始
- 通过Hugging Face链接获取预训练模型或使用代码自动下载
- 使用Python调用`TaDiCodecPipline`加载Tokenizer模型
- 结合AR或MGM TTS模型进行推理,输入文本生成语音
界面预览

与其他方案对比
| 对比项 | Diffusion-Speech-Tokenizer | 同类方案 |
|---|---|---|
| 压缩率与质量 | 达到0.0875 kbps极低码率,同时保持高质量(UTMOS)和说话人相似度(SIM) | 通常码率较高,或在极低码率下质量下降明显 |
| 技术架构 | 采用融合文本引导的扩散自编码器,端到端优化 | 传统或独立的分词与声码器流程,文本信息利用方式不同 |
适合谁用
- 从事语音合成与语音大模型研究的科研人员
- 需要高效压缩语音数据用于模型训练的算法工程师
- 探索零样本文本转语音技术的开发者
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/HeCheng0625/Diffusion-Speech-Tokenizer