产品推荐 2026-07-27

Diffusion-Speech-Tokenizer:语音语

将语音高效压缩成文本感知的Token,用于大模型语音生成与建模。

开源软件跨平台工具

产品简介

Diffusion-Speech-Tokenizer 基于扩散模型的先进语音分词工具,能以极低码率(0.0875 kbps)将24kHz语音压缩为Token,同时结合文本信息提升重建质量。适用于从事语音大模型、零样本语音合成研究的科研人员与开发者。

Diffusion-Speech-Tokenizer 主界面

核心功能

  • 文本感知的扩散解码器,提升语音重建质量
  • 实现超低帧率(6.25 Hz)与比特率(0.0875 kbps)压缩
  • 支持基于Token的零样本语音合成(包括自回归与扩散模型)
  • 提供在Hugging Face上托管的预训练模型,并支持自动下载
  • 采用端到端的扩散自编码器架构进行优化

快速开始

  1. 通过Hugging Face链接获取预训练模型或使用代码自动下载
  2. 使用Python调用`TaDiCodecPipline`加载Tokenizer模型
  3. 结合AR或MGM TTS模型进行推理,输入文本生成语音

界面预览

Diffusion-Speech-Tokenizer 界面截图

Diffusion-Speech-Tokenizer 界面截图

与其他方案对比

对比项Diffusion-Speech-Tokenizer同类方案
压缩率与质量达到0.0875 kbps极低码率,同时保持高质量(UTMOS)和说话人相似度(SIM)通常码率较高,或在极低码率下质量下降明显
技术架构采用融合文本引导的扩散自编码器,端到端优化传统或独立的分词与声码器流程,文本信息利用方式不同

适合谁用

  • 从事语音合成与语音大模型研究的科研人员
  • 需要高效压缩语音数据用于模型训练的算法工程师
  • 探索零样本文本转语音技术的开发者

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项