产品简介
ComfyUI-Qwen3-ASR 基于 Qwen3-ASR 的 ComfyUI 自定义节点,实现音频到文本的自动转录,支持 52 种语言及方言,包括多种中国方言。适合需要处理多语言音频内容的用户,如会议记录、字幕生成等场景。

核心功能
- 支持52种语言和方言
- 提供两种模型大小选择
- 自动语言检测无需手动指定
- 支持批量音频文件转录
- 模型首次使用自动下载
快速开始
- 在 ComfyUI Manager 中搜索 'Qwen3-ASR' 并安装
- 添加 Qwen3-ASR Loader 节点选择模型大小
- 连接音频输入到 Qwen3-ASR Transcribe 节点转录文本
界面预览
与其他方案对比
| 对比项 | ComfyUI-Qwen3-ASR | 同类方案 |
|---|---|---|
| 语言支持 | 支持52种语言和22种中国方言 | 多数工具仅支持主流语言 |
| 运行方式 | 本地运行无需联网 | 云服务需要联网和可能收费 |
| 批量处理 | 内置批量转录节点 | 可能需要手动处理单个文件 |
适合谁用
- 需要转录多语言会议记录的国际团队
- 处理方言音频的研究人员
- 为视频生成多语言字幕的内容创作者
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/DarioFT/ComfyUI-Qwen3-ASR