产品推荐 2026-07-27

ComfyUI-Qwen3-ASR:语音识别工具(源码)

ComfyUI 语音识别节点,支持多语言音频转文本。

开源软件跨平台工具

产品简介

ComfyUI-Qwen3-ASR 基于 Qwen3-ASR 的 ComfyUI 自定义节点,实现音频到文本的自动转录,支持 52 种语言及方言,包括多种中国方言。适合需要处理多语言音频内容的用户,如会议记录、字幕生成等场景。

ComfyUI-Qwen3-ASR 主界面

核心功能

  • 支持52种语言和方言
  • 提供两种模型大小选择
  • 自动语言检测无需手动指定
  • 支持批量音频文件转录
  • 模型首次使用自动下载

快速开始

  1. 在 ComfyUI Manager 中搜索 'Qwen3-ASR' 并安装
  2. 添加 Qwen3-ASR Loader 节点选择模型大小
  3. 连接音频输入到 Qwen3-ASR Transcribe 节点转录文本

界面预览

与其他方案对比

对比项ComfyUI-Qwen3-ASR同类方案
语言支持支持52种语言和22种中国方言多数工具仅支持主流语言
运行方式本地运行无需联网云服务需要联网和可能收费
批量处理内置批量转录节点可能需要手动处理单个文件

适合谁用

  • 需要转录多语言会议记录的国际团队
  • 处理方言音频的研究人员
  • 为视频生成多语言字幕的内容创作者

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项