产品简介
audio-transcription TranscriboZH 是一个免费的音视频转录工具,使用 Whisper v3 模型实现高精度转录,支持多语言包括瑞士德语,转录速度可达实时15倍。它适合需要处理机密音视频文件的专业人士,如司法机构或研究人员,提供说话人分离、批量处理和集成编辑器功能。
核心功能
- 使用 Whisper v3 large 模型确保高精度转录
- 完全免费无许可证或使用费用
- 转录速度高达实时15倍
- 自动说话人分离和识别
- 支持导出为文本、SRT 及同步查看器
快速开始
- 安装 NVIDIA 驱动和 CUDA 环境
- 安装 ffmpeg 和 conda 并创建 Python 环境
- 克隆仓库并安装依赖包
- 配置 Huggingface 令牌
- 运行 worker 和 frontend 脚本
界面预览
与其他方案对比
| 对比项 | audio-transcription | 同类方案 |
|---|---|---|
| 价格 | 完全免费,无许可证或使用费用 | 许多商业工具需要订阅或按使用付费 |
| 转录速度 | 基于GPU加速,高达实时15倍 | 在线服务可能受网络限制,速度较慢 |
| 语言支持 | 支持多语言,包括瑞士德语等小语种 | 可能仅支持主流语言 |
适合谁用
- 需要转录机密音视频文件的司法或行政人员
- 处理多语言会议录音的研究人员
- 视频内容创作者需要生成字幕
- 企业内部会议记录整理人员
下载与版本
当前最新版本为 master,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/machinelearningZH/audio-transcription