产品简介
vid2cleantxt 是基于 OpenAI Whisper 模型的工具,可自动将语音密集的视频文件转录为可读文本。它解决了视频信息冗长、难以快速提取和搜索的问题,适合需要处理视频内容的研究人员、学生和内容创作者。

核心功能
- 集成 OpenAI Whisper 等先进 Transformer 模型进行高精度语音转录
- 支持 Python API 和命令行工具,灵活集成到工作流
- 自动将视频转为音频并分段处理,提高效率
- 内置拼写检查和句子边界检测,输出更清晰文本
- 提取关键词并导出为 Excel 文件,便于分析
快速开始
- 安装 Python 环境并运行 `pip install git+https://github.com/pszemraj/vid2cleantxt.git` 命令安装工具
- 在命令行中执行 `python vid2cleantxt/transcribe.py --input-dir "视频目录" --output-dir "输出目录"` 进行转录
- 或导入 Python 包,使用 `vid2cleantxt.transcribe.transcribe_dir()` 函数处理视频
界面预览


与其他方案对比
| 对比项 | 本工具 | 同类商业软件 | 在线服务 |
|---|---|---|---|
| 费用 | 开源免费 | 通常收费或含广告 | 可能有订阅或上传限制 |
| 隐私 | 本地运行,数据自持 | 依赖厂商政策 | 需上传数据到服务器 |
| 可定制性 | 源码开放,社区活跃 | 受限于官方功能 | 功能固定 |
适合谁用
- 研究人员:分析学术讲座或会议视频的文本内容
- 学生:总结课程视频或演讲笔记
- 内容创作者:将视频内容转为文字用于文章或字幕制作
下载与版本
当前最新版本为 v0.2.5,发布于 2022-10-12。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/pszemraj/vid2cleantxt