产品简介
whisper_dictation Whisper Dictation是一款开源本地AI软件,通过语音控制电脑、输入文本、进行AI聊天和生成图像,所有数据本地处理保护隐私,适合需要离线语音交互和AI功能的用户。
核心功能
- 语音键盘输入
- AI聊天和翻译
- 图像生成(通过Stable Diffusion)
- 语音控制网络摄像头和应用程序
- 本地处理保护隐私
快速开始
- 克隆仓库并安装依赖:git clone -b main https://github.com/themanyone/whisper_dictation.git && cd whisper_dictation && pip install -r requirements.txt。
- 安装并启动whisper-server:使用whisper.cpp编译后运行whisper-server -l en -m ggml-tiny.en.bin --port 7777。
- 运行客户端脚本:./whisper_cpp_client.py启动语音控制界面。
- 调整麦克风音量至约33%以优化语音识别。
界面预览
与其他方案对比
| 对比项 | whisper_dictation | 同类方案 |
|---|---|---|
| 隐私保护 | 所有处理在本地完成,数据不上传 | 云端语音助手如Siri可能上传用户数据 |
| 功能集成 | 集成语音输入、AI聊天、图像生成等多功能 | 通常只提供单一语音或AI功能 |
| 硬件要求 | 需要至少4 GiB VRAM,适合有GPU的用户 | 部分工具对硬件要求较低但功能受限 |
适合谁用
- 需要离线语音输入文档的办公人员
- 希望本地控制电脑避免数据上传的隐私敏感用户
- AI爱好者进行图像生成和聊天实验
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/themanyone/whisper_dictation