产品简介
ollama-ocr Ollama OCR 是一个使用 Ollama 平台先进视觉语言模型的强大 OCR 包,可从图像中高效提取文本。解决传统 OCR 准确率低或格式支持有限的问题,支持多模型和输出格式,适合需要处理图像文本的研究人员、开发者和内容创作者。

核心功能
- 基于 Ollama 视觉语言模型进行 OCR
- 支持多种模型如 LLaVA、Llama 3.2 Vision 和 MiniCPM-V 2.6
- 输出格式包括 Markdown、纯文本和 JSON
- 提供 Docker 支持便于部署
- 跨平台运行,兼容 Windows、macOS、Linux
快速开始
- 安装 Ollama 平台
- 拉取所需模型,如 ollama pull llama3.2-vision:11b
- 克隆仓库并安装依赖:git clone 仓库后运行 yarn 或 npm i
- 运行开发服务器:yarn dev 或 npm run dev
界面预览


与其他方案对比
| 对比项 | ollama-ocr | 同类方案 |
|---|---|---|
| 技术基础 | 使用 Ollama 的先进视觉语言模型,识别更准确 | 传统 OCR 可能依赖较旧技术或规则模型 |
| 输出灵活性 | 支持 Markdown、纯文本、JSON 等多种格式 | 多数 OCR 工具仅输出纯文本 |
| 部署方式 | 支持本地运行和 Docker 部署,保护隐私 | 可能主要依赖云端服务,有数据外传风险 |
适合谁用
- 需要从图像提取文本的研究人员
- 开发 OCR 相关应用的程序员
- 处理扫描文档或图片文字的内容创作者
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/dwqs/ollama-ocr