产品推荐 2026-07-28

ollama-ocr:免费的OCR 文字识别工具(源码)

基于 Ollama 的 OCR 工具,利用视觉语言模型从图像识别提取文字。

开源软件跨平台工具

产品简介

ollama-ocr Ollama OCR 是一个使用 Ollama 平台先进视觉语言模型的强大 OCR 包,可从图像中高效提取文本。解决传统 OCR 准确率低或格式支持有限的问题,支持多模型和输出格式,适合需要处理图像文本的研究人员、开发者和内容创作者。

ollama-ocr 主界面

核心功能

  • 基于 Ollama 视觉语言模型进行 OCR
  • 支持多种模型如 LLaVA、Llama 3.2 Vision 和 MiniCPM-V 2.6
  • 输出格式包括 Markdown、纯文本和 JSON
  • 提供 Docker 支持便于部署
  • 跨平台运行,兼容 Windows、macOS、Linux

快速开始

  1. 安装 Ollama 平台
  2. 拉取所需模型,如 ollama pull llama3.2-vision:11b
  3. 克隆仓库并安装依赖:git clone 仓库后运行 yarn 或 npm i
  4. 运行开发服务器:yarn dev 或 npm run dev

界面预览

ollama-ocr 界面截图

ollama-ocr 界面截图

与其他方案对比

对比项ollama-ocr同类方案
技术基础使用 Ollama 的先进视觉语言模型,识别更准确传统 OCR 可能依赖较旧技术或规则模型
输出灵活性支持 Markdown、纯文本、JSON 等多种格式多数 OCR 工具仅输出纯文本
部署方式支持本地运行和 Docker 部署,保护隐私可能主要依赖云端服务,有数据外传风险

适合谁用

  • 需要从图像提取文本的研究人员
  • 开发 OCR 相关应用的程序员
  • 处理扫描文档或图片文字的内容创作者

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/dwqs/ollama-ocr