产品推荐 2026-07-27

ocr-based-qwen:免费的图片文字识别工具(源码)

基于通义千问大模型的OCR工具,能从图片快速提取文字和数学公式。

开源软件跨平台工具

产品简介

ocr-based-qwen 这是一款基于通义千问大模型的开源图片文字识别工具。它能通过调用大模型API,精准提取图片中的文字内容,特别擅长数学公式的识别与LaTeX格式输出,并支持验证码识别。支持拖拽、粘贴等多种图片上传方式,并提供API接口,适合有图片文字提取需求的普通用户、学生及开发者。

ocr-based-qwen 主界面

核心功能

  • 图片OCR文字提取
  • 数学公式识别(LaTeX格式)
  • 验证码识别
  • 拖拽/粘贴上传图片
  • 提供API(支持base64/URL/文件)

快速开始

  1. 配置 Cookie:访问 QwenLM 网站获取并填写你的 Cookie,或使用项目提供的测试 Cookie。
  2. 上传图片:将图片拖拽至指定区域、点击上传或直接从剪贴板粘贴图片。
  3. 查看与使用结果:识别完成后,结果会显示在页面下方,可一键复制。

界面预览

ocr-based-qwen 界面截图

ocr-based-qwen 界面截图

与其他方案对比

对比项ocr-based-qwen同类方案
核心识别能力基于通义千问大模型,对数学公式识别和LaTeX输出有特别优化,同时支持验证码识别。传统OCR工具通常在复杂公式和验证码识别上精度较低。
输入方式支持拖拽、粘贴、文件上传、API(base64/URL)等多种方式,灵活度高。多数工具通常仅支持基础的文件上传或截图。
部署与使用门槛提供 Cloudflare Workers 和 Docker 一键部署方案,私有化部署方便。同类SaaS服务通常需要注册并在线使用,私有部署复杂。

适合谁用

  • 需要将图片中的文字(特别是含数学公式)转换为可编辑文本的学生和研究人员
  • 需要批量或自动化处理验证码的用户
  • 希望通过API集成OCR功能到自己项目中的开发者

下载与版本

当前最新版本为 v1.1.0,发布于 2025-02-15。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/Cunninger/ocr-based-qwen