产品简介
ocr-based-qwen 这是一款基于通义千问大模型的开源图片文字识别工具。它能通过调用大模型API,精准提取图片中的文字内容,特别擅长数学公式的识别与LaTeX格式输出,并支持验证码识别。支持拖拽、粘贴等多种图片上传方式,并提供API接口,适合有图片文字提取需求的普通用户、学生及开发者。

核心功能
- 图片OCR文字提取
- 数学公式识别(LaTeX格式)
- 验证码识别
- 拖拽/粘贴上传图片
- 提供API(支持base64/URL/文件)
快速开始
- 配置 Cookie:访问 QwenLM 网站获取并填写你的 Cookie,或使用项目提供的测试 Cookie。
- 上传图片:将图片拖拽至指定区域、点击上传或直接从剪贴板粘贴图片。
- 查看与使用结果:识别完成后,结果会显示在页面下方,可一键复制。
界面预览


与其他方案对比
| 对比项 | ocr-based-qwen | 同类方案 |
|---|---|---|
| 核心识别能力 | 基于通义千问大模型,对数学公式识别和LaTeX输出有特别优化,同时支持验证码识别。 | 传统OCR工具通常在复杂公式和验证码识别上精度较低。 |
| 输入方式 | 支持拖拽、粘贴、文件上传、API(base64/URL)等多种方式,灵活度高。 | 多数工具通常仅支持基础的文件上传或截图。 |
| 部署与使用门槛 | 提供 Cloudflare Workers 和 Docker 一键部署方案,私有化部署方便。 | 同类SaaS服务通常需要注册并在线使用,私有部署复杂。 |
适合谁用
- 需要将图片中的文字(特别是含数学公式)转换为可编辑文本的学生和研究人员
- 需要批量或自动化处理验证码的用户
- 希望通过API集成OCR功能到自己项目中的开发者
下载与版本
当前最新版本为 v1.1.0,发布于 2025-02-15。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/Cunninger/ocr-based-qwen