产品简介
SmolDocling-OCR-App 这是一个基于SmolDocling模型的OCR工具,能从文档图像中高精度提取文本,支持表格、代码、公式等多种文档类型,并提供DocTags和Markdown结构化输出。适合需要处理扫描文档或提取结构化数据的用户。
核心功能
- 支持单图或多图批量处理
- 支持表格、代码、公式、图表、节标题等文档类型提取
- 提供DocTags和Markdown结构化输出
- 结果可下载保存
快速开始
- 克隆仓库并安装Python依赖
- 创建.env文件并设置Hugging Face API token
- 运行streamlit run main.py启动应用
- 上传文档图像,选择任务类型,处理后下载结果
界面预览
与其他方案对比
| 对比项 | SmolDocling-OCR-App | 同类方案 |
|---|---|---|
| 支持文档类型 | 支持表格、代码、公式、图表、节标题等多种文档类型提取 | 同类工具通常仅支持通用文本识别 |
| 输出格式 | 提供DocTags和Markdown结构化输出,便于后续处理 | 多数工具只输出纯文本,缺乏结构化信息 |
适合谁用
- 追求开源、免费、无广告体验的用户
- 重视数据隐私,希望本地化处理的用户
- 需要跨平台一致体验的进阶用户
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/AIAnytime/SmolDocling-OCR-App