产品简介
FireRed-OCR 是一个专为深度文档解析设计的框架,它能将通用视觉模型训练成文档解析专家,精准识别并转换文档中的文字、公式和表格为结构化Markdown。解决了通用模型处理复杂版面时易出现行序错乱、公式错误等‘结构幻觉’问题,尤其适合需要处理学术论文、技术报告、复杂表格的开发者和研究人员。
核心功能
- 【顶级识别性能】在OmniDocBench v1.5基准测试中达到92.94%的整体得分,领先众多模型。
- 【精准结构解析】采用格式约束强化学习,确保表格、公式等结构严格正确,避免常见错误。
- 【专为复杂文档设计】内置“几何+语义”数据引擎,能有效处理长尾、非标准文档布局。
- 【三阶段渐进式训练】通过预对齐、监督微调和强化学习,逐步提升模型的结构化输出能力。
- 【一体化输出】直接生成标准Markdown格式,保留原始文档的层次结构。
快速开始
- 【安装依赖】在终端运行 pip install transformers qwen-vl-utils。
- 【获取代码】克隆GitHub仓库:git clone https://github.com/FireRedTeam/FireRed-OCR.git。
- 【运行推理】使用提供的Python代码片段,加载模型并处理文档图像,即可获得Markdown输出。
界面预览


与其他方案对比
| 对比项 | FireRed-OCR | 同类方案 |
|---|---|---|
| 整体性能 | 在OmniDocBench v1.5基准上得分92.94%,显著高于传统流程方案及部分通用大模型。 | 传统流程方案如Dolphin-1.5得分83.21%;部分通用VLM得分更低。 |
| 结构准确性 | 通过格式约束强化学习,表格、公式等结构的完整性和正确性表现更优。 | 传统方案或通用模型易产生未闭合表格、无效公式等结构错误。 |
| 复杂版面鲁棒性 | 在FireRedBench等包含复杂非标准布局的测试中,展现出比传统流程系统更强的适应能力。 | 传统流程系统在处理长尾、非标准版面时能力相对有限。 |
适合谁用
- 需要将论文PDF或扫描件转换为可编辑Markdown的学术研究人员。
- 负责数字化大量技术报告或档案的工程师或文员。
- 开发文档解析应用的AI开发者。
- 处理包含复杂表格和公式的金融、法律文档的专业人士。
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/FireRedTeam/FireRed-OCR