产品简介
sciencebeam-parser ScienceBeam Parser 能自动解析科学 PDF 文档,转换为 XML 格式,方便数据提取和分析。适用于科研人员、数据科学家等需要处理学术文档的用户,解决手动提取数据效率低的问题。
核心功能
- 支持 PDF 到 XML 的自动转换
- 提供多种 API 端点处理全文、标题、参考文献等
- 兼容 GROBID REST API 便于集成
- 输出格式包括 TEI XML、JATS XML 和 JSON
- 通过 Docker 容器支持跨平台部署(Windows、macOS、Linux)
快速开始
- 第一步:安装 Docker 并拉取 ScienceBeam Parser 容器镜像。
- 第二步:启动服务器,例如运行命令 'make dev-start'。
- 第三步:使用 HTTP 客户端提交 PDF 文档到 API 端点,如 curl 命令发送到 http://localhost:8080/api/processFulltextDocument。
界面预览
与其他方案对比
| 对比项 | sciencebeam-parser | 同类方案 |
|---|---|---|
| 平台支持 | 通过 Docker 支持 Windows、macOS、Linux 全平台 | 许多同类工具仅支持 Linux 或需要复杂环境配置 |
| 输出格式 | 支持 TEI XML、JATS XML、JSON 等多种输出格式 | 通常只支持单一输出格式如 XML 或纯文本 |
适合谁用
- 科研人员:需要从学术论文 PDF 中提取标题、作者和参考文献用于分析
- 数据科学家:处理大量科学文档,自动化数据提取以支持研究
- 开发者:集成 PDF 解析功能到数据处理流程中
下载与版本
当前最新版本为 v0.1.18,发布于 2026-04-16。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/eLifePathways/sciencebeam-parser