产品简介
llm-reader 是一款开源工具,能将网页URL转换为LLM输入友好的文本格式,提升数据提取准确性。解决网页内容直接输入大型语言模型效率低的问题,支持链接、图片和表格提取,适合构建RAG系统、进行网页抓取或数据提取的开发者和数据科学家。
核心功能
- 将网页转换为LLM友好文本
- 支持并发网页抓取(基于Playwright)
- 开源替代Firecrawl和Jina Reader API
- 提取网页链接、图片链接和表格
- 跨平台支持Windows、macOS和Linux
快速开始
- 第一步:使用pip命令安装llm-reader库
- 第二步:安装Playwright依赖并下载浏览器
- 第三步:导入函数,传入网页URL获取LLM友好文本
界面预览
与其他方案对比
| 对比项 | llm-reader | 同类方案 |
|---|---|---|
| 开源性 | 完全开源,免费使用 | Firecrawl和Jina Reader API为付费或部分付费服务 |
适合谁用
- 构建RAG系统的AI工程师
- 进行网页数据抓取的数据科学家
- 提取电商产品信息的运营人员
- 寻找开源网页抓取工具的开发者
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/m92vyas/llm-reader