产品简介
warc-gpt WARC-GPT 是一个开源实验性工具,利用检索增强生成(RAG)技术,让用户能从WARC格式的网络存档中提取文本、生成嵌入,并通过AI回答问题。适合研究人员、图书馆员和数据分析师探索历史网络内容,解决手动分析存档数据的效率痛点。
核心功能
- 支持WARC文件的检索增强生成管道
- 高度可定制,兼容多种LLM、提供商和嵌入模型
- 提供REST API接口
- 具备Web用户界面
- 支持嵌入向量可视化
快速开始
- 安装 Python 3.11+ 和 Poetry,克隆仓库并运行安装命令。
- 复制 .env.example 到 .env,配置AI模型如 OpenAI 或 Ollama。
- 将WARC文件放入 ./warc 目录,运行 flask ingest 命令导入数据。
- 运行 flask run 启动服务器,访问 localhost:5000 使用Web界面。
界面预览
与其他方案对比
| 对比项 | warc-gpt | 同类方案 |
|---|---|---|
| 数据处理专注度 | 专门针对WARC网络存档格式优化 | 通用文档处理工具,不支持WARC特定功能 |
| 部署灵活性 | 支持本地AI推理(如Ollama)和云API | 通常依赖云服务,无本地推理选项 |
| 定制化程度 | 高度可定制,可切换多种LLM和嵌入模型 | 模型固定,定制选项有限 |
适合谁用
- 网络档案研究人员:探索和分析WARC格式的历史网络数据
- 图书馆数字化人员:利用AI辅助存档管理和检索
- AI开发者:实验和集成检索增强生成管道
下载与版本
当前最新版本为 v0.2.2,发布于 2025-02-11。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/harvard-lil/warc-gpt