产品简介
prophet Prophet是一个开源的两阶段框架,用于基于知识的视觉问答。它通过训练视觉模型提取答案启发式,再用这些启发式提示GPT-3,显著提升问答准确率。适用于研究人员和开发者进行图像理解任务。
核心功能
- 两阶段框架设计:先训练视觉模型,再提示GPT-3
- 支持OK-VQA和A-OKVQA数据集
- 提供预训练和微调模型下载
- 自动化脚本简化部署流程
- 在基准测试中性能超越现有方法
快速开始
- 安装Conda并创建环境:conda env create -f environment.yml
- 下载数据集和资源文件到datasets和assets文件夹
- 运行脚本提取图像特征:bash scripts/extract_img_feats.sh
- 执行预训练:bash scripts/pretrain.sh --task ok --version v1
- 生成答案启发式并用于提示GPT-3
界面预览
与其他方案对比
| 对比项 | prophet | 同类方案 |
|---|---|---|
| 性能表现 | 在OK-VQA和A-OKVQA上准确率达61.1%和55.7%,超越现有state-of-the-art方法 | 现有方法准确率较低 |
适合谁用
- 从事视觉问答研究的学者和研究人员
- 开发图像理解应用的AI工程师
- 需要提升视觉模型准确性的数据科学家
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/MILVLG/prophet