产品推荐 2026-07-27

prophet:免费的视觉问答辅助工具(源码)

Prophet是一个视觉问答框架,通过提示GPT-3提升基于知识问答的准确性。

开源软件跨平台工具

产品简介

prophet Prophet是一个开源的两阶段框架,用于基于知识的视觉问答。它通过训练视觉模型提取答案启发式,再用这些启发式提示GPT-3,显著提升问答准确率。适用于研究人员和开发者进行图像理解任务。

核心功能

  • 两阶段框架设计:先训练视觉模型,再提示GPT-3
  • 支持OK-VQA和A-OKVQA数据集
  • 提供预训练和微调模型下载
  • 自动化脚本简化部署流程
  • 在基准测试中性能超越现有方法

快速开始

  1. 安装Conda并创建环境:conda env create -f environment.yml
  2. 下载数据集和资源文件到datasets和assets文件夹
  3. 运行脚本提取图像特征:bash scripts/extract_img_feats.sh
  4. 执行预训练:bash scripts/pretrain.sh --task ok --version v1
  5. 生成答案启发式并用于提示GPT-3

界面预览

与其他方案对比

对比项prophet同类方案
性能表现在OK-VQA和A-OKVQA上准确率达61.1%和55.7%,超越现有state-of-the-art方法现有方法准确率较低

适合谁用

  • 从事视觉问答研究的学者和研究人员
  • 开发图像理解应用的AI工程师
  • 需要提升视觉模型准确性的数据科学家

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/MILVLG/prophet