产品简介
VideoGPT-plus +是一个开源AI视频理解模型,通过双编码器集成增强视频时空细节理解。适用于视频对话、问答等任务,解决现有模型在细节捕捉和全局上下文上的不足,为研究人员和开发者提供强大支持。

核心功能
- 集成图像和视频编码器以增强时空细节
- 自适应池化处理视频片段
- 提供VCG+112K高质量数据集
- 提出VCGBench-Diverse全面评估基准
- 支持预训练和微调脚本
快速开始
- 第一步:使用conda创建Python 3.11环境并激活
- 第二步:克隆仓库并安装依赖包
- 第三步:安装FlashAttention以支持训练功能
界面预览


与其他方案对比
| 对比项 | VideoGPT-plus | 同类方案 |
|---|---|---|
| 基准评估多样性 | 提供VCGBench-Diverse,覆盖18类视频和4354 QA对,更全面评估 | 现有基准如VCG-Bench仅限于ActivityNet数据集,多样性不足 |
适合谁用
- 追求开源、免费、无广告体验的用户
- 重视数据隐私,希望本地化处理的用户
- 需要跨平台一致体验的进阶用户
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/mbzuai-oryx/VideoGPT-plus