产品简介
video-SALMONN-2 2 是由清华大学和字节跳动开发的视听大语言模型,能自动生成高质量的视频字幕,适用于需要处理视频内容的研究人员和开发者,解决视频理解难题。

核心功能
- 生成高质量视听视频字幕
- 支持多个模型规模(3B、7B、72B)
- 在多个视听和视觉基准测试上表现优异(SOTA)
- 开源代码和模型,支持自定义训练
- 跨平台支持(Windows、macOS、Linux)
快速开始
- 第一步:准备数据集,参考示例文件如 `scripts/example_sft.json`。
- 第二步:下载预训练模型,如从 Hugging Face 获取 LLaVA-OneVision。
- 第三步:修改训练参数脚本,如 `scripts/train_sft.sh`。
- 第四步:运行训练命令,如 `bash scripts/train_sft.sh`。
- 第五步:评估模型,修改 `scripts/eval.sh` 并运行。
界面预览
与其他方案对比
| 对比项 | video-SALMONN-2 | 同类方案 |
|---|---|---|
| 性能表现 | 在 Video-MME、WorldSense 等多个基准测试上达到 SOTA 结果 | 其他开源模型在类似规模下表现较弱 |
| 模型规模 | 提供从3B到72B的多种模型选择,支持灵活扩展 | 同类工具通常只提供单一或有限模型规模 |
适合谁用
- 需要视频字幕生成和理解的研究人员
- 开发视听AI应用的软件开发者
- 需要自动化视频描述的内容创作者或教育工作者
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/bytedance/video-SALMONN-2