产品推荐 2026-07-28

video-SALMONN-2:视听视频字幕生成工具(源码)

一个能生成高质量视听视频字幕的大语言模型工具。

开源软件跨平台工具

产品简介

video-SALMONN-2 2 是由清华大学和字节跳动开发的视听大语言模型,能自动生成高质量的视频字幕,适用于需要处理视频内容的研究人员和开发者,解决视频理解难题。

video-SALMONN-2 主界面

核心功能

  • 生成高质量视听视频字幕
  • 支持多个模型规模(3B、7B、72B)
  • 在多个视听和视觉基准测试上表现优异(SOTA)
  • 开源代码和模型,支持自定义训练
  • 跨平台支持(Windows、macOS、Linux)

快速开始

  1. 第一步:准备数据集,参考示例文件如 `scripts/example_sft.json`。
  2. 第二步:下载预训练模型,如从 Hugging Face 获取 LLaVA-OneVision。
  3. 第三步:修改训练参数脚本,如 `scripts/train_sft.sh`。
  4. 第四步:运行训练命令,如 `bash scripts/train_sft.sh`。
  5. 第五步:评估模型,修改 `scripts/eval.sh` 并运行。

界面预览

与其他方案对比

对比项video-SALMONN-2同类方案
性能表现在 Video-MME、WorldSense 等多个基准测试上达到 SOTA 结果其他开源模型在类似规模下表现较弱
模型规模提供从3B到72B的多种模型选择,支持灵活扩展同类工具通常只提供单一或有限模型规模

适合谁用

  • 需要视频字幕生成和理解的研究人员
  • 开发视听AI应用的软件开发者
  • 需要自动化视频描述的内容创作者或教育工作者

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项