产品简介
PAM 是一个高效的视觉理解框架,能同时完成图像和视频中任意物体的分割、类别识别、定义解释和详细描述。它解决了需要多个模型才能完成视觉分析与理解的痛点,适合计算机视觉研究者和AI应用开发者使用。

核心功能
- 扩展SAM 2,实现图像与视频中任意物体的精确分割
- 集成大型语言模型,生成包括类别、定义、解释和描述在内的多种语义输出
- 支持图像、视频及流式视频处理
- 提供高质量、经过优化的图像与视频区域语义标注数据集
- 提供1.5B和3B两种参数规模的开源模型
快速开始
- 克隆本仓库代码并进入目录:`git clone https://github.com/Afeng-x/PAM.git && cd PAM`
- 配置Python环境并安装基础与训练依赖包
- 安装Flash-Attention加速库
- 下载SAM2.1-h-large模型权重文件
界面预览


与其他方案对比
| 对比项 | PAM | 同类方案 |
|---|---|---|
| 核心能力 | 一体化框架,同时实现物体分割与丰富的语义理解(类别、解释、描述) | 通常将分割(如SAM)与语义理解(如LLaVA)作为独立模块,需要串联使用 |
适合谁用
- 需要对图像/视频中的物体进行精细分割与语义理解的计算机视觉研究人员
- 正在开发需要集成强大视觉感知能力的AI应用工程师
- 需要处理并理解复杂视觉内容的数据科学家
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/Perceive-Anything/PAM