产品推荐 2026-07-27

PAM:高效架构多平台的视觉感知分割工具(源码)

一个能对图像和视频中的物体进行全面分割与语义理解的AI模型。

开源软件跨平台工具

产品简介

PAM 是一个高效的视觉理解框架,能同时完成图像和视频中任意物体的分割、类别识别、定义解释和详细描述。它解决了需要多个模型才能完成视觉分析与理解的痛点,适合计算机视觉研究者和AI应用开发者使用。

PAM 主界面

核心功能

  • 扩展SAM 2,实现图像与视频中任意物体的精确分割
  • 集成大型语言模型,生成包括类别、定义、解释和描述在内的多种语义输出
  • 支持图像、视频及流式视频处理
  • 提供高质量、经过优化的图像与视频区域语义标注数据集
  • 提供1.5B和3B两种参数规模的开源模型

快速开始

  1. 克隆本仓库代码并进入目录:`git clone https://github.com/Afeng-x/PAM.git && cd PAM`
  2. 配置Python环境并安装基础与训练依赖包
  3. 安装Flash-Attention加速库
  4. 下载SAM2.1-h-large模型权重文件

界面预览

PAM 界面截图

PAM 界面截图

与其他方案对比

对比项PAM同类方案
核心能力一体化框架,同时实现物体分割与丰富的语义理解(类别、解释、描述)通常将分割(如SAM)与语义理解(如LLaVA)作为独立模块,需要串联使用

适合谁用

  • 需要对图像/视频中的物体进行精细分割与语义理解的计算机视觉研究人员
  • 正在开发需要集成强大视觉感知能力的AI应用工程师
  • 需要处理并理解复杂视觉内容的数据科学家

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/Perceive-Anything/PAM