产品简介
LDA-1B 是一个面向机器人学习的基础模型,通过联合学习动态、策略和视觉预测,利用不同质量数据提升泛化能力,适用于机器人研究人员和 AI 开发者。

核心功能
- 统一多任务学习:单模型同时预测未来视觉特征和动作块
- 数据质量分层:高质量数据用于策略学习,低质量数据用于动态学习
- 潜在动态建模:预测潜在视觉特征而非像素,提高泛化性
- 跨具身预训练:支持多种机器人具身,如人形机器人等
- 大规模模型:1B参数,增强表达能力
快速开始
- 克隆仓库:执行 git clone https://github.com/jiangranlv/latent-dynamics-action.git LDA
- 设置环境:创建 conda 环境并安装依赖(pip install -r requirements.txt)
- 下载模型:从 Hugging Face 下载 Qwen3-VL-4B 和 DINO-ViT-S 预训练权重
界面预览

与其他方案对比
| 对比项 | 本工具 | 同类商业软件 | 在线服务 |
|---|---|---|---|
| 费用 | 开源免费 | 通常收费或含广告 | 可能有订阅或上传限制 |
| 隐私 | 本地运行,数据自持 | 依赖厂商政策 | 需上传数据到服务器 |
| 可定制性 | 源码开放,社区活跃 | 受限于官方功能 | 功能固定 |
适合谁用
- 机器人研究人员:开发和评估机器人学习算法
- AI 应用开发者:构建智能机器人系统
- 机器人教育工作者:用于教学和实验
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/jiangranlv/LDA-1B