产品推荐 2026-07-27

DatasetLoom:免费的多模态数据集构建平台(源码)

面向多模态大模型训练的智能数据集构建与评估平台。

开源软件跨平台工具

产品简介

DatasetLoom 是一款专为多模态大模型训练打造的数据集构建平台。它能将 PDF、Word 等文档和图像,通过解析、分块、标注与 AI 生成,快速转变为可用于监督微调(SFT)和偏好对齐(DPO)的高质量训练数据,尤其擅长利用 RAG 技术生成基于真实知识的对话数据集,适合 AI 工程师和研究团队使用。

DatasetLoom 主界面

核心功能

  • 支持 PDF、Word 等多格式文档解析与智能分块
  • 集成图像标注、图文问答与图像描述一键生成
  • 内置 AI 自动评分系统,支持多模型输出质量对比
  • 可构建 DPO 偏好数据集和 SFT 指令微调语料
  • 通过 RAG 技术结合向量数据库,生成基于文档的专业对话数据

快速开始

  1. 克隆项目仓库:`git clone https://github.com/599yongyang/DatasetLoom.git`
  2. 复制并修改环境变量文件:`cp .env.example .env`
  3. 使用 pnpm 安装项目依赖:`pnpm install`
  4. 初始化数据库:`pnpm --filter=api prisma:migrate`
  5. 启动开发服务:`pnpm run dev`,前端默认访问 `http://localhost:2088`

界面预览

DatasetLoom 界面截图

DatasetLoom 界面截图

与其他方案对比

对比项DatasetLoom同类方案
核心功能提供从文档解析、分块、AI 标注到评分、导出的全自动化流水线,并集成 RAG 增强数据生成。传统标注工具通常聚焦于手动标注单一数据类型,缺乏文档解析、AI 生成及 RAG 能力。
技术架构采用 Next.js + NestJS + Turborepo 的现代化 Monorepo 架构,前后端解耦,易于扩展和维护。多数同类工具可能采用单体架构或较旧的技术栈,扩展性和开发体验较弱。
输出目标输出通常为原始标注数据,需要用户自行进行复杂的格式转换和筛选才能用于训练。直接生成可用于模型训练的 SFT/DPO 格式数据集,并支持多种格式导出。

适合谁用

  • 需要为多模态大模型构建高质量训练数据的 AI 工程师与研究人员
  • 希望将论文、教材等文档转化为问答练习题的教育科研工作者
  • 需要构建医疗、法律、金融等垂直领域结构化知识库的团队

下载与版本

当前最新版本为 v0.1.4,发布于 2025-08-20。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/599yongyang/DatasetLoom