产品简介
DatasetLoom 是一款专为多模态大模型训练打造的数据集构建平台。它能将 PDF、Word 等文档和图像,通过解析、分块、标注与 AI 生成,快速转变为可用于监督微调(SFT)和偏好对齐(DPO)的高质量训练数据,尤其擅长利用 RAG 技术生成基于真实知识的对话数据集,适合 AI 工程师和研究团队使用。

核心功能
- 支持 PDF、Word 等多格式文档解析与智能分块
- 集成图像标注、图文问答与图像描述一键生成
- 内置 AI 自动评分系统,支持多模型输出质量对比
- 可构建 DPO 偏好数据集和 SFT 指令微调语料
- 通过 RAG 技术结合向量数据库,生成基于文档的专业对话数据
快速开始
- 克隆项目仓库:`git clone https://github.com/599yongyang/DatasetLoom.git`
- 复制并修改环境变量文件:`cp .env.example .env`
- 使用 pnpm 安装项目依赖:`pnpm install`
- 初始化数据库:`pnpm --filter=api prisma:migrate`
- 启动开发服务:`pnpm run dev`,前端默认访问 `http://localhost:2088`
界面预览


与其他方案对比
| 对比项 | DatasetLoom | 同类方案 |
|---|---|---|
| 核心功能 | 提供从文档解析、分块、AI 标注到评分、导出的全自动化流水线,并集成 RAG 增强数据生成。 | 传统标注工具通常聚焦于手动标注单一数据类型,缺乏文档解析、AI 生成及 RAG 能力。 |
| 技术架构 | 采用 Next.js + NestJS + Turborepo 的现代化 Monorepo 架构,前后端解耦,易于扩展和维护。 | 多数同类工具可能采用单体架构或较旧的技术栈,扩展性和开发体验较弱。 |
| 输出目标 | 输出通常为原始标注数据,需要用户自行进行复杂的格式转换和筛选才能用于训练。 | 直接生成可用于模型训练的 SFT/DPO 格式数据集,并支持多种格式导出。 |
适合谁用
- 需要为多模态大模型构建高质量训练数据的 AI 工程师与研究人员
- 希望将论文、教材等文档转化为问答练习题的教育科研工作者
- 需要构建医疗、法律、金融等垂直领域结构化知识库的团队
下载与版本
当前最新版本为 v0.1.4,发布于 2025-08-20。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/599yongyang/DatasetLoom