产品简介
open-rs 这是一个开源研究项目,专注于探索如何通过强化学习(RL)有效提升小规模语言模型的数学与逻辑推理能力。它解决了训练强大推理模型成本高昂的痛点,适合资源有限但仍希望获得顶尖推理能力的研究者和开发者。

核心功能
- 基于GRPO算法的强化学习训练框架
- 针对1.5B参数的小模型进行优化
- 使用精简的数学推理数据集进行高效训练
- 训练成本极低(约42美元)
- 完全开源代码、模型与数据集
快速开始
- 使用curl安装`uv`并配置Python 3.11虚拟环境。
- 安装`vLLM`、`FlashAttention`及项目依赖。
- 登录Hugging Face和Weights & Biases账户。
- 使用提供的YAML配置文件,通过accelerate启动训练或评估脚本。
界面预览


与其他方案对比
| 对比项 | open-rs | 同类方案 |
|---|---|---|
| 训练成本 | 仅需约42美元(4块A40 GPU,24小时) | 同等效果的7B模型训练成本在1000至2000美元以上 |
| 模型规模 | 专注于1.5B参数小模型,资源友好 | 通常需要7B或更大参数的模型才能获得强推理能力 |
适合谁用
- 资源受限环境下希望提升小模型推理能力的AI研究者
- 想以低成本方案获得强大数学推理能力的开发者
- 关注高效、开源AI训练方法的机器学习工程师
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/knoveleng/open-rs