产品推荐 2026-07-28

JustRL:简单配方高效计算的强化学习框架(源码)

JustRL 是一个简单强化学习配方,用于扩展1.5B语言模型并提升数学推理能力。

开源软件跨平台工具

产品简介

JustRL 是一个开源强化学习框架,专为小语言模型设计。它通过单阶段训练和固定超参数,在数学推理任务上达到先进性能,无需复杂多阶段流程。适合AI研究人员和开发者,希望以高效率提升模型能力。

JustRL 主界面

核心功能

  • 单阶段固定超参数训练
  • 稳定无崩溃的性能提升
  • 1.5B规模最先进结果
  • 计算效率高,节省资源
  • 开源模型和评估脚本

快速开始

  1. 第一步:创建 conda 环境并安装 PyTorch、vLLM 等依赖
  2. 第二步:下载评估输出到仓库目录
  3. 第三步:运行 gen_vllm.py 生成输出(可选)
  4. 第四步:运行 grade.py 评估结果

界面预览

JustRL 界面截图

与其他方案对比

对比项JustRL同类方案
数学推理性能在AIME24、AIME25等多个基准上达到最高平均分54.87如ProRL-V2平均分53.08,性能略低
计算效率使用单阶段训练,计算量比多阶段方法减少50%以上如BroRL需要4.9倍更多计算以提升性能

适合谁用

  • 需要提升小语言模型数学推理能力的AI研究人员
  • 希望使用简单强化学习方法的机器学习开发者
  • 学习自然语言处理和强化学习结合的高校学生

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/thunlp/JustRL