← 开源
mst272

LLM-Dojo

轻量级 LLM Post-training 框架,支持 SFT、RLVR、On-Policy KD、Guide KD 及混合训练;实现单轮/多轮 Guide 蒸馏、多教师蒸馏、Reward 混合训练与自动化数据分流👩‍🎓👨‍🎓

Model DevelopmentFine-tuningPython
在 GitHub 打开
增长势头
+024 小时新增 Star0.0%
939
Star
85
Fork
+0
本周
2
贡献者
创建于 2024-01-23 · 更新于 2026-08-28 · 今日第 12283 名
主要开发者
README

🥋 LLM-Dojo

A lightweight playground for RLHF and SFT experiments, with support for RLVR, KD, and Guide-KD.

轻量级 RLHF/SFT 实验平台,支持 RLVR、KD 与 Guide-KD。

📋 Overview

模块 说明
openrlhf-kd 当前主线,基于 OpenRLHF 重构,实现 RLVR + KD + Guide-KD
main_train.py 简洁 SFT 训练入口

🎯 RLVR

openrlhf-kd 是这个仓库当前最核心的部分,基于 OpenRLHF 构建,具体训练使用可参见文档 openrlhf-kd/examples/README.md

主要改动:

  1. 精简框架,只保留 RLVR 部分,移除了 critic 等不需要的内容
  2. 增加 KD、Guide-KD 与 reward 的混合训练,支持按 datasource 路由

✏️ SFT

根目录的 SFT 部分保持了比较简洁的训练入口,适合快速微调实验。

特性:

  • 支持 Deepspeed
  • 支持 LoRA、QLoRA、全参微调
  • 自动适配 chat template

示例文件可参见 data/sft_data.jsonl

Quick Start:

bash run_example.sh

或:

deepspeed --include localhost:0,1 main_train.py \
  --train_data_path /path/to/data.jsonl \
  --model_name_or_path /path/to/model \
  --task_type sft \
  --train_mode qlora \
  --output_dir /path/to/output