Hugging Face 官方的大模型对齐训练库,覆盖 SFT、DPO、RLHF 全流程。
Project story
TRL(Transformer Reinforcement Learning)是 Hugging Face 官方的大模型对齐训练库:支持监督微调(SFT)、偏好优化(DPO/KTO/ORPO)与强化学习(PPO/GRPO),用统一 Trainer API 完成从基座模型到对齐模型的训练。
与 Transformers、PEFT 深度集成,训练脚本开箱即用,是开源社区做模型对齐的主流工具。
适合场景:模型偏好对齐、指令微调、RLHF 研究与复现。
上手方式:pip install trl,用 TRLConfig 配置后调用 SFTTrainer/DPOTrainer 训练。