RLHF(基于人类反馈的强化学习)是让大模型输出符合人类偏好与价值观的关键对齐技术,通过人类对模型回答的排序反馈训练奖励模型,再用强化学习优化策略模型,让模型「更会说话、更守规矩」。
AI Glossary
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是让大模型输出符合人类偏好与价值观的关键对齐技术。它解决「模型什么都会但不会好好说」的问题——回答质量、语气、安全合规,都通过人类反馈来校准。
RLHF 用人类反馈校准大模型:先学偏好、再教模型。它是现代大模型对齐的核心技术之一,理解它就能理解「模型为什么会这么说话」。