强化学习(RL)是机器学习的重要范式:智能体通过与环境的试错交互,根据奖励信号学习最优策略,广泛应用于游戏博弈、机器人控制与RLHF对齐等场景。
AI Glossary
强化学习(Reinforcement Learning,RL)是机器学习的重要范式:智能体通过与环境的试错交互,根据奖励信号学习最优策略。它不像监督学习那样给答案,而是让智能体自己探索——做对了得奖励,做错了受惩罚,最终学会最优行为。
RLHF(基于人类反馈的强化学习)就是把强化学习用于大模型:以人类偏好为奖励信号,优化模型的回答策略。理解 RL 就能理解现代大模型「怎么学会好好说话」。
强化学习让 AI 从试错中学会决策:探索、奖励、优化策略。它是游戏、机器人与大模型对齐的核心技术,理解 RL 是理解 AI 前沿的关键。