AI对齐指让 AI 的目标与行为符合人类意图与价值观:通过 RLHF、宪法式AI等方法,让模型更安全、更可控、更符合预期。
AI Glossary
AI对齐(Alignment)指让 AI 系统的目标与行为符合人类意图与价值观:模型不仅要"会回答",还要"回答得对、回答得安全、不违背人的期望"。
这类似于教育孩子:能力之外,还要教会什么该做、什么不该做、什么情况下要谨慎。
内容安全是"过滤+拦截"(不让有害内容出现),对齐是"价值观内化"(模型本身不愿生成有害内容)——两者共同构成 AI 负责任运营的保障。
AI对齐是让"越来越强"的模型同时"越来越可靠"的关键工程——它不是限制 AI,而是让 AI 成为值得托付的伙伴。
用通俗中文解释 AI 技术术语,帮助你看懂工具页面里的模型、协议和工作流。