注意力机制让模型在处理序列时按相关性给不同位置分配权重,是 Transformer 架构与大语言模型的核心机制。
AI Glossary
注意力机制(Attention Mechanism)是让模型在处理序列时,动态决定"该重点关注哪些部分"的机制。它给序列中每个位置分配一个权重:相关的信息权重高、无关的信息权重低,从而在长文本中抓住关键内容。
注意力机制是 Transformer 架构的基石,而 Transformer 是当前所有主流大语言模型的基础。它解决了早期模型"记不住长距离依赖"的问题:无论两个词在句子里隔多远,注意力都能直接建立联系,这也是大模型能理解长文、多轮对话与复杂指令的根本原因。
注意力机制是理解大模型原理绕不开的概念:它让模型能"关注该关注的",是 Transformer 架构的核心创新。理解它有助于明白为什么大模型擅长长文与复杂任务,也能解释上下文窗口的成本约束。
用通俗中文解释 AI 技术术语,帮助你看懂工具页面里的模型、协议和工作流。