依据 Attention Is All You Need 原始论文,梳理 Transformer 的注意力结构与阅读边界。
学习内容
本文基于 Vaswani 等人在 2017 年发表的论文 Attention Is All You Need,介绍论文提出的 Transformer 架构及其阅读方法。它不是某个具体产品的部署手册,也不把论文中的实验设置外推为所有模型、语言或任务的保证。阅读时应将论文中的结论与其数据集、训练设定和评测指标一并理解。
该论文讨论序列到序列建模中的机器翻译任务,并提出只使用注意力机制的编码器—解码器网络。相较于依赖循环计算的结构,注意力允许序列中不同位置直接建立联系;这为并行训练提供了结构上的条件,但计算成本、显存占用和长序列处理仍需结合具体实现评估。
论文将查询、键和值表示为向量。注意力先计算查询与键的相似度,再经过缩放和归一化得到权重,最后对值进行加权汇总。这个过程的意义是:当前位置可以根据任务学习从哪些位置获取信息。注意力权重并不自动等于人类可解释的因果证据,分析模型时仍应避免把单一权重图当成完整解释。
多头注意力会将表示投影到多个子空间,并行计算多组注意力后再拼接和变换。论文把它用于编码器自注意力、解码器自注意力以及编码器—解码器注意力。每个头可能学习到不同的关联模式,但具体模式依赖训练结果,不能预先假定某一头必然对应语法、事实或某类语义关系。
编码器层由多头自注意力和前馈网络组成;解码器除自注意力和编码器—解码器注意力外,还使用掩码以避免当前位置访问未来目标词。由于注意力层本身没有序列顺序概念,论文向输入加入位置编码。论文给出了正弦与余弦形式,并比较了学习式位置表示;工程实现应以所用框架与模型配置为准。
阅读原文时可依次核对架构图、各层定义、训练细节和实验表格。将 BLEU 等评测结果限定在论文列出的翻译任务和对比条件内,不要把它改写为普适的质量排名。若要复现实验,应记录语料处理、词表、优化器、学习率计划、硬件和随机种子;这些因素都会影响结果。
Transformer 是后续大量模型的基础组件,但不同模型在数据、目标函数、上下文长度、位置编码和安全策略上可能差异很大。把论文概念用于产品选型或风险判断前,应继续查阅该产品的官方技术文档、模型卡和适用条款,并针对自己的数据进行测试。
继续学习
介绍文本如何转换为向量、相似度如何计算,以及向量检索在推荐、搜索和 RAG 中的常见用途。