Transformer是基于注意力机制、可并行处理序列的深度学习架构,是大语言模型与当前主流 AI 技术的基石。
AI Glossary
Transformer 是一种基于注意力机制(Attention)的深度学习架构:它不按顺序逐词处理文本,而是并行处理整个序列,并让序列中任意两个位置直接建立关联。2017 年由 Google 提出后,它取代了 RNN/LSTM 成为自然语言处理的主流架构,也是所有大语言模型的基础。
Transformer 的两个突破解决了旧架构的瓶颈:一是并行计算大幅提速(不再逐词串行);二是注意力机制让长距离依赖不再衰减(任意两词直接相关)。这两点共同催生了大规模预训练,进而有了 GPT、BERT 与今天的百模大战——几乎所有主流大模型(ChatGPT、Gemini、Claude、DeepSeek 等)都是 Transformer 架构。
Transformer 是理解现代 AI 绕不开的基石概念:注意力机制 + 并行处理重构了深度学习。理解它能帮你明白大模型为什么强、为什么贵、为什么有上下文窗口限制。