循环神经网络(RNN)是擅长处理序列数据的神经网络:通过循环结构保留历史信息,广泛用于文本、语音、时间序列任务,是 LSTM、GRU 等模型与语言模型发展的重要基础。
AI Glossary
循环神经网络(Recurrent Neural Network,RNN)是专门处理序列数据的神经网络结构:文本、语音、时间序列这类"有先后顺序"的数据。与普通网络一次处理一个独立输入不同,RNN 的核心是"记忆"——它在处理序列的每一步都保留一个隐藏状态,把"之前看过的内容"带进当前步的计算,从而让模型理解上下文。
RNN 按时间展开理解:处理序列第 t 步时,输入 = 当前数据 + 上一步的隐藏状态;输出 = 基于两者计算,并生成新的隐藏状态传给下一步。这样"今天的信息"和"昨天的记忆"被一起编码,模型能感知先后关系——比如读完"我"字时还记得前面的"今天",才能正确理解整句话。
基础 RNN 有个短板:序列太长时早期信息会"遗忘"(梯度消失/爆炸),记不住长距离依赖。为此研究者设计了改进结构:LSTM(长短期记忆)用"门控"机制(输入门、遗忘门、输出门)决定哪些信息该记住、哪些该丢弃,能稳定处理长序列;GRU 是 LSTM 的简化版,参数更少、训练更快,效果接近。它们是语言模型时代的核心序列架构。
2017 年 Transformer 用"注意力机制"直接建模序列全局关系,在并行效率与长文本处理上超越 RNN,成为大语言模型的主流架构。但 RNN 及其思想并未消失:注意力机制与"记忆-更新"的循环思想互补,许多研究仍把循环结构与注意力结合。理解 RNN/LSTM,能帮你理解序列建模的本质与大模型架构演进。