BERT 是谷歌 2018 年提出的预训练语言模型:用"掩码语言模型+双向Transformer"在大规模语料上预训练,开创了"预训练+微调"范式,是 NLP 进入大模型时代的标志。
AI Glossary
BERT(Bidirectional Encoder Representations from Transformers)是谷歌 2018 年提出的预训练语言模型:先用大规模无标注语料训练一个"通晓语言"的基座模型,再针对具体任务微调。它有两个关键创新——双向编码(同时看到一句话的左边和右边,真正理解上下文)与掩码语言模型(随机遮住部分词,让模型猜被遮住的词,从而学会语言规律)。BERT 的出现让 NLP 进入"预训练 + 微调"时代,是 GPT 之外的另一条大模型主线,也是现代 LLM 发展史上最重要的里程碑之一。
BERT 的训练分两步:
BERT 是编码器(理解型):擅长分类、抽取、判断类任务;GPT 是解码器(生成型):擅长文本生成与对话。两者同属 Transformer 家族,但 BERT 关注"理解",GPT 关注"生成"。当前大模型时代 GPT 路线的生成式模型成为主流,但 BERT 奠定了"预训练+微调"这一根本范式,理解它才能理解今天所有大模型的训练逻辑。
文本分类(垃圾信息/情感)、命名实体识别、问答系统、语义相似度计算、搜索引擎排序、信息抽取。BERT 及其变体至今仍在大量"理解型"任务与轻量部署场景中使用,是 NLP 工程师的必备知识。