长上下文指大语言模型单次能够处理的输入长度,从早期的几千 token 扩展到如今的百万级,让模型可以整本读入书籍、长文档与完整代码库,是 AI 应用能力边界的重要指标之一。
AI Glossary
长上下文(Long Context)指大语言模型单次对话/请求能够处理的输入长度,通常以 token(词元)为单位衡量。从 GPT-3 时代的几千 token,到 Claude、Gemini、Kimi 等模型的 10 万、100 万、甚至 1000 万 token,模型的「一次能读多少」正在指数级增长。
上下文长度决定模型能「记住并理解」多少信息:短上下文只能处理段落,长上下文可以整本读入书籍、完整代码库或整场会议记录,直接改变 AI 的应用形态。
长上下文直接拓展了 AI 的能力边界:
一是整篇理解:可以一次性读入整份论文、报告、合同,基于全文问答与总结,而不是分段拼接。
二是代码级理解:把整个项目代码库放进上下文,AI 理解全局后进行跨文件修改与重构。
三是长文档处理:书籍、法律文件、财务报告等长材料的一体化处理。
四是「少检索」范式:减少对 RAG(检索增强)的依赖,直接用完整上下文回答问题。
长上下文主要靠三类技术实现:
一是稀疏注意力:用稀疏模式减少计算量,让注意力机制扩展到更长序列(如 Longformer、BigBird)。
二是滑动窗口/分层压缩:对早期内容做压缩摘要,保留关键信息(如早期的摘要式方法)。
三是位置编码扩展:改进位置编码(RoPE 等)的外推能力,让模型理解超出训练长度的序列。
训练层面还需要用长文本数据继续预训练,模型才能真正「用得好」长上下文——上下文长度是能力上限,训练充分性决定实际效果。
长上下文并非「越长越好用」,存在现实局限:
一是「中间遗忘」:研究表明模型对长上下文中间部分的信息利用不稳定,关键信息放开头与结尾更易被记住。
二是「大海捞针」效应:长文本中只有一两句关键信息时,模型可能定位失败(即大海捞针测试的难点)。
三是算力成本:上下文越长,推理计算与内存开销越大,成本随长度增长。
四是输入输出不均衡:长输入下模型的输出质量与指令遵循可能下降,需要工程调优。
整本文档问答:论文、书籍、报告的一体化理解与问答。
代码库助手:完整代码库上下文下的开发辅助。
长对话记忆:贯穿多轮对话的长期记忆与任务执行。
会议与档案:整场会议、整批文档的归档与分析。
长上下文是衡量大模型能力的核心指标之一,从几千到百万 token 的演进让「整本读入」成为可能。但「窗口长」不等于「用得好」——中间遗忘、算力成本与训练充分性都是现实约束。理解这些局限,才能正确使用长上下文能力:关键信息放显眼位置、重要结论交叉验证、长任务结合检索工具,让长上下文真正服务于任务而不是浪费在无效阅读上。