大语言模型(LLM)是海量文本数据训练出的深度神经网络模型,核心能力是理解和生成自然语言,是 ChatGPT、Claude、DeepSeek 等 AI 助手的底层技术。
AI Glossary
大语言模型(Large Language Model,简称 LLM)是通过海量文本数据训练出来的深度神经网络模型,核心能力是理解和生成自然语言。ChatGPT、Claude、DeepSeek、通义千问等 AI 助手的底层技术都是大语言模型。
「大」体现在规模:模型参数从几十亿到数千亿不等,训练数据覆盖书籍、网页、代码、论文等广泛文本,这让它掌握了丰富的语言模式与世界知识。
LLM 的核心机制可以简化理解为「预测下一个词」:
所以 LLM 生成的回答本质是「统计上最合理的续写」,而不是「查数据库返回正确答案」。这也解释了两个典型现象:它善于组织语言、产出流畅内容;但它也可能一本正经地编造信息(即「幻觉」)。
LLM 是当前 AI 应用浪潮的基础设施:
几乎所有你接触到的「AI 功能」,底层都站着一个大语言模型。
它的强项:语言组织、知识问答(基于训练数据)、总结提炼、翻译改写、代码辅助。
它的边界:
常见误区:
不要把「大模型」和「AI 产品」混为一谈:ChatGPT 是一个产品,GPT 是它的底层模型;类似的,豆包、DeepSeek 等是产品,背后是不同的模型。产品会叠加提示词工程、检索增强(RAG)、工具调用等能力,来弥补模型的短板。这也是为什么同一个模型,在不同产品里体验可能差异很大。
大语言模型是用海量文本训练、以「预测下一个词」为核心的语言生成模型,它是当前 AI 助手与应用浪潮的底层技术。理解它的机制(概率续写)与边界(会幻觉、知识会过时),能帮你更正确地使用 AI:重要信息交叉核对、提示词写清楚、不把模型当数据库。
用通俗中文解释 AI 技术术语,帮助你看懂工具页面里的模型、协议和工作流。