无监督学习是机器学习的三大范式之一:训练数据不带人工标注,模型自己发现数据中的结构(聚类、降维、分布规律),是数据探索与大模型预训练的基础方法。
AI Glossary
无监督学习(Unsupervised Learning)是机器学习的主要范式之一:训练数据没有人工标注(没有"正确答案"标签),模型的任务是从数据自身发现结构——把相似的东西归为一类、找出数据的潜在维度、学习数据的分布规律。与之相对,监督学习用"输入-标签"对学习映射,强化学习用试错学策略;无监督学习则是在"没有人告诉模型什么是对的"的情况下自主学习。
常见的无监督任务包括:
监督学习需要大量人工标注(成本高、依赖标签质量),擅长"学会映射";无监督学习无需标注(数据随处可得),擅长"发现结构与规律"。两者常组合使用:无监督先在大规模无标注数据上预训练(学通用规律),监督再在少量标注数据上微调(对齐具体任务)——这正是大模型"预训练 + 微调"的范式。
用户画像与客户分群、异常检测(金融欺诈、系统故障)、推荐系统(用户行为模式发现)、知识图谱构建(实体聚类)、以及大语言模型的预训练——无监督学习是"AI 从海量原始数据中自主学习"的根本途径,与大模型时代深度绑定。