模型量化是把模型参数从高精度(如FP16)压缩到低精度(如INT8)的优化技术,显著降低显存占用与推理成本,是本地部署大模型的关键手段。
AI Glossary
模型量化(Model Quantization)是把神经网络参数从高精度数值(如 FP16、FP32)压缩到低精度(如 INT8、INT4)的技术。精度降低换来的是更小的模型体积、更低的显存占用和更快的推理速度——这是普通电脑能跑大模型的秘密。
大模型参数动辄几十上百 GB(以 FP16 计),绝大多数个人设备跑不动。量化把每个参数从 2 字节压到 1 字节甚至 0.5 字节,显存需求减半以上,让 7B、13B 级别模型在消费级显卡甚至 CPU 上可运行。本地部署、边缘设备、低成本推理都依赖它。
模型量化是"让 AI 跑得起"的关键优化:用少量精度换大量成本节省。想在自己电脑上跑大模型,量化是最重要的概念之一;同时要接受量化后的质量折损,按任务敏感性选择精度档位。