微软开源的大模型训练优化库,ZeRO 显存优化让百亿级模型单卡可训。
Project story
DeepSpeed 是微软开源的训练优化库:ZeRO 显存优化把模型、梯度、优化器状态分布到多卡,大幅降低训练大模型所需的显存,配合 offload 甚至可在消费级 GPU 上训练百亿参数模型。
提供分布式训练、推理加速与量化(DeepSpeed-Inference)能力,与 Hugging Face Trainer 深度集成,是开源社区训练大模型的标准组件之一。
适合场景:大模型预训练与微调、显存受限环境的训练、高性能推理。
上手方式:pip install deepspeed,配置 ZeRO 策略后正常启动训练脚本。