国产高性能 LLM 推理与部署工具,TurboMind 引擎兼顾易用与性能。
Project story
LMDeploy 是上海人工智能实验室开源的高性能推理工具:TurboMind 引擎支持连续批处理、KV Cache 复用与 W4A16 量化,同时提供简洁的 OpenAI 兼容 API 与多种模型接入。
与 InternLM 生态深度绑定,也支持 Llama、Qwen 等主流模型;部署流程简单,适合国内环境的快速模型服务化。
适合场景:国产模型(InternLM/Qwen)的部署、高性能低成本推理服务。
上手方式:pip install lmdeploy,lmdeploy serve 命令即可启动服务。