NVIDIA 官方 LLM 推理引擎,针对 GPU 深度优化,性能极致但对生态有要求。
Project story
TensorRT-LLM 是 NVIDIA 官方的大模型推理引擎:把模型编译为针对具体 GPU 高度优化的 TensorRT 引擎,通过内核融合、KV Cache 管理与量化,实现吞吐与延迟的极致性能。
支持主流开源模型与 FP8/INT4 量化、多卡并行,常被用于高端 GPU 集群的高性能推理服务。
适合场景:NVIDIA GPU 上的高并发推理服务、对性能有极致要求的模型部署。
上手方式:按文档构建 TensorRT-LLM 环境,转换模型为引擎后部署服务。