Hugging Face 官方开源的高性能 LLM 推理服务器,专为生产部署优化。
Project story
Text Generation Inference(TGI)是 Hugging Face 推出的 LLM 推理服务器:支持连续批处理、张量并行、量化(GPTQ/AWQ/FP8)、流式输出等生产特性,官方模型服务(HF Inference Endpoints)即基于它运行。
Rust 内核保证低延迟高吞吐,一条 docker 命令即可部署,是自建模型服务的高性能选择。
适合场景:需要高并发对外提供开源模型服务、与 Hugging Face 生态深度协作的团队。
上手方式:docker run 启动 TGI 镜像,指定模型 ID 与显存参数即可对外提供服务。