BentoML 开源的 LLM 服务框架,一行命令把开源模型变成生产级 API 服务。
Project story
OpenLLM 把「模型服务化」简化成一行命令:openllm serve 即可把 Llama、Qwen、Mistral 等模型包装成 OpenAI 兼容 API,自动处理量化、批处理与显存优化。
与 BentoML 生态集成,可打包为可部署的 Bento 并托管到任意云;支持多后端适配(vLLM、llama.cpp 等)。
适合场景:快速把开源模型暴露成服务、模型部署实验、BentoML 技术栈团队。
上手方式:pip install openllm,openllm serve Qwen2.5-7B-Instruct 即启动服务。