基于 CTranslate2 重写的 Whisper 推理实现,4 倍以上加速,显存占用更低。
Project story
faster-whisper 用 CTranslate2 重写了 Whisper 推理内核:在保持识别精度的前提下,推理速度提升约 4 倍、显存占用大幅下降,是生产环境部署 Whisper 的首选实现。
支持 int8 量化、CPU/GPU 双后端与流式推理,接口与原始 Whisper 高度一致,迁移成本低;大量语音产品(含 RAGFlow 等)内置它作为转写引擎。
适合场景:高吞吐语音转写服务、资源受限设备上的离线识别、字幕批量生产。
上手方式:pip install faster-whisper,加载模型后 transcribe 一行出结果。