OpenAI 开源的通用语音识别模型,支持 99 种语言的多语言转写与翻译。
Project story
Whisper 是 OpenAI 开源的语音识别模型,基于大规模弱监督训练,对嘈杂环境、口音和专有名词的鲁棒性明显优于传统方案。支持 99 种语言的转写,以及任意语言到英语的翻译。
模型分 tiny/base/small/medium/large 五档,可以在显存和精度之间取舍;large 版本在标准评测上接近人类转录水平。社区生态衍生出 faster-whisper、WhisperX、whisper.cpp 等大量加速方案。
适合场景:会议录音转写、字幕生成、语音内容搜索索引、以及各类需要高准确率转写的产品集成。
上手方式:pip install openai-whisper 后 whisper audio.mp3 --language zh 即可输出带时间戳的文本。