Whisper 是 OpenAI 开源的语音识别(ASR)模型,支持近百种语言、多任务(转写/翻译),是本地部署语音转文字的主流选择。
AI Glossary
Whisper 是 OpenAI 在 2022 年开源的自动语音识别(ASR)模型,可以从音频中生成文字转录,还支持将语音直接翻译成英文。它训练自 68 万小时的多语言音频数据,覆盖 99 种语言,是目前开源社区使用最广的语音识别方案之一。
与早期语音模型不同,Whisper 不做领域限定:新闻、会议、口语、带噪音的录音都能处理,且支持自动标点。
Whisper 的转录在专业术语、方言上可能出错,幻觉(生成不存在的内容)在小模型上更明显;对超长音频需要分段处理。
Whisper 让"语音转文字"从专用服务变成可本地部署的开源能力,是会议纪要、字幕生成、音频存档等场景的事实标准。