语音识别(ASR)是把人类语音自动转换成文字的技术,是语音助手、会议转写、字幕生成等应用的基础,代表模型包括 Whisper、Kaldi 与各厂商的工业级 ASR 系统,当前正与大模型结合走向端到端与多模态。
AI Glossary
语音识别(Speech Recognition,也称 ASR,Automatic Speech Recognition)是把人类的语音信号自动转换成对应文字的 AI 技术。它是人机语音交互的第一环:语音助手听懂你说了什么、会议软件把录音转成文字、视频平台自动生成字幕,背后都是 ASR。
语音识别与语音合成(TTS,把文字变成语音)相对,两者共同构成语音交互的「听」与「说」闭环。ASR 也是当前大模型语音能力(如语音输入、语音 Agent)的基础组件。
语音识别可以理解为三步:先把语音波形转成可计算的特征(声学特征,如 MFCC、Fbank),再用模型把特征序列映射到文字序列,最后通过语言模型优化文字表达。
技术路线经历了三代演进:
传统路线(GMM-HMM):用高斯混合模型建模声学单元、隐马尔可夫模型建模时序,配合语言模型做解码。是 2010 年代前的主流。
深度学习路线(DNN/端到端):先用 DNN 替代 GMM 建模声学,后来发展到端到端模型——CTC、Attention 编解码器(如 LAS)、Transformer 架构直接把语音映射到文字,不再需要中间对齐步骤,识别准确率大幅提升。
大模型时代(多模态 ASR):Whisper 等模型用大规模弱监督数据训练,支持多语言与强噪声鲁棒性;新一代语音大模型把 ASR 与理解、生成融合,走向「听懂语义而不只是转文字」。
语音识别比文字处理难在信号层面:口音与方言、背景噪声、多人说话(说话人分离)、专业术语与专有名词、语速与情绪都会影响准确率。工业级系统需要数据增强、领域定制(热词)与降噪工程来应对。
会议转写:讯飞、飞书妙记等把会议录音转成文字纪要,替代人工速记。
语音助手:Siri、小爱同学、豆包语音等听懂用户指令并执行。
字幕生成:视频平台自动为内容生成字幕,提升观看体验与无障碍支持。
客服质检:把客服通话转成文字,分析服务质量与用户诉求。
语音输入:手机输入法语音转文字,替代键盘输入。
Whisper:OpenAI 开源的多语言语音识别模型,支持多种语言与任务(转写、翻译),是当前最流行的开源 ASR。
Kaldi:传统学术界的经典 ASR 工具包,用于研究与定制。
工业级 ASR:讯飞、百度、阿里、字节等提供的云 API,针对中文与垂直场景优化。
语音识别是把「声音」变成「文字」的 AI 基础能力,从 GMM-HMM 到大模型,识别准确率与多语言能力不断提升,已成为会议、助手、字幕等产品的标配。理解 ASR 的能力边界(噪声、口音、术语是主要失分点),有助于合理设计依赖语音的产品。对普通用户而言,Whisper 等开源模型已经让「免费、离线、多语言」的语音转写成为现实。