语音转写(Speech-to-Text)指用自动语音识别(ASR)技术把语音内容转换成文字文本的能力,是会议纪要、字幕生成、语音搜索与语音助手的基础技术,近年来在大模型辅助下准确率与理解能力大幅提升。
AI Glossary
语音转写(Speech-to-Text / ASR)指用自动语音识别技术把语音内容转换成文字文本的能力。它把「听写」自动化:语音输入、文字输出,是会议纪要、视频字幕、语音搜索与语音助手的基础技术。
语音转写并不是简单的「声音变字」:系统要识别发音、分词断句、加标点、区分说话人,甚至理解专业术语,才能产出可用的文字稿。近年结合大模型,转写在准确率、理解与提炼能力上有了显著提升。
语音转写链路通常包含:
第一步语音信号处理:对音频降噪、分帧、提取声学特征,过滤环境干扰。
第二步声学模型:把声学特征映射到音素/字符,识别「说了什么音」。
第三步语言模型:结合语言概率修正识别结果,分词断句、纠正同音字,理解「该是什么字」。
第四步后处理:标点、格式、术语修正,说话人区分,时间轴对齐。
传统 ASR 与「大模型转写」的区别在于:大模型可以理解语义,转写后自动提炼要点、生成摘要与待办,从「转文字」升级为「转理解」。
会议纪要:会议录音自动转写、提炼要点与待办,替代人工记录。
视频字幕:短视频、课程、影视的自动字幕生成。
语音搜索与指令:语音助手、语音输入法把语音转成文本执行。
访谈与播客:采访、播客的转写整理与归档。
客服质检:通话录音转写与分析,辅助服务质量管理。
一是音频质量:噪声、回声、远场录音显著影响准确率。
二是口音与方言:方言、口音、混合语言场景识别难度高。
三是专业术语:医疗、法律、技术术语需要领域词典支持。
四是多人说话:重叠发言、插话影响说话人区分与内容完整。
实时转写:会议、直播中边说话边出稿,辅助理解与记录。
离线转写:上传音频/视频文件批量转写,处理长材料。
多语言转写:跨语言转写与翻译,服务国际化场景。
智能提炼:转写 + 大模型提炼,产出纪要、摘要与待办。
语音转写把「听写」变成自动能力,是 AI 最普及的应用之一:从字幕到纪要、从语音助手到客服质检,无处不在。理解「声学 + 语言 + 后处理」的链路,就能看懂各类转写工具的差异——准确率、实时性、多语言与提炼能力。大模型时代的转写已从「转文字」走向「转理解」,但口音、噪声与专业术语仍是人工校对的必要理由:机器出初稿、人做关键校对,是高效使用的常态。