阿里开源的多语言语音识别模型,专注于高准确率中文识别与超低延迟推理。
Project story
SenseVoice 是阿里开源的语音识别模型,主打中文高准确率与极低延迟,在中文评测集上的字错率表现优于多数同规模模型。它同时支持中英日粤韩五种语言识别,并附带语速、情绪等副语言信息输出。
提供 Python 与 ONNX 导出,可部署到低端设备;与 FunASR、CosyVoice 配合构成阿里开源语音体系。
适合场景:对中文识别率和延迟有要求的实时转写、智能客服、语音输入法。
上手方式:从 ModelScope 下载模型,pip 安装后用 Python API 直接识别。