News brief
正文
今日,智谱AI正式发布了其最新的多模态语音大模型GLM-4-Voice。与此前基于文本转语音(TTS)和自动语音识别(ASR)拼接的技术路线不同,GLM-4-Voice采用了端到端的架构设计,能够直接处理音频输入并生成音频输出,将对话延迟降低至200毫秒以内,实现了接近真人的流畅交流体验。
据官方技术报告显示,该模型在中文普通话、方言以及中英混合语境的识别准确率上均达到了行业领先水平,特别是在情感识别方面,它能够精准捕捉用户语气中的细微变化,如愤怒、喜悦或犹豫,并据此调整回复的语气和节奏。在基准测试中,GLM-4-Voice在情感一致性评分上比上一代模型提升了35%。
智谱AI CEO张鹏表示,语音交互是人工智能落地终端设备的关键入口。GLM-4-Voice不仅适用于传统的智能客服场景,更将在教育辅导、心理陪伴以及车载智能助手等领域发挥巨大潜力。目前,该模型已通过API接口向开发者开放,首批合作伙伴包括多家头部智能家居企业和在线教育平台。业内分析认为,随着语音交互自然度的提升,AI助手将从“工具型”向“伙伴型”转变,市场规模有望在未来三年内突破千亿级别。