多模态模型指能同时处理文本、图像、音频、视频等多种输入形态的 AI 模型,如能看图回答、听懂语音、理解视频画面的模型,是当前 AI 技术的重要发展方向。
AI Glossary
多模态模型(Multimodal Model)指能同时处理多种输入形态的 AI 模型——不只是文本,还包括图像、音频、视频等。最直观的例子:你发一张照片问「这张图里有什么」,它能看图回答;你发一段语音,它能听懂并回复。
「多模态」的「多」指输入渠道多:文字、图片、声音、画面……模型把这些不同形态的信息统一理解,而不是只能处理一种。
主流多模态模型的能力通常包括:
在日常产品里,「能传图问问题」「能语音对话」「能扫描文档问答」的背后都是多模态理解能力。
限制:
常见误区:
纯文本模型擅长深度语言任务(长文写作、复杂推理、代码);多模态模型在语言能力之外增加了「感知」能力。当前趋势是融合:新一代旗舰模型普遍具备多模态理解,同时保持强文本能力——选型时看你的任务是否需要「看图/听声」。
多模态模型是能同时理解文本、图像、音频、视频的 AI,让人机交互从「打字」扩展到「拍照、说话、发视频」。它解锁了识图、语音、视觉问答等场景,也有「看错/编造」的限制。理解多模态,就理解了为什么新一代 AI 产品都在强调「能传文件、能看图、能语音」。