GPT-4o 是 OpenAI 于 2024 年发布的旗舰多模态模型,支持文本、图像、音频实时理解与生成,以低延迟语音对话和全能输入著称。
AI Glossary
GPT-4o 是 OpenAI 于 2024 年 5 月发布的旗舰多模态模型。名字中的 "o" 代表 Omni(全能):它能同时理解文本、图像与音频,并以低延迟进行实时语音对话——对话响应速度接近真人交流。
与早期版本不同,GPT-4o 是真正的端到端多模态模型:语音输入不再先转文字再处理,而是直接理解音频中的语气与情绪,这让对话更自然。
| 维度 | GPT-4 | GPT-4o |
|---|---|---|
| 模态 | 文本+图像 | 文本+图像+音频 |
| 语音延迟 | 数秒(文字中转) | 亚秒级(端到端) |
| 价格 | 较高 | 更低(约一半) |
| 速度 | 较慢 | 快约 2 倍 |
GPT-4o 把"全能输入+实时语音"带到了大众可用的水平,是多模态 AI 助手进入日常生活的标志性模型。
用通俗中文解释 AI 技术术语,帮助你看懂工具页面里的模型、协议和工作流。