基础概念

多模态 AI

不局限于文本,而是能够接收或生成多种数据类型——文本、图像、音频、视频——的模型。

早期的大语言模型只能读写文本。多模态模型还能看一张照片并描述它、听懂语音、理解视频,或者生成图像——因为它被训练成能把不同类型的数据映射到同一套模型用来推理的底层表征上。

一旦 AI 需要在物理世界中真正行动,多模态就不再只是演示花招,而会变成硬性要求:机器人或自动驾驶汽车需要在同一个模型里完成看、听、推理,而不是把几个各司其职的单一系统拼接起来——这正是"具身智能/物理 AI"被视为比聊天机器人式文本 AI 更难、也来得更晚的一个重要原因。

相关分析