基礎 関連分析 →
マルチモーダルAI
テキストだけでなく、画像・音声・動画など二種類以上のデータを入力または生成できるモデル。
初期の大規模言語モデルはテキストの読み書きしかできませんでした。マルチモーダルモデルは写真を見て説明したり、音声を聞いたり、動画を理解したり、画像を生成したりもできます — 異なる種類のデータを、モデルが推論に使う同じ内部表現へと対応づけるよう学習されているからです。
AIが物理世界で実際に行動しなければならない瞬間、マルチモーダル性は単なるデモの見せ場ではなく、必須要件になります。ロボットや自動運転車は、別々の単機能システムをつなぎ合わせるのではなく、一つのモデルの中で見て、聞いて、推論する必要があります — これが「フィジカルAI」がチャットボット型のテキストAIよりも難しく、より先の目標とみなされる大きな理由の一つです。