기본 개념 관련 분석 →
멀티모달 AI
텍스트만이 아니라 이미지·음성·영상 등 두 가지 이상의 데이터 유형을 입력받거나 생성할 수 있는 모델.
초기 거대 언어 모델은 텍스트만 읽고 썼습니다. 멀티모달 모델은 사진을 보고 설명하거나, 음성을 듣거나, 영상을 이해하거나, 이미지를 생성할 수도 있습니다 — 서로 다른 유형의 데이터를 모델이 추론하는 동일한 내부 표현으로 대응시키도록 학습됐기 때문입니다.
AI가 물리적 세계에서 실제로 행동해야 하는 순간, 멀티모달은 그저 시연용 트릭이 아니라 필수 요건이 됩니다. 로봇이나 자율주행차는 별개의 단일목적 시스템을 이어붙이는 게 아니라, 하나의 모델 안에서 보고·듣고·추론해야 합니다 — 이것이 "피지컬 AI"가 챗봇형 텍스트 AI보다 더 어렵고 더 늦게 도달할 목표로 여겨지는 큰 이유 중 하나입니다.