Fundamentos

IA multimodal

Un modelo que puede recibir o generar más de un tipo de datos —texto, imágenes, audio, vídeo— en lugar de solo texto.

Los primeros modelos de lenguaje grandes solo leían y escribían texto. Un modelo multimodal también puede mirar una foto y describirla, escuchar voz, ver un vídeo o generar una imagen, porque ha sido entrenado para mapear distintos tipos de datos hacia la misma representación subyacente sobre la que razona el modelo.

La multimodalidad deja de ser un truco de demostración y se convierte en un requisito ineludible en el momento en que la IA tiene que actuar en el mundo físico: un robot o un vehículo autónomo necesita ver, oír y razonar dentro del mismo modelo, no encadenar sistemas separados de propósito único — una parte importante de por qué la 'IA física' se considera un hito más difícil y más lejano que la IA conversacional basada en texto.

Análisis relacionado