Modelo multimodal

Subir una foto de un plato de comida y preguntar cuántas calorías tiene, o pedirle a una IA que describa lo que ocurre en un vídeo, exige algo más que procesar texto. Un modelo multimodal es precisamente eso: un sistema de IA capaz de entender y combinar distintos tipos de información a la vez (texto, imágenes, audio, vídeo), en lugar de trabajar exclusivamente con uno solo de estos formatos.

Por qué supone un salto real frente a los modelos centrados en un solo formato

Durante años, existían modelos especializados en un único tipo de dato: unos solo entendían texto, otros solo reconocían imágenes, otros solo procesaban audio. Un modelo multimodal integra varias de estas capacidades dentro de un mismo sistema, permitiendo, por ejemplo, describir el contenido de una imagen, responder preguntas sobre un documento con gráficos incluidos, o generar una imagen a partir de una descripción textual, todo con el mismo modelo subyacente.

Aplicaciones habituales de esta capacidad combinada

  • Describir o analizar el contenido visual de una imagen o captura de pantalla, sin necesidad de transcribir manualmente lo que muestra.
  • Generar imágenes a partir de una descripción escrita, o al revés, describir con palabras el contenido de una imagen dada.
  • Transcribir y resumir el contenido de un vídeo, combinando lo que se dice con lo que se muestra visualmente.
  • Analizar documentos con tablas, gráficos o diagramas, entendiendo tanto el texto como los elementos visuales que lo acompañan.

Por qué esto ha ampliado enormemente los casos de uso prácticos

Muchas tareas del mundo real combinan de forma natural varios formatos a la vez: un informe con gráficos, una consulta de soporte con una captura de pantalla adjunta, un producto que se describe mejor con una foto que con mil palabras. Un modelo multimodal puede abordar estas situaciones de forma integrada, sin necesitar que una persona convierta manualmente la información visual en texto antes de poder usarla.

Un matiz técnico que conviene tener presente

No todos los modelos multimodales manejan igual de bien cada tipo de entrada: algunos son excelentes interpretando imágenes pero más limitados con audio, o viceversa. Antes de asumir que un modelo concreto resuelve bien cualquier combinación de formatos, conviene verificar específicamente sus capacidades documentadas para el tipo de contenido que se necesita procesar en cada caso particular.

Términos relacionados.

Share of Voice

En un sector con cinco marcas competidoras, no todas ocupan el mismo espacio en la conversación pública. El Share of Voice (SOV, «cuota de voz») mide precisamente qué porcentaje de

Leer más

Rastreo

Antes de que Google pueda decidir si una página merece aparecer en sus resultados, necesita primero descubrirla y visitarla. El rastreo es precisamente ese primer paso: el proceso mediante el

Leer más

Function calling

Un modelo de lenguaje, por sí solo, no puede consultar el tiempo real, revisar el stock actual de un producto, ni enviar un email: solo genera texto. El function calling

Leer más
0%