Entender imágenes y usar referencias

Hasta ahora hemos usado los modelos en una sola dirección: texto → imagen. Pero los modelos multimodales también funcionan al revés, y eso permite tener más flexibilidad a la hora de trabajar.

Las IAs también entienden imágenes

Sube una fotografía cualquiera a ChatGPT, Gemini o Copilot y hazle esta secuencia de preguntas, una detrás de otra:

¿Qué aparece en esta imagen?
Describe únicamente la composición.
Describe la iluminación.
Describe el estilo.
Escribe un prompt que permitiría generar una imagen parecida.

En el último prompt le estamos pidiendo al modelo que haga ingeniería inversa de la imagen: que traduzca lo que ve al lenguaje que él mismo entiende mejor.

image-to-text
Preguntar por partes da respuestas mucho más útiles que un genérico '¿qué ves aquí?'.

Usos prácticos inmediatos

  • Redactar textos alternativos para accesibilidad.
  • Documentar material gráfico heredado del que nadie recuerda el origen.
  • Extraer una paleta o una descripción de estilo de una pieza que ya funciona.
  • Comprobar qué está viendo el modelo cuando una edición no sale como esperábamos.

Hay una razón concreta detrás de ese fallo con los detalles pequeños. Como vimos al hablar de cómo procesa el modelo lo que le das, la imagen se trocea en parches antes de entrar, y muchas herramientas la reescalan primero. Si un texto ocupa unos pocos píxeles, puede que sencillamente no sobreviva a ese proceso: el modelo no lo está leyendo mal, es que nunca llegó a verlo. Cuando necesites que lea algo pequeño (una cifra en un gráfico, una etiqueta, un pie de página), recorta esa zona y súbela aparte.

Trabajar con imágenes de referencia

Supón que ves una imagen que te encanta y quieres algo parecido. Le podemos pasar esa imagen al modelo y pedir cosas como:

Genera una imagen diferente manteniendo esta estética.
Mantén la composición pero cambia el contenido.
Utiliza esta imagen únicamente como referencia de estilo.

Fíjate en que las tres frases piden cosas distintas.

Los cuatro tipos de referencia

Referencia de contenido

"Quiero estos elementos."

Interesa qué aparece: los objetos, las personas, el tipo de escena. No importa cómo esté fotografiado ni con qué acabado.

Útil cuando tienes una foto de un espacio, un evento o un montaje y quieres una versión distinta del mismo tipo de escena.

Referencia de sujeto

"Quiero mantener esta persona, personaje u objeto."

Interesa que el sujeto siga siendo reconocible aunque cambie todo lo demás: postura, fondo, iluminación, formato.

Es la base de la consistencia de personaje y de producto, que veremos en detalle en el capítulo 5.

Referencia de estilo

"Quiero esta estética."

Interesa el acabado: paleta, textura, tipo de trazo, grano, tratamiento de la luz. El contenido puede ser completamente distinto.

Es lo que permite que una diez imágenes distintas mantengan una misma estética, como las imágenes de este curso.

Referencia de composición

"Quiero esta distribución."

Interesa dónde está cada cosa: el encuadre, la perspectiva, la jerarquía visual, el espacio reservado para el texto.

Muy útil cuando tienes una plantilla que funciona como un cartel, una portada, una ficha... y quieres reutilizar su esqueleto con otro contenido.

Referencias

Combinar referencias

En ocasiones puede ser útil aportar referencias de diferentes imágenes:

Usa la primera imagen como referencia del personaje, la segunda
únicamente como referencia de estilo, y sitúa la escena en un
mostrador de atención al público.

La calidad del resultado depende mucho de la herramienta: algunas admiten varias imágenes con roles diferenciados y otras las mezclan todas. Merece la pena probarlo antes de comprometerse con un flujo de trabajo.

image-to-text
Referencias con roles explícitos. Cuanto más claro sea el reparto, menos habrá que iterar después.

Ejercicio

Toma una imagen que te guste y produce tres resultados a partir de ella:

  1. Una versión que conserve el contenido pero cambie el estilo.
  2. Una versión que conserve el estilo pero cambie el contenido.
  3. Una versión que conserve la composición pero cambie ambas cosas.

Antes de generar, escribe en una línea qué esperas obtener. Compárarlo después con el resultado.