Cómo pedir una imagen
En el capítulo anterior generamos una imagen con un prompt simple. En muchas ocasiones el resultado obtenido se parece solo a medias a lo que teníamos en mente. En este capítulo veremos cómo cerrar esa distancia.
Del prompt engineering a la dirección visual
Durante un tiempo circularon fórmulas muy rígidas para escribir prompts: plantillas larguísimas, listas de palabras mágicas y parámetros heredados de herramientas concretas. Buena parte de eso ha envejecido mal, porque los modelos actuales entienden lenguaje natural mucho mejor que hace dos años.
Es más útil pensar en términos de dirección visual: lo mismo que le explicarías a un fotógrafo o a una ilustradora si le encargases la pieza. Esa persona no necesita palabras clave, necesita saber qué quieres, dónde ocurre y cómo debe verse.
Los siete ingredientes
Una estructura sencilla, que funciona en cualquier herramienta y que se puede recorrer mentalmente de forma rápida:
1. Qué quiero. El sujeto principal: objeto, persona, escena.
2. Contexto. Dónde ocurre, en qué momento, con qué alrededor.
3. Composición. Primer plano, plano general, perspectiva frontal o cenital, dónde se sitúa el sujeto dentro del encuadre.
4. Estética. Fotografía, ilustración, dibujo técnico, cartoon, acuarela, render 3D.
5. Detalles importantes. Colores, iluminación, materiales, objetos concretos que deben aparecer.
6. Formato. Horizontal, vertical, cuadrado; y si aplica, la proporción concreta (16:9, 9:16, 1:1).
7. Restricciones. Qué debe aparecer y qué no debe aparecer.

Ejemplo
Con la escena del capítulo anterior, la versión dirigida quedaría así:
Un pangolín surfeando una ola en un mar abierto, con un volcán al fondo.
El pangolín aparece de cuerpo completo en el centro de la imagen, sobre
una tabla verde, con un bañador rojo de flores y ambos brazos extendidos.
Fotografía deportiva, iluminación cinematográfica, perspectiva frontal,
formato horizontal 16:9.
Cada frase cubre un ingrediente: sujeto, contexto, composición, restricción de postura, estética, iluminación, perspectiva y formato.

Lo importante es iterar
Con el avance en el entendimiento de instrucciones en los nuevos modelos el objetivo ya no es escribir el prompt perfecto a la primera sino saber cómo iterar sobre una primera versión.

Los modelos conversacionales actuales permiten trabajar sobre la imagen anterior sin volver a describirla entera. Una sesión real se parece más a esto:
El pangolín está demasiado cerca. Aléjalo.
Cambia la tabla a rojo.
Elimina el volcán del fondo.
Haz que parezca una ilustración de libro infantil.
Ahora genera una versión vertical.
Esa conversación, eso sí, tiene un límite: la ventana de contexto que vimos en el capítulo anterior. Y en una conversación visual se agota rápido, porque cada imagen cuesta muchos más tokens que una frase. De ahí que a la décima corrección reaparezca un detalle que habías descartado al principio: esa instrucción, sencillamente, ya no está dentro de lo que el modelo puede ver.
Si eso ocurre, lo más rápido no es insistir, sino repetir la restricción o empezar un hilo nuevo con la mejor imagen como punto de partida.
Dos hábitos que ayudan mucho:
- Cambia una cosa por vuelta. Si pides tres correcciones a la vez y el resultado empeora, no sabrás cuál fue la culpable.
- Guarda las versiones que te gusten. Una iteración puede alejarte del buen resultado que ya tenías, y no siempre es posible volver atrás.

Comparar herramientas con el mismo problema
Una forma honesta de comparar plataformas es darles exactamente el mismo encargo. Con el prompt dirigido completo, prueba en:
- ChatGPT
- Gemini
- Microsoft Copilot
Y, si hay tiempo o acceso, en alguna adicional como Grok o Midjourney.
Después compara sobre estos ejes:
| Criterio | Qué mirar |
|---|---|
| Seguimiento de instrucciones | ¿Cumple las restricciones concretas (cantidades, posiciones, colores)? |
| Estética | ¿El acabado por defecto encaja con lo que necesitas? |
| Realismo | ¿Anatomía, sombras y reflejos aguantan una segunda mirada? |
| Texto | ¿Escribe correctamente si le pides un rótulo? |
| Facilidad de edición | ¿Puedes corregir sin volver a empezar? |
| Velocidad | ¿Cuánto tarda cada iteración? |
| Restricciones | ¿Qué se niega a generar? |
Ejercicio
Genera una imagen relacionada con tu trabajo o tus intereses, cumpliendo tres condiciones:
- Debe contener al menos tres elementos concretos que tú especifiques.
- Debe especificarse un formato.
- Debe hacerse al menos una modificación posterior por conversación.
Propuesta
Consigue que el modelo respete simultáneamente:
- una cantidad exacta ("exactamente cuatro sillas"),
- una posición ("el logotipo en la esquina inferior derecha"),
- un color concreto,
- una relación espacial ("la persona detrás del mostrador, no delante").
Es más difícil de lo que parece, y descubrir dónde se rompe cada herramienta es precisamente el objetivo.