Prompts de poses NSFW: cómo describirlas para que funcionen (2026)

13 min read

Describir una pose con palabras es de lo más difícil que se le puede pedir a
un modelo de imagen. Esta guía explica por qué fallan los prompts de poses
largos, qué estructura funciona mejor y en qué punto conviene dejar de escribir
y usar una referencia visual.

Por qué las poses son el punto débil de los prompts

Un modelo de difusión aprende asociaciones entre palabras e imágenes, no
anatomía. Entiende bastante bien conceptos que aparecen etiquetados con
frecuencia y consistencia en su entrenamiento, y entiende muy mal cualquier cosa
que exija razonamiento espacial.

Eso explica el patrón que todo el mundo observa. Una pose común y muy
fotografiada sale a la primera. Una pose que requiere entender que un brazo pasa
por detrás de una pierna mientras la cabeza gira en otra dirección sale mal por
mucho que la describas, porque el modelo no está resolviendo geometría, está
buscando el conjunto de imágenes que más se parece a tus palabras.

La conclusión práctica es contraintuitiva: describir con más detalle una pose
compleja no ayuda, la empeora. Cada término adicional añade una restricción que
el modelo intenta satisfacer, y cuando no puede satisfacerlas todas produce
anatomía imposible.

La misma postura vista desde tres orientaciones

La estructura que funciona

El orden importa más que la cantidad. Los modelos dan más peso a lo que
aparece antes en el prompt, así que la estructura útil va de lo general a lo
particular.

Posición Qué va aquí Ejemplo de tipo
1 Sujeto y encuadre Plano medio, cuerpo entero, primer plano
2 Postura global De pie, sentada, tumbada, arrodillada
3 Orientación De frente, de perfil, de espaldas, tres cuartos
4 Detalle de miembros Brazos, manos, piernas, cabeza
5 Contexto y luz Sobre una cama, luz lateral, interior

La regla que más resultados mejora es empezar por la postura global y no por
el detalle. Si escribes primero lo que hacen las manos, el modelo intenta
resolver las manos y acomoda el resto alrededor, que es exactamente al revés de
como se construye una imagen.

La segunda regla es no describir lo obvio. Si dices que está sentada, no hace
falta añadir que las piernas están dobladas. Esa redundancia consume atención del
modelo sin aportar información, y en prompts largos la atención es un recurso
limitado.

Vocabulario que el modelo entiende

Los términos que funcionan son los que aparecen etiquetados de forma
consistente en los conjuntos de entrenamiento. En modelos entrenados con
etiquetas tipo booru, el vocabulario de esas etiquetas funciona notablemente
mejor que la descripción libre, porque coincide con lo que el modelo vio.

Eso significa que el vocabulario óptimo depende del checkpoint. Un modelo
entrenado con descripciones naturales responde bien a frases. Un modelo
entrenado con etiquetas responde mejor a listas de términos cortos. Mezclar los
dos estilos en un mismo prompt suele dar peores resultados que elegir uno.

Si trabajas con modelos de la familia anime o ilustración, las guías de
Pony Diffusion XL y de
Illustrious XL explican qué
convención espera cada uno, que es el detalle que más diferencia produce en la
práctica.

Cuándo dejar de escribir y usar una referencia

Existe un punto claro. Si has reescrito el prompt cinco veces y la pose sigue
sin salir, el problema no es tu redacción: es que estás usando la herramienta
equivocada para el trabajo.

Para una pose concreta y específica, una referencia visual resuelve en un
intento lo que el texto no resuelve en veinte. ControlNet toma una imagen de
referencia, extrae la estructura de la pose y se la impone al modelo, de forma
que el resultado respeta la postura sin depender de que el modelo entienda tu
descripción.

El detalle que más se falla ahí es el preprocesador. Uno de esqueleto captura
la posición de las articulaciones y deja libre el resto. Uno de profundidad
captura el volumen y por tanto también la forma del cuerpo. Uno de contornos
captura la silueta completa, incluida la ropa. Elegir el equivocado produce
resultados que respetan la pose de forma aproximada y frustrante. La
guía de ControlNet en
español
cubre cuál corresponde a cada caso.

La combinación más potente es referencia para la pose y prompt para todo lo
demás. Dejas que la imagen resuelva la geometría y usas las palabras para el
estilo, la luz y el detalle, que es donde el texto sí funciona bien.

El prompt negativo en poses

En poses, el negativo tiene un papel distinto al habitual. No sirve para
pedir una postura, sirve para bloquear los fallos anatómicos concretos que ves
repetirse.

La forma correcta de construirlo es empírica y personal. Genera con el
negativo vacío o muy corto, observa qué falla de verdad en tus imágenes, y añade
solo eso. Un negativo copiado de un foro incluye decenas de términos que
combaten problemas que tu modelo no tiene, y compite con el entrenamiento del
propio checkpoint.

Los fallos que más se repiten en poses son extremidades adicionales, manos
deformes y articulaciones imposibles. Las manos merecen mención aparte porque
son el problema anatómico más persistente en todos los modelos, y tienen sus
propias soluciones más allá del prompt, recogidas en la guía sobre
manos deformes.

Poses con más de una persona

Aquí la dificultad se multiplica en lugar de sumarse. El modelo tiende a
mezclar los atributos de los sujetos, de forma que el pelo de uno acaba en el
otro y las posturas se confunden. Es uno de los fallos más difíciles de
corregir solo con texto.

Lo que ayuda es reducir la ambigüedad. Menos personas, atributos claramente
diferenciados entre ellas y una descripción de la relación espacial entre los
sujetos en lugar de dos descripciones independientes. Aun así, el resultado será
inconsistente en una proporción alta de generaciones.

Para escenas de varias personas con poses concretas, la referencia visual deja
de ser una opción y se convierte prácticamente en un requisito. También ayuda
generar por partes y componer después, que es más trabajo y da un control que el
prompt no puede ofrecer.

La estructura de la pose antes de añadir cualquier detalle

Un método de trabajo que ahorra tiempo

El error de proceso más común es cambiar varias cosas a la vez y no saber cuál
produjo la mejora. La alternativa es aburrida y funciona: fija la semilla,
cambia un elemento del prompt, genera, compara.

Con la semilla fija, cualquier diferencia entre dos imágenes viene del cambio
que hiciste. Sin ella, estás comparando dos generaciones distintas y no puedes
atribuir nada. Cuando ya tengas el prompt afinado, libera la semilla y genera
variaciones.

Merece también la pena guardar los prompts que funcionan, con el modelo y los
ajustes usados. Un prompt que funciona en un checkpoint puede fallar en otro, así
que anotar la combinación completa es lo que hace la información reutilizable. Si
quieres una base estructurada sobre la que construir, la
guía maestra de prompts
NSFW
desarrolla el esquema completo, y para estilos concretos de ilustración
la guía de IA hentai y anime
cubre las convenciones propias de ese terreno.

Si prefieres probar prompts sin montar nada en local,
un generador alojado permite iterar
rápido, aunque el control fino sobre samplers y pasos quede fuera.

Errores que se repiten

El primero es el prompt kilométrico. Más términos no es más control, es más
ruido, y a partir de cierta longitud el modelo simplemente ignora el final.

El segundo es pedir una pose que contradice el encuadre. Si pides un primer
plano y describes la posición de los pies, algo va a ceder. El encuadre y la
pose tienen que ser coherentes entre sí.

El tercero es insistir con el mismo prompt esperando que la siguiente semilla
lo arregle. Si la pose es estructuralmente difícil, ninguna semilla la va a
resolver, y las diez generaciones extra son tiempo perdido.

El cuarto es no comprobar si el checkpoint es adecuado. Un modelo entrenado
para retrato realista va a tener dificultades con poses dinámicas complejas por
mucho prompt que le dediques. Para comparar opciones, la lista de
mejores generadores NSFW
recoge las diferencias entre familias de modelos, y
esta alternativa alojada sirve para
comparar resultados sin instalar nada.

Encuadre y pose son la misma decisión

Se tratan como cosas separadas y no lo son. El encuadre determina qué parte
del cuerpo es visible, y por tanto qué parte de la pose el modelo tiene que
resolver de verdad. Elegirlo bien elimina la mitad de los problemas antes de que
aparezcan.

Un primer plano hace irrelevante la posición de las piernas, así que
describirla solo añade ruido. Un plano entero obliga al modelo a resolver el
cuerpo completo, incluidas manos y pies, que es donde más falla. Si tu pose no
necesita mostrar los pies, no los muestres: cada elemento fuera de encuadre es
un problema que no vas a tener que corregir después.

Esto también sugiere una táctica útil para poses difíciles. Genera un encuadre
más cerrado del que quieres, comprueba que la parte visible sale bien, y amplía
el encuadre solo si de verdad lo necesitas. Es más rápido que pelear la imagen
completa desde el principio.

La orientación merece la misma atención. Una figura de espaldas o de perfil
esconde el rostro y las manos, que son las dos zonas de fallo más frecuentes.
Para ciertos resultados, es la vía más corta a una imagen limpia.

La iluminación lateral que hace legible una postura

Iluminación: el ajuste que hace creíble una pose

Una pose técnicamente correcta puede seguir pareciendo falsa, y casi siempre
la culpa es de la luz. El modelo tiende por defecto a una iluminación plana y
frontal que aplana el volumen y elimina las sombras que dan sensación de
tridimensionalidad.

Añadir un término de iluminación direccional cambia el resultado más que
media docena de términos de postura. Una luz lateral marca el relieve del cuerpo
y hace legible la pose. Una luz cenital o contrapicada cambia por completo el
carácter de la misma postura sin tocar nada más.

El orden también importa aquí. La iluminación va al final del prompt, después
de la pose, porque es un modificador de la escena y no su estructura. Ponerla al
principio le da un peso que no necesita y compite con la postura.

Si generas y el resultado parece un maniquí, prueba a cambiar solo la luz
antes de tocar la pose. Es el experimento más barato del proceso y resuelve una
proporción sorprendente de los casos.

Qué hacer cuando el checkpoint no colabora

Antes de reescribir el prompt por sexta vez, merece la pena descartar que el
problema sea el modelo. Hay una prueba rápida: genera la misma pose con un
prompt mínimo, tres o cuatro términos, y observa. Si con un prompt mínimo el
modelo ya produce anatomía rara, el prompt largo no era el problema.

Los modelos muy estilizados tienen su propio repertorio de poses aprendidas y
se resisten a salir de él. Los modelos realistas manejan mejor la anatomía
general y peor las posturas muy dinámicas. Ninguna cantidad de texto convierte
uno en el otro.

Cuando el checkpoint es el límite, hay tres salidas. Cambiar de modelo, que es
la más directa. Usar un LoRA de poses, que ajusta el comportamiento sin cambiar
la base. O pasar a referencia visual, que evita el problema por completo porque
la estructura ya no depende de lo que el modelo entienda.

Esa última opción es también la más robusta a largo plazo. Un flujo basado en
referencia funciona igual cuando cambias de checkpoint, mientras que un prompt
cuidadosamente afinado para un modelo concreto hay que rehacerlo entero cuando
cambias de base.

Queda una última comprobación que ahorra bastante frustración: verifica que la
resolución y la proporción encajan con la pose que pides. Una figura de cuerpo
entero en un lienzo cuadrado obliga al modelo a comprimir o recortar, y el
resultado son proporciones extrañas que después se atribuyen al prompt. Una
pose vertical quiere un lienzo vertical, y ese ajuste de dos segundos resuelve
más problemas de anatomía de los que parece razonable.

Y si después de todo esto la pose sigue sin salir, acepta que algunas
posturas simplemente no están bien representadas en el entrenamiento de ningún
modelo accesible hoy. Reconocerlo pronto es más productivo que la generación
número cuarenta con el mismo prompt reordenado. Cambia de enfoque o cambia de
pose, y guarda la idea para cuando tengas un flujo con referencia visual
montado. Volver a un problema con mejores herramientas es casi siempre más
productivo que insistir con las que ya sabes que no bastan para ese caso
concreto.

Preguntas frecuentes

¿Por qué mi pose no sale como la describo?

Porque el modelo no razona sobre geometría, busca imágenes parecidas a tus
palabras. Las poses comunes salen bien y las que exigen relaciones espaciales
complejas fallan por mucho detalle que añadas. Para esas, usa una referencia
visual.

¿Cuántos términos debería tener un prompt de pose?

Menos de los que la gente usa. Empieza con encuadre, postura global y
orientación, y añade detalle solo si hace falta. Los prompts muy largos diluyen
la atención del modelo y a partir de cierto punto el final se ignora.

¿Sirve el mismo prompt en modelos distintos?

No necesariamente. Un modelo entrenado con etiquetas responde mejor a listas
de términos cortos y otro entrenado con descripciones responde mejor a frases.
Anota siempre con qué checkpoint funcionó un prompt.

¿Cuándo debo usar ControlNet en lugar del prompt?

En cuanto la pose sea específica y hayas fallado tres o cuatro veces por
texto. Una referencia visual resuelve en un intento lo que el prompt no resuelve
en veinte, y te deja usar las palabras para estilo y luz.

¿Por qué salen brazos o piernas de más?

Suele ocurrir cuando el prompt describe una postura ambigua o contradictoria y
el modelo intenta satisfacer restricciones incompatibles. Simplifica la
descripción y comprueba si el problema desaparece antes de recurrir al prompt
negativo.

¿Qué pongo en el negativo para poses?

Solo los fallos que veas repetirse en tus propias imágenes. Un negativo
copiado de un foro combate problemas que tu modelo puede no tener y compite con
su entrenamiento. Empieza corto y añade con criterio.

¿Puedo mantener la misma pose y cambiar el personaje?

Sí, es justo el caso donde ControlNet brilla. Fijas la estructura con la
referencia y cambias el resto del prompt libremente. Es también la forma más
fiable de generar variaciones coherentes de una misma escena.

¿Las poses con dos personas son mucho más difíciles?

Bastante más. El modelo tiende a mezclar atributos entre sujetos y a confundir
las posturas. Reducir el número de personas, diferenciarlas claramente y usar
referencia visual son las tres cosas que más ayudan.