Generador de imagen a imagen NSFW: guía práctica (2026)

13 min read

Un generador de imagen a imagen NSFW parte de una foto que tú subes en lugar
de partir de ruido. El resultado conserva la composición original en mayor o
menor medida, y ese grado lo controlas tú. Esta guía explica qué ajuste manda
de verdad y cómo detectar una herramienta que ignora tu imagen.

Imagen a imagen, img2img y “con imagen de entrada” son lo mismo

La confusión con los nombres cuesta tiempo a mucha gente. Una herramienta que
anuncia entrada de imagen, otra que dice trabajar a partir de una foto y otra
que lista img2img en un menú describen exactamente la misma función: tú aportas
una imagen de partida, el modelo la usa como base y devuelve una imagen nueva en
lugar de empezar desde cero. Si llevas semanas buscando un término y no
encontrabas nada, esa es la razón.

Lo que sí cambia entre herramientas no es la etiqueta, son tres ajustes. El
primero es si la herramienta acepta una imagen de entrada, porque bastantes
generadores alojados son solo de texto y no lo dicen en la portada. El segundo
es la fuerza de denoising, que decide cuánto puede alejarse el resultado de lo
que subiste. El tercero es qué pasa con la resolución y la proporción, ya que
algunas herramientas recortan o reducen tu imagen antes de tocarla.

Cuatro pruebas con el mismo encuadre y distinta intensidad de cambio

El denoising es el ajuste que manda

Si solo vas a aprender un parámetro, que sea este. La fuerza de denoising se
expresa normalmente entre cero y uno, y determina cuánto ruido se añade a tu
imagen antes de que el modelo la reconstruya. Cuanto más ruido, más libertad
tiene el modelo y menos se parece el resultado a tu original.

Denoising Qué conserva Para qué sirve
0.15 a 0.30 Composición, pose, ropa y rasgos Retoques, limpiar artefactos, cambiar textura
0.35 a 0.50 Pose y encuadre, la piel y la ropa cambian Cambiar estilo manteniendo la escena
0.55 a 0.70 Solo el reparto general de luz y color Reinterpretar la escena con la misma energía
0.75 o más Casi nada reconocible Poco útil, equivale a generar desde texto

Estos rangos son orientativos y se mueven según el checkpoint, el sampler y
los pasos que uses. Trátalos como un punto de partida y ajusta desde ahí, no
como valores fijos.

Cómo saber si una herramienta ignora tu imagen

Esta prueba se hace en cinco minutos y te ahorra pagar por algo que no hace lo
que promete. Sube una sola imagen. Genera dos veces con un denoising bajo y dos
veces con uno alto, sin cambiar nada más. Compara los cuatro resultados.

Si el par de denoising bajo se parece mucho a tu original y el par alto se
aleja bastante, el control funciona como debe. Si los cuatro resultados se
parecen entre sí pero ninguno se parece a tu foto, la herramienta probablemente
está generando solo desde el prompt y tu imagen no entra en la ecuación. Es más
común de lo que parece en las capas gratuitas, donde a veces el campo de subida
existe pero no está conectado al pipeline.

Un segundo indicio: si el resultado siempre sale con la misma proporción
aunque subas imágenes verticales y horizontales, la herramienta está recortando
o reescalando por su cuenta. Eso no significa que ignore la imagen, pero sí que
vas a perder parte del encuadre, y conviene saberlo antes y no después de
cincuenta generaciones.

El flujo que funciona con la mayoría de checkpoints

El error más repetido es subir una foto mala y esperar que el modelo la
arregle. El modelo trabaja con lo que le das. Una imagen de partida nítida, bien
encuadrada y con la exposición correcta produce resultados claramente mejores
que una borrosa, y arreglar la foto antes suele ser mejor inversión de tiempo que
repetir generaciones. Si tu problema es exactamente ese, la guía sobre
imágenes borrosas y cómo
solucionarlas
cubre las causas más habituales.

El orden que recomiendo es sencillo. Primero fija el encuadre y la resolución
de la imagen de partida. Segundo escribe un prompt que describa lo que quieres
que cambie, no lo que ya está en la foto, porque repetir lo que el modelo ya ve
solo compite con la imagen. Tercero empieza con denoising bajo y súbelo poco a
poco hasta que el resultado se aleje lo justo. Cuarto, si necesitas control real
sobre la pose, pasa a ControlNet en lugar de forzar el denoising.

Ese último punto merece énfasis. Mucha gente sube el denoising buscando un
cambio de pose y lo que consigue es perder al personaje. Para eso existe otra
herramienta, y la guía de
ControlNet en español
explica cómo fijar la postura sin sacrificar el
parecido.

Alojado o local, y qué cambia de verdad

Una herramienta alojada te evita instalar nada y funciona desde el móvil, pero
aplica sus propios filtros y sus propios límites de uso, y no siempre te dice
cuáles son. Una instalación local no filtra más allá de lo que haga el checkpoint
que cargues, a cambio de pedirte una tarjeta gráfica decente y una tarde de
configuración.

Para imagen a imagen concretamente, lo local tiene una ventaja que suele
decidir la cuestión: acceso directo al denoising, al sampler y a los pasos. La
mayoría de las interfaces alojadas esconden esos controles detrás de un
deslizador simplificado con tres posiciones, y con eso no se trabaja bien. Si
quieres empezar por lo local, tienes la
instalación de ComfyUI y la de
Stable Diffusion en
español
ya explicadas paso a paso.

Si prefieres probar el flujo sin instalar nada primero, un generador alojado
sirve perfectamente para entender qué hace el denoising antes de montar tu
propio equipo. AI Nudez funciona en el
navegador y permite ver el efecto sin configurar nada, que para aprender el
concepto es suficiente.

De imagen a vídeo, el paso siguiente

Cuando ya controlas imagen a imagen, el salto natural es animar la imagen
resultante. El planteamiento es parecido pero el papel de tu foto cambia: unas
herramientas la usan como primer fotograma literal y otras solo como referencia
de estilo y composición. Esas dos conductas se describen igual en el marketing y
producen resultados completamente distintos, así que conviene generar un clip
corto antes de juzgar una herramienta. Lo tienes desarrollado en la guía de
vídeo NSFW a partir de una foto.

Un caso concreto y frecuente es partir de un retrato y modificar la ropa o
quitarla. Ese flujo tiene sus propias particularidades y sus propios límites
legales y éticos, y está tratado aparte en
desnudar una foto con IA. Merece
lectura antes de usarlo con imágenes de personas reales.

Una zona concreta sustituida sin tocar el resto de la imagen

Errores que se repiten

Subir una imagen ya generada por IA y esperar mejoras es el primero. Los
artefactos del modelo original se refuerzan en la segunda pasada en lugar de
desaparecer. Si vas a reprocesar, hazlo con denoising bajo y sobre una zona
concreta, no sobre la imagen entera.

El segundo es escribir un prompt genérico. En texto a imagen un prompt vago
produce algo aceptable porque el modelo rellena. En imagen a imagen compite con
tu foto y el resultado sale confuso. Describe el cambio, no la escena.

El tercero es no fijar la semilla cuando estás comparando ajustes. Si cambias
denoising y semilla a la vez no sabes cuál de los dos produjo la diferencia.
Fija la semilla mientras experimentas y libérala cuando ya tengas los valores.

El cuarto es asumir que un checkpoint bueno para texto a imagen lo será para
imagen a imagen. No siempre es así, y los modelos muy estilizados tienden a
imponer su estilo sobre tu foto incluso con denoising bajo. Si quieres comparar
opciones antes de decidir, la lista de
mejores generadores de IA
NSFW
incluye cuáles aceptan entrada de imagen y cuáles no. Para una prueba
rápida sin instalar, esta alternativa
alojada
permite comprobar el comportamiento en unos minutos.

Resolución de la imagen de partida: el detalle que casi nadie mira

La resolución con la que subes la imagen condiciona todo lo que viene
después, y es el punto que más gente pasa por alto. Si subes una foto de dos mil
píxeles de ancho a una herramienta que trabaja a mil veinticuatro, esa foto se
reduce antes de que el modelo la toque. Toda la información fina que creías
estar aportando desaparece en ese paso.

El efecto contrario también existe. Subir una imagen demasiado pequeña obliga
a la herramienta a ampliarla, y ampliar antes de generar introduce un suavizado
que el modelo interpreta como textura real. El resultado son pieles de plástico
y bordes blandos que después cuesta corregir.

La recomendación práctica es preparar la imagen de partida a una resolución
cercana a la de trabajo del modelo, con el recorte ya hecho y la proporción ya
decidida. Cinco minutos en un editor cualquiera antes de subir ahorran muchas
generaciones desperdiciadas. Es la misma lógica que se aplica al vídeo, donde la
calidad del fotograma inicial manda sobre casi todo lo demás.

Prompt positivo y negativo en imagen a imagen

La lógica del prompt cambia respecto a texto a imagen y conviene interiorizar
la diferencia. En texto a imagen describes la escena completa porque no existe
nada más. En imagen a imagen la escena ya está, así que describir lo que la foto
ya muestra no aporta información: compite con ella.

Lo que funciona es describir el cambio. Si quieres otra iluminación, describe
la iluminación. Si quieres otro material en la ropa, describe el material. Si
quieres el mismo encuadre con otro estilo, nombra el estilo y poco más. Los
prompts cortos y dirigidos rinden mejor aquí que los largos y descriptivos, que
es justo lo contrario de lo que mucha gente ha aprendido generando desde
texto.

Con el negativo pasa algo parecido. Un negativo heredado de tus generaciones
de texto a imagen suele incluir términos que ahora luchan contra elementos
presentes en tu foto original. Revísalo y quédate solo con lo que tenga sentido
sobre esta imagen concreta. Si te interesa el tema en profundidad, la
guía maestra de prompts
NSFW
desarrolla la estructura completa y cuándo conviene cada parte.

Un control de precisión ajustado paso a paso

Cuándo usar inpainting en lugar de img2img completo

Esta decisión ahorra mucho tiempo cuando se entiende bien. Img2img reprocesa
toda la imagen, así que cualquier zona que ya estaba bien corre el riesgo de
empeorar. Inpainting reprocesa solo lo que marcas con una máscara y deja el
resto intacto, píxel por píxel.

La regla es sencilla. Si el problema está localizado, una mano, un ojo, un
detalle de la ropa, usa inpainting. Si quieres cambiar el carácter global de la
imagen, su luz, su estilo o su textura general, usa img2img. Intentar arreglar
una mano subiendo el denoising global es el camino largo hacia perder la cara
del personaje.

Una variante intermedia funciona muy bien: img2img suave sobre toda la imagen
para unificar el estilo, seguido de inpainting sobre las zonas que hayan quedado
peor. Dos pasadas cortas suelen dar mejor resultado que una pasada agresiva, y
además son más fáciles de deshacer si algo sale mal.

Qué esperar según el tipo de foto de partida

No todas las imágenes de partida se comportan igual, y saber esto por
adelantado evita frustración. Un retrato frontal bien iluminado es el caso
fácil: el modelo tiene rasgos claros con los que trabajar y el resultado suele
ser consistente incluso con denoising medio.

Una foto de cuerpo entero a distancia es más difícil. La cara ocupa pocos
píxeles, así que en cuanto subes el denoising el rostro se deshace antes que el
resto de la imagen. En esos casos conviene trabajar en dos fases, primero la
escena y después el rostro por separado.

Las fotos con poca luz o mucho grano son el peor punto de partida. El modelo
interpreta el ruido como textura y lo amplifica. Si solo tienes una imagen así,
límpiala antes de subirla, porque ninguna cantidad de denoising va a recuperar
información que no está en el archivo original.

Un último caso que conviene mencionar es la imagen ya generada por IA. Puede
parecer el punto de partida ideal porque es limpia y está bien compuesta, pero
arrastra los artefactos del modelo que la creó, y una segunda pasada tiende a
reforzarlos en lugar de disolverlos. Si vas a reprocesar material generado,
trabaja con denoising bajo y sobre zonas concretas, no sobre la imagen
entera.

Preguntas frecuentes

¿Cuál es la diferencia entre img2img e inpainting?

Img2img reprocesa toda la imagen con la fuerza de denoising que elijas.
Inpainting reprocesa solo la zona que pintas con una máscara y deja el resto
intacto. Para cambios locales, como una mano mal generada, inpainting es casi
siempre la opción correcta.

¿Qué valor de denoising debería usar para empezar?

Empieza en 0.35 y ajusta. Si el resultado se parece demasiado a tu original,
sube en pasos de 0.05. Si pierdes el parecido, baja. Ese rango medio funciona
razonablemente con la mayoría de checkpoints, aunque el valor óptimo depende del
modelo y del sampler.

¿Puedo usar imagen a imagen desde el móvil?

Con una herramienta alojada sí, siempre que acepte subida de archivos. Una
instalación local en el móvil no es viable en la práctica por memoria de vídeo.
La alternativa habitual es instalar en un ordenador y acceder desde el móvil por
red local.

¿Por qué mi resultado sale con otra proporción?

Porque la herramienta está recortando o reescalando la imagen de entrada para
ajustarla a su resolución de trabajo. Comprueba si puedes fijar la resolución de
salida. Si no puedes, recorta tú la imagen a la proporción correcta antes de
subirla.

¿Necesito una tarjeta gráfica potente?

Para imagen a imagen local, sí conviene. El proceso consume una memoria
parecida a la de texto a imagen a la misma resolución, así que si ya generas sin
problemas también podrás reprocesar. Si vas justo de memoria, baja la resolución
de trabajo antes que los pasos.

¿Sirve cualquier checkpoint para imagen a imagen?

Técnicamente casi todos aceptan una imagen de entrada, pero el
comportamiento varía bastante. Los modelos muy estilizados tienden a imponer su
estilo aunque uses denoising bajo. Prueba el checkpoint concreto que quieras usar
antes de dar por hecho el resultado.

¿Puedo mantener la cara de la imagen original?

Con denoising bajo se conserva razonablemente. Si necesitas más fidelidad,
combina denoising bajo con inpainting sobre el rostro, o usa herramientas de
consistencia de personaje. Cuanto más alto el denoising, menos parecido queda.

¿Es legal reprocesar la foto de otra persona?

Depende de tu jurisdicción, del uso que le des y del consentimiento de la
persona. Varía mucho entre países y esto no es asesoramiento legal. Infórmate de
la normativa que te aplica antes de trabajar con imágenes de personas reales, y
no publiques material de terceros sin permiso.