RealVisXL para NSFW (2026): guía completa

13 min read

RealVisXL es un checkpoint SDXL orientado al fotorrealismo. En NSFW no gana
por variedad de poses, sino por piel, luz y rostros que dejan de parecer de
plástico. Esta guía cubre los ajustes que dan resultados predecibles y los
límites donde conviene cambiar de modelo.

Qué es RealVisXL y por qué se usa

RealVisXL es una versión reentrenada de SDXL construida alrededor de un solo
objetivo: que la imagen parezca una fotografía. El entrenamiento se apoyó en
material fotográfico, y eso se nota desde la primera generación en dos cosas
concretas.

La primera es la piel. SDXL de base tiende a alisar el poro y a dejar un
acabado de cera, sobre todo en planos cerrados. RealVisXL conserva textura, y el
retrato deja de parecer renderizado. Para NSFW esto pesa más de lo que parece,
porque la queja habitual no suele ser la pose sino que el resultado parece
falso.

La segunda es la luz. Entiende bastante mejor las descripciones de luz
lateral, contraluz o luz suave, y no empuja cada escena hacia una iluminación
frontal y plana. Quien busca imagen que parezca fotografía suele notar más esa
diferencia que cualquier cambio de muestreador.

Conviene saber desde el principio qué no es. No es un modelo de anime: no
trabaja con el sistema de etiquetas en el que se apoyan los checkpoints de
ilustración, y alimentarlo con ese vocabulario suele dar resultados confusos.
Para ese camino está la guía de
Animagine XL
.

La textura de la superficie es lo que separa un resultado realista

Ajustes que funcionan

La resolución es lo primero y lo que más se ignora. Es SDXL, así que trabaja
cerca de 1024 por 1024 y en las proporciones equivalentes, como 832 por 1216 en
retrato. Generar a 512 de lado produce ese resultado aplanado que hace pensar
que el modelo es malo. Empieza en la resolución nativa y amplía después, en un
paso aparte.

Para el muestreador, los de la familia DPM++ con planificador Karras suelen
dar resultados consistentes en fotorrealismo, y entre 25 y 35 pasos es la franja
donde la mayoría se detiene. Subir mucho más rara vez cambia lo suficiente como
para justificar el tiempo, y la diferencia desaparece tras cualquier
redimensionado.

El CFG merece atención especial porque es donde estos modelos se comportan
distinto de los antiguos. Los valores altos, del orden de 9 o 10, tienden a
saturar el color y a endurecer la piel, justo lo contrario de lo que se busca.
En la práctica, algo entre 3.5 y 6 suele dar el aspecto más natural, y conviene
probar el extremo bajo antes de asumir que la imagen necesita más obediencia al
texto.

El negativo: menos es más

Existe la costumbre de pegar listas enormes de términos negativos heredadas
de los modelos antiguos. En SDXL, y en esta familia en particular, eso suele
estorbar más que ayudar: cada término consume influencia y algunos empujan la
imagen lejos de lo que querías.

En la mayoría de los casos, mencionar la deformación de manos y de anatomía
ya cubre lo que aparece con más frecuencia. Los términos genéricos de calidad
tienen un efecto discutible aquí y se pueden quitar sin pérdida apreciable, algo
que se comprueba en una sola generación con la semilla fija.

Vocabulario fotográfico

Como el entrenamiento vino de fotografía, el modelo responde mejor a términos
que usaría un fotógrafo que a adjetivos de calidad. Es la diferencia más rápida
de notar y la que más cambia el resultado.

Las descripciones de luz tienen efecto inmediato. La luz lateral dura crea
sombra marcada y volumen. La luz suave difusa aplana el relieve y favorece una
piel uniforme. El contraluz recorta la silueta y tiende a oscurecer el rostro,
que a veces es justo lo buscado y a veces arruina el encuadre. Elegir una y
escribir solo esa rinde más que citar tres a la vez.

Los términos de óptica y encuadre también funcionan. Mencionar una distancia
focal larga tiende a comprimir el fondo y aislar a la persona, mientras que una
corta amplía el entorno y puede deformar los rasgos en plano cerrado. La
profundidad de campo reducida se entiende bien y ayuda a esconder fondos que el
modelo no ha resuelto del todo.

Un aviso sobre la piel: pedir piel perfecta suele devolver el plástico que el
modelo evita por defecto. El camino contrario funciona mejor, mencionando
textura, poro visible e imperfección leve, que es lo que produce el realismo que
casi todo el mundo busca.

Dónde falla

La anatomía explícita es el punto débil previsible. El entrenamiento se apoyó
sobre todo en fotografía general, así que las escenas con anatomía compleja
suelen salir menos convincentes que en modelos entrenados específicamente para
eso. Entrega mejor piel y luz, y peor estructura.

La solución habitual no es cambiar de modelo sino combinar: generar la
composición en un modelo que entienda la escena y pasar el resultado por
RealVisXL con una fuerza media, heredando la estructura y ganando la textura.
Ese tipo de pasada es la misma que se usa al corregir con máscara, descrita en la
guía de inpaint
para NSFW
.

El segundo límite es la variedad de poses. Como el entrenamiento privilegió
la fotografía convencional, las peticiones de ángulo poco común tienden a volver
a encuadres estándar. Fijar la pose con una guía externa resuelve mejor que
insistir en el texto.

El tercero es la especificidad de personaje. No conoce figuras por su nombre
como los modelos de anime, así que reproducir a alguien concreto pasa por
entrenar un LoRA.

Frente a otros modelos realistas

La comparación que más se pide es con Juggernaut, que juega en el mismo
terreno. Las diferencias suelen estar en el carácter por defecto más que en la
calidad: uno puede tirar hacia un acabado algo más editorial y el otro hacia
algo más neutro, y la preferencia acaba siendo personal. El repaso propio está
en la guía de
Juggernaut XL
.

Frente a los modelos de arquitectura más reciente, la diferencia no es tanto
de estilo como de exigencia de hardware y de ecosistema de extensiones
disponibles. Un checkpoint SDXL bien asentado suele tener más herramientas
compatibles a su alrededor, y eso pesa más en el día a día que una ventaja
teórica de calidad.

La recomendación práctica es no elegir en abstracto. Genera la misma escena
con la semilla fija en dos o tres checkpoints realistas y quédate con el que te
guste, porque a este nivel la diferencia es de gusto y no de capacidad.

Un flujo que ahorra tiempo

El camino con menos trabajo repetido empieza por fijar la semilla y variar un
solo parámetro cada vez. Generar diez imágenes cambiándolo todo a la vez produce
diez resultados distintos y ninguna información sobre qué ajuste causó qué.

Un orden que funciona: primero acierta resolución y proporción, porque afectan
a todo lo demás. Después ajusta el CFG, que es donde este modelo más se
diferencia de los antiguos. Solo entonces toca el muestreador y el número de
pasos, que suelen ser la parte menos decisiva. Y al final afina el prompt.

Cuando el resultado esté casi bien, resiste la tentación de seguir generando a
la espera de mejor suerte. Una pasada suave sobre la mejor imagen que tengas
suele acercarse más que decenas de intentos nuevos, y cuesta una fracción del
tiempo.

La dirección de la luz cambia el resultado más que los adjetivos

Escenas con varias personas

Es donde más tropiezan los modelos fotográficos en general, y este no es una
excepción. Con más de una figura en el cuadro, los rasgos tienden a mezclarse
entre ellas y aparecen miembros en sitios improbables.

Describir a cada persona por separado en el prompt ayuda menos de lo que
parece, porque el modelo no reparte la descripción entre figuras de forma
fiable. Lo que suele funcionar mejor es generar en plano algo más abierto,
aceptar rostros menos definidos y corregir cada uno después.

Para escenas realmente complejas, generar a cada persona por separado y
componer después acaba saliendo más rentable que pelearse con un prompt que
intenta gobernarlo todo a la vez.

Versiones

RealVisXL ha pasado por varias revisiones, y no son simplemente mejores unas
que otras: cambian de carácter. Las más recientes tienden a entregar imagen más
limpia y contrastada sin ajuste, mientras que algunas anteriores mantenían un
aspecto más crudo que parte de la gente prefiere.

Si encuentras ajustes recomendados en una discusión antigua y no funcionan, la
versión es la primera sospechosa. Conviene anotar qué revisión descargaste,
porque comparar resultados entre versiones sin saber cuál está cargada es fuente
garantizada de confusión.

Problemas frecuentes

La piel sigue pareciendo artificial. Tres causas aparecen casi siempre: un CFG
demasiado alto, que endurece la imagen; pedir piel perfecta en el prompt, que
empuja de vuelta al acabado liso; y generar por debajo de la resolución nativa,
que deja menos detalle disponible para la textura. Corregir la resolución
resuelve por sí solo buena parte de los casos.

Los colores salen apagados o demasiado grises. Suele ser CFG bajo llevado al
extremo. La franja recomendada es baja comparada con los modelos antiguos, pero
tiene un suelo: por debajo de cierto punto la imagen pierde decisión.

El rostro cambia entre generaciones con el mismo prompt. Es lo normal si la
semilla varía. Para mantener a la misma persona hace falta o fijar la semilla o
recurrir a un LoRA entrenado, porque el texto por sí solo no identifica a
nadie.

Aparecen manos deformes pese al negativo. El negativo reduce la frecuencia,
no la elimina, porque el problema está en la estructura y no en el estilo. La
corrección posterior con máscara sigue siendo el camino fiable.

La imagen sale bien pero sosa. Suele faltar información de luz. Este modelo
responde mucho a la iluminación, y un prompt que no la menciona deja esa decisión
al azar. Añadir una sola descripción de luz concreta cambia el resultado más que
cualquier ajuste numérico.

Dónde encontrarlo e instalarlo

Se distribuye en los repositorios comunitarios habituales de checkpoints. En
septiembre de 2026 solía encontrarse en Civitai, aunque conviene comprobar la
ficha del modelo antes de descargar, porque el alojamiento y las versiones
cambian sin aviso. El camino de navegación está en la guía de
Civitai en español
.

La instalación es la de cualquier checkpoint: el archivo va a la carpeta de
modelos y aparece en la lista tras actualizar. Si todavía no tienes interfaz
montada, el paso a paso está en instalación
de Stable Diffusion en español
.

Sobre licencia, conviene leer lo que indique la propia ficha antes de usar el
resultado comercialmente. Los modelos derivados suelen heredar condiciones del
modelo base y pueden añadir restricciones propias, y esos términos cambian entre
versiones.

Si tu equipo se queda corto para SDXL, alquilar una gráfica por horas evita
comprar hardware para un uso puntual, y el procedimiento está en la guía de RunPod en
español
. Y si solo quieres ver el tipo de resultado antes de descargar varios
gigabytes, puedes probarlo en un generador online.

Componer en un modelo y acabar en otro combina lo mejor de cada uno

Después de generar

Dos pasos cierran el trabajo. El primero es corregir los rostros en plano
abierto, donde la falta de píxeles deja la cara blanda; la corrección automática
lo resuelve bien, como explica la guía de ADetailer en
español
.

El segundo es ampliar, siempre al final y nunca antes de las correcciones,
porque escalar consolida los defectos. El procedimiento está en la guía de escalar
imágenes NSFW con IA
. Quien prefiera resolverlo sin montar nada puede probarlo directamente online.

Combinar dos modelos en dos etapas

La técnica que más rendimiento saca a un checkpoint fotorrealista no tiene que
ver con sus ajustes, sino con no pedirle todo a la vez. Un modelo resuelve bien
la escena y otro resuelve bien la piel, y rara vez son el mismo.

El procedimiento es sencillo: genera la composición donde salga mejor
planteada, aunque el acabado no te guste, y pasa esa imagen por RealVisXL con una
fuerza intermedia. La estructura se hereda de la primera etapa y la textura viene
de la segunda.

El valor de esa segunda pasada es lo único delicado. Demasiado bajo y no
cambia el acabado; demasiado alto y pierdes la composición que habías conseguido.
La franja media suele ser el punto donde ambas cosas conviven.

Conviene guardar la imagen intermedia. Si la segunda etapa no sale, poder
repetirla con otro valor sin regenerar la composición entera ahorra bastante
tiempo, sobre todo cuando la primera imagen costó varios intentos.

Preguntas frecuentes

¿Funciona con LoRAs de SDXL?

En general sí, ya que deriva de SDXL y comparte arquitectura. La intensidad
suele necesitar ajuste, porque un LoRA calibrado en otro checkpoint tiende a
llegar demasiado fuerte o demasiado flojo. Bajar el peso y subir poco a poco es
el camino más rápido. Los LoRAs hechos para modelos antiguos no son
compatibles.

¿Es mejor que Juggernaut para NSFW?

Depende del acabado que busques, no de la calidad. Ambos son fotorrealistas de
la misma generación y la diferencia suele estar en el carácter por defecto. La
prueba con la semilla fija en la misma escena responde mejor que cualquier
recomendación.

¿Qué CFG uso?

Empieza por 4 o 5. Es más bajo de lo que sugiere la costumbre heredada de los
modelos antiguos, y ahí es justo donde el aspecto queda natural. Si la imagen
ignora partes del prompt, sube despacio, recordando que pasar de 8 tiende a
endurecer la piel y a saturar el color.

¿Necesito refinador?

Normalmente no. El flujo de refinador del SDXL original aporta menos en
checkpoints reentrenados como este, y mucha gente obtiene mejor resultado con una
pasada suave de imagen a imagen que con el refinador estándar. Si lo tienes
activado por costumbre, merece la pena generar la misma escena con y sin él,
manteniendo la semilla fija, y comprobar si la diferencia justifica el tiempo
extra que añade a cada imagen.

¿Sirve para imágenes sin contenido adulto?

Sirve sin reservas. Es un checkpoint fotorrealista de uso general, y buena
parte de la gente lo utiliza para retrato corriente, producto y paisaje. Nada en
el modelo dirige el resultado hacia contenido adulto por su cuenta: eso depende
enteramente de lo que pida el prompt.

¿Por qué mis imágenes salen borrosas en los bordes?

Suele ser una proporción fuera de las franjas en las que se entrenó SDXL. Los
formatos muy alargados llevan al modelo a territorio poco representado, y el
borde es lo primero que se resiente. Mantente cerca de las proporciones
habituales y recorta después si necesitas un formato poco común.