Animagine XL para NSFW (2026): guía completa

13 min read

Animagine XL es un checkpoint SDXL centrado en ilustración de anime que
responde a etiquetas y conoce muchos personajes por su nombre. Esta guía cubre
los ajustes que dan resultados consistentes, cómo escribir el prompt y en qué se
diferencia de las otras familias de anime.

Qué es Animagine XL

Animagine XL es un modelo construido sobre la arquitectura SDXL y reentrenado
con un fuerte énfasis en ilustración de estilo anime. Lo distintivo no es la
calidad de imagen, que está a la altura de su generación, sino cómo se le habla:
responde a listas de etiquetas en lugar de a frases descriptivas.

Esa decisión de entrenamiento tiene dos consecuencias prácticas. La primera es
que conoce muchos personajes por su nombre, heredado del vocabulario con el que
se entrenó, lo que permite generar figuras reconocibles sin recurrir a un LoRA.
La segunda es que el orden de los términos pesa, cosa que no ocurre igual en
modelos fotorrealistas.

Quien llega desde un checkpoint fotográfico suele escribir una frase bien
construida y obtener algo genérico. No es un fallo del modelo: es que la frase no
se parece a lo que vio durante el entrenamiento. El vocabulario correcto está
detallado en la guía de etiquetas
Danbooru para NSFW
.

El prompt va de lo general a lo concreto, en ese orden

Ajustes que funcionan

La resolución sigue el patrón de SDXL: cerca de 1024 por 1024 y las
proporciones equivalentes, con los retratos en torno a 832 por 1216. Generar por
debajo de eso suele producir resultados planos que hacen pensar que el modelo es
flojo, cuando el problema es el tamaño.

Para el muestreador, Euler a es la elección tradicional en modelos de anime y
sigue funcionando bien aquí, con algo entre 25 y 30 pasos. Los muestreadores de
la familia DPM++ también sirven y tienden a dar bordes algo más definidos. La
diferencia entre ellos es menor que la que provoca una etiqueta bien elegida.

El CFG suele quedar bien entre 5 y 7. Los valores altos endurecen la línea y
saturan el color, algo que en ilustración se nota enseguida. Si el modelo ignora
parte del prompt, reordenar las etiquetas suele rendir más que subir el CFG.

Marcadores de calidad

Esta familia se entrenó con marcadores de puntuación asociados a la calidad de
cada imagen, así que incluirlos al principio del prompt suele ayudar. La forma
exacta cambia entre versiones, de modo que conviene mirar lo que recomienda la
ficha del modelo en lugar de copiar una receta antigua.

Es la causa más frecuente de que una configuración encontrada en un foro no
funcione. Si los resultados salen extraños justo después de copiar unos ajustes
ajenos, ese es el primer elemento que conviene revisar, antes que el muestreador
o el CFG.

Personajes por su nombre

La característica más llamativa de esta línea es conocer muchos personajes,
heredado del vocabulario de etiquetas del entrenamiento. Permite generar a
alguien reconocible sin entrenar nada, lo que ahorra bastante trabajo.

El reconocimiento es desigual. Los personajes muy representados en el material
de entrenamiento salen consistentes, mientras que los menos comunes pueden salir
solo aproximados. Cuando el resultado no convence, añadir las características
visuales principales junto al nombre suele estabilizarlo.

Conviene recordar que el nombre arrastra el aspecto asociado en el material de
entrenamiento, incluida la ropa y el peinado típicos. Si quieres el personaje con
otra apariencia, hay que decirlo explícitamente, porque lo habitual tiende a
imponerse. Poner la prenda no deseada en negativo suele funcionar mejor que pedir
la nueva en positivo.

Para los casos en que la fidelidad importa mucho, el camino sigue siendo
entrenar un LoRA con imágenes de referencia, proceso descrito en cómo
entrenar un LoRA en español
.

Cómo escribir el prompt

El formato esperado es una lista de términos separados por comas, de lo
general a lo concreto. Suele funcionar empezar por los marcadores de calidad y el
número de personajes, seguir con el personaje o sus rasgos, después el encuadre,
y solo entonces ropa, pose, escenario e iluminación.

El recuento de personajes merece mención aparte porque resuelve un problema
muy común. Sin él, las escenas con dos figuras tienden a mezclar rasgos entre
ellas, y el resultado es la sensación de que algo está mal sin poder señalar qué.
Declararlo al principio corrige la mayoría de esos casos.

El negativo aquí está más estandarizado que en modelos fotográficos. Los
marcadores de baja puntuación aparecen en casi todas las configuraciones
recomendadas y suelen mejorar el acabado, aunque las listas larguísimas siguen
costando influencia sin devolver lo mismo.

En qué se diferencia de las otras familias

Frente a la línea Pony, la diferencia principal está en el conjunto de
marcadores y en el estilo por defecto. Ambas trabajan con etiquetas y sirven bien
al anime, pero los ajustes recomendados de una rara vez funcionan tal cual en la
otra, y es habitual que alguien prefiera una por afinidad de estilo más que por
calidad objetiva. El repaso está en la guía
de Pony Diffusion XL
.

Frente a Illustrious y sus derivados, la diferencia suele notarse en el
acabado y en qué personajes conoce cada uno. Conviene probar el mismo prompt en
ambos antes de decidir, porque la preferencia es bastante personal. Hay un
repaso propio en la guía
de Illustrious XL
.

Frente a un checkpoint fotorrealista la diferencia no es de calidad sino de
propósito. Pedirle fotorrealismo a un modelo ajustado para ilustración devuelve
normalmente algo intermedio que no acaba de ser ninguna de las dos cosas.

Qué esperar y qué no

Conviene tener claro dónde rinde este modelo y dónde conviene otro, porque
buena parte de las decepciones vienen de pedirle lo que no hace.

Rinde bien en ilustración de personaje, que es para lo que se ajustó: figuras
reconocibles, línea limpia, color sólido y expresiones claras. También responde
bien a los términos de encuadre y ángulo, así que se puede componer con bastante
precisión sin recurrir a nada externo.

Rinde peor en escenas complejas con varias figuras interactuando, donde los
rasgos tienden a mezclarse entre personajes. También en fondos detallados, que
suelen salir correctos pero genéricos, porque el entrenamiento privilegió al
personaje sobre el entorno.

Y no rinde en fotorrealismo, por diseño. Si necesitas piel con textura y luz
fotográfica, el camino pasa por un checkpoint orientado a eso, y luego, si acaso,
combinar ambos en dos etapas.

Combinar con LoRAs

Al estar construido sobre SDXL, acepta la mayor parte de los LoRAs de esa
arquitectura, aunque la compatibilidad es menos fiable que dentro de la misma
familia. La parte que pide cuidado es la intensidad: un LoRA calibrado en otro
checkpoint suele llegar demasiado fuerte y se nota en color desplazado o en
rasgos que ignoran el prompt.

El procedimiento que funciona es empezar con un peso bajo y subir en escalones
pequeños hasta que el efecto aparezca sin contaminar el resto. Cuando se usan dos
o más a la vez, lo que importa es la suma de los pesos más que cada valor por
separado, y pasado cierto punto la imagen entera se degrada.

Los personajes muy representados salen más consistentes

Dónde encontrarlo y qué comprobar

Los checkpoints de esta línea circulan por los repositorios comunitarios
habituales. En septiembre de 2026 solían encontrarse en Civitai, aunque conviene
comprobar la ficha del modelo antes de descargar, ya que las versiones y el
alojamiento cambian con frecuencia. El camino de navegación está en la guía de
Civitai en español
.

Sobre las condiciones de uso, lo más seguro es leer lo que indique la propia
ficha. Los modelos derivados suelen heredar términos del modelo base y a veces
añaden restricciones propias, y eso varía entre versiones.

Un cuidado adicional al descargar: estas familias tienen muchos derivados con
nombres parecidos, y no es raro bajar una variante distinta de la que se
pretendía y concluir que los ajustes recomendados no sirven. Comprobar el nombre
completo y la versión antes de generar evita buena parte de esa confusión.

Instalación y rendimiento

La instalación es la de cualquier checkpoint SDXL: el archivo va a la carpeta
de modelos de la interfaz y aparece en la lista tras actualizar. Si todavía no
tienes nada montado, el paso a paso está en instalación
de Stable Diffusion en español
.

En cuanto a exigencia, el comportamiento es el típico de SDXL. La mayoría de
la gente genera con comodidad usando 8 GB de memoria de vídeo con una imagen cada
vez a resolución nativa, y con menos suele ser posible activando las opciones de
ahorro de la interfaz. El lote grande y la resolución alta siguen siendo lo que
más tumba la generación.

Una observación sobre el tiempo: los modelos de anime tienden a converger
antes que los fotográficos, así que el número de pasos que parece escaso a menudo
ya basta. Probar con menos pasos antes de dar por hecho que hacen falta más es
una forma barata de acelerar todo el flujo.

Consistencia entre imágenes

Mantener al mismo personaje en varias imágenes es una de las preguntas más
repetidas, y la respuesta depende de cuánta fidelidad necesites. Para una
consistencia aproximada, repetir exactamente las mismas etiquetas de apariencia y
mantener la semilla fija ya llega bastante lejos, cambiando solo pose y
escenario.

Para consistencia alta, el camino fiable sigue siendo un LoRA entrenado con
imágenes del personaje. Es más trabajo la primera vez y mucho menos en todas las
siguientes, sobre todo si la idea es producir una serie completa.

Existe un punto intermedio útil: generar una imagen de referencia buena y
usarla como base para las demás con una pasada de imagen a imagen y fuerza media.
El personaje se mantiene reconocible y la escena cambia, a cambio de menos
libertad de encuadre.

Cómo comparar ajustes sin engañarte

El error más caro al afinar un modelo es cambiar varias cosas a la vez. Si
mueves muestreador, pasos y CFG en la misma prueba, tendrás una imagen distinta y
ninguna información sobre qué la causó.

El método que funciona es fijar la semilla y mover un solo parámetro por
tanda. Con tres generaciones por parámetro se ve la tendencia completa, y en
quince minutos tienes una configuración propia mejor que cualquier receta
copiada.

Conviene además mirar siempre las imágenes al mismo tamaño en pantalla. Es
muy fácil preferir la más grande simplemente porque se ve más nítida, y acabar
eligiendo unos ajustes por un motivo que no tenía nada que ver con ellos.

Un CFG moderado evita que la línea se endurezca

Problemas frecuentes

El resultado sale genérico, sin nada de lo pedido. Normalmente el prompt está
escrito en frases en lugar de etiquetas. Reescríbelo como lista separada por
comas y compara.

Los rostros salen blandos en plano abierto. Es el problema clásico de pocos
píxeles en la cara, y la corrección automática lo resuelve bien, como se explica
en la guía de ADetailer en
español
.

El estilo tira hacia un aspecto fijo que no pediste. Es el comportamiento
esperado de un checkpoint ajustado. Las etiquetas de estilo en negativo ayudan,
pero si el conflicto es grande, cambiar de modelo resuelve más rápido.

Los colores salen saturados. Suele ser CFG alto combinado con exceso de
marcadores de calidad. Baja el CFG antes de tocar cualquier otra cosa.

Aparecen miembros de más en escenas con dos personas. Falta la etiqueta de
recuento de personajes al principio del prompt. Declarar cuántas figuras hay
resuelve la mayoría de estos casos. Si quieres comparar el comportamiento con un
servicio que ya viene ajustado, puedes probar un generador listo antes de
seguir afinando el tuyo.

Después de generar

Cuando la imagen está bien pero le falta tamaño, el escalado va al final, nunca
antes de las correcciones, porque ampliar consolida los defectos. El
procedimiento está en la guía de escalar
imágenes NSFW con IA
. Para una prueba rápida sin instalar nada también
sirve un generador en el navegador.

Preguntas frecuentes

¿Funciona con LoRAs de SDXL normales?

Con frecuencia sí, ya que la base es SDXL, aunque la compatibilidad es menos
fiable que entre checkpoints de la misma familia. Los LoRAs entrenados sobre la
misma línea tienden a comportarse mejor. Bajar el peso es la primera prueba
cuando algo sale deformado.

¿Puedo generar estilo realista con él?

Hasta cierto punto, pero no es su fuerte. Los modelos de esta línea están
ajustados para ilustración, y pedir fotorrealismo suele devolver algo intermedio.
Para imagen fotográfica, un checkpoint orientado a ello entrega bastante más.

¿Cuántos pasos conviene usar?

Entre 25 y 30 cubre la mayoría de los casos con Euler a. Subir mucho más allá
rara vez cambia lo suficiente como para compensar el tiempo, y en ilustración la
diferencia desaparece tras cualquier redimensionado. De hecho, merece la pena
probar con veinte antes de dar por hecho que hacen falta más: estos modelos
convergen antes que los fotográficos y el ahorro de tiempo por imagen se nota
mucho a lo largo de una sesión entera.

¿Sirve para imágenes sin contenido adulto?

Sirve con normalidad. Nada en el modelo obliga a que el contenido sea
explícito, y buena parte de la gente lo usa para ilustración corriente. Las
etiquetas que controlan ese aspecto son una parte más del vocabulario, y omitirlas
o ponerlas en negativo suele bastar.

¿Qué hago si dos personajes se mezclan en la misma imagen?

Lo primero es declarar el número de figuras al principio del prompt, que es lo
que evita la mayor parte de estos casos. Si aun así se mezclan rasgos, ayuda
separar bien las descripciones y mantenerlas cortas, porque cuanto más larga es
cada una, más se solapan. Para escenas realmente complejas, generar a cada
personaje por separado y componer después suele salir más rentable que pelearse
con el prompt.

¿Conviene activar la ampliación durante la generación?

En muchos casos sí, siempre con moderación. Ampliar dentro de la generación con
una fuerza baja, en torno a 0.3, suele añadir detalle sin reinventar la imagen.
Valores más altos tienden a mover el rostro y la composición, que normalmente no
es lo que se busca en un paso de ampliación. Si solo quieres más tamaño final,
escalar después como paso aparte da más control y gasta menos memoria.

¿Por qué ignora parte de mis etiquetas?

Los prompts muy largos diluyen la influencia de cada término, y los que están
al final suelen ser los primeros en perderse. Si algo importante no aparece, mueve
el término hacia el principio antes de subirle el peso. Otra causa frecuente es
el conflicto entre dos términos que piden cosas incompatibles.