Wan 2.2 y Hunyuan Video en local para NSFW (2026): guía

16 min read

Wan 2.2 y HunyuanVideo son los dos modelos de vídeo abiertos que más se usan
para generar NSFW en local. Ambos funcionan dentro de ComfyUI, sin filtro de
contenido, pero difieren en memoria necesaria, velocidad y, sobre todo si vives
en España, en licencia. Esta guía explica cuál elegir y cómo montarlo.

Qué hace falta para generar vídeo en tu propio equipo

Hay dos caminos muy distintos para conseguir un clip. El primero es animar una
foto en un servicio web, sin instalar nada, que es lo que cubre la guía de vídeo NSFW a
partir de una foto
. El segundo es ejecutar el modelo de vídeo en tu propia
gráfica, y es el tema de esta página.

El camino local cuesta más al principio y devuelve más después. No hay colas,
no hay límites de uso impuestos por nadie, nada sale de tu equipo y controlas la
semilla, la duración y los LoRAs. A cambio necesitas una gráfica con bastante
memoria, espacio en disco para archivos grandes y paciencia con la primera
instalación.

Tres piezas componen cualquier montaje. La interfaz, que en la práctica es
ComfyUI, porque es donde el soporte de estos modelos llega antes y mejor. Los
archivos del modelo, que en vídeo siempre son varios: el modelo de difusión, un
codificador de texto y un VAE. Y la gráfica, que es el factor que más limita lo
que puedes hacer. Si todavía no tienes ComfyUI, el paso a paso está en la guía de
instalación
de ComfyUI
.

La variante pequeña de Wan cabe en gráficas domésticas, la grande no

Wan 2.2: las versiones y cuál te conviene

Wan es la familia de modelos de vídeo de Alibaba, publicada con pesos abiertos.
Su repositorio indica licencia Apache 2.0, una de las más permisivas que existen,
y la versión 2.2 llega en varias variantes que no se parecen entre sí en
exigencia.

La variante de 5.000 millones de parámetros, llamada TI2V-5B, admite tanto texto
como imagen de partida y genera a 720p y 24 fotogramas por segundo según su
repositorio. Es la pensada para gráficas domésticas. La documentación de ComfyUI
indica que debería caber bien en 8 GB de memoria de vídeo gracias a la descarga
automática de partes del modelo a la memoria del sistema, a costa de tardar
más.

Las variantes grandes, T2V-A14B para texto a vídeo e I2V-A14B para imagen a
vídeo, usan una arquitectura de mezcla de expertos: unos 27.000 millones de
parámetros en total, con 14.000 millones activos en cada paso. Dan mejor
movimiento y más detalle. Según el repositorio oficial, la ejecución en una sola
gráfica sin trucos pide una tarjeta de centro de datos, aunque ofrece opciones de
descarga de memoria para reducirlo.

Un detalle de las variantes grandes que confunde al principio: en ComfyUI el
flujo carga dos modelos de difusión, uno de ruido alto y otro de ruido bajo. El
primero decide la composición y el movimiento general; el segundo afina el
detalle en los pasos finales. Si un flujo descargado te pide dos archivos casi
iguales, es por eso, y los dos son necesarios.

La recomendación práctica: empieza con la variante 5B aunque tu gráfica dé para
más. Aprenderás cómo responde el modelo en clips que tardan minutos en lugar de
media hora, y cuando sepas qué quieres, el salto a la variante grande tendrá
sentido.

HunyuanVideo: el original y la versión 1.5

HunyuanVideo es el modelo de vídeo abierto de Tencent. La primera versión se
ganó fama por la coherencia entre fotogramas, con rostros y fondos que no
tiemblan de un cuadro al siguiente, pero era pesada para una gráfica
doméstica.

La versión 1.5 corrige buena parte de eso. Según su repositorio tiene 8.300
millones de parámetros, genera a 480p y 720p, y declara 14 GB como memoria mínima
con la descarga de modelo activada. ComfyUI la soporta de forma nativa, lo que
simplifica mucho la instalación frente a la primera versión, que dependía de
nodos de terceros.

Frente a Wan, el carácter es distinto más que mejor o peor. HunyuanVideo tiende
a un acabado muy estable y cinematográfico; Wan suele responder mejor a
descripciones de movimiento concretas y tiene un ecosistema de LoRAs más grande
en la comunidad. Muchas personas acaban teniendo ambos.

La licencia importa, y más si estás en España

Este es el punto que casi ninguna guía menciona y que para un lector en España
cambia la decisión. La licencia de HunyuanVideo, tanto de la versión original
como de la 1.5, es la Tencent Hunyuan Community License. Según el propio texto
publicado en sus repositorios, ese acuerdo no se aplica en la Unión Europea, el
Reino Unido ni Corea del Sur.

En términos prácticos, la licencia no te concede derechos de uso si estás en uno
de esos territorios. No es una prohibición técnica, porque el modelo se descarga
y funciona igual, sino una ausencia de permiso. Qué implica eso para un uso
personal es una cuestión legal que no podemos resolver en una guía, pero conviene
saberlo antes de construir un flujo de trabajo, y todavía más antes de publicar
o vender lo que generes.

Wan 2.2 no tiene esa restricción territorial en su repositorio: la licencia
Apache 2.0, según su texto, es la misma en cualquier país. Para quien vive en la
Unión Europea, eso convierte a Wan en la opción más limpia por defecto. Revisa en
cualquier caso la licencia de la versión concreta que descargas y la de cada LoRA,
porque los términos cambian entre versiones.

Memoria: qué cabe en tu gráfica

En vídeo, la memoria de la gráfica manda más que en imagen, porque el modelo
trabaja con todos los fotogramas a la vez. Tres palancas deciden si un modelo
cabe.

La primera es la precisión de los pesos. Los archivos en fp16 son los más
fieles y los más grandes; las versiones en fp8 ocupan aproximadamente la mitad con
una pérdida de calidad que en la mayoría de clips cuesta ver. La comunidad publica
además versiones cuantizadas en formato GGUF, todavía más pequeñas, que abren la
puerta a gráficas modestas a cambio de algo de detalle.

La segunda es la descarga de partes del modelo a la memoria del sistema.
ComfyUI lo hace de forma automática cuando la gráfica no da, y funciona, pero cada
viaje entre memorias cuesta tiempo. Un clip que cabe entero en la gráfica y otro
que depende de esa descarga pueden tardar tiempos muy diferentes.

La tercera es el propio clip: resolución y número de fotogramas. Duplicar los
fotogramas se acerca a duplicar la memoria y la espera. Si recibes un error de
memoria, baja primero esas dos cosas antes de cambiar de modelo. La guía del error
CUDA sin memoria
explica el resto de opciones.

Modelo Tamaño Referencia de memoria publicada Encaja con
Wan 2.2 TI2V-5B 5.000 millones 8 GB con descarga automática (ComfyUI) Gráficas domésticas, aprendizaje
Wan 2.2 A14B 27.000 millones (14.000 activos) Tarjeta de centro de datos sin descarga (repositorio) Gráficas grandes, fp8 o GGUF
HunyuanVideo 1.5 8.300 millones 14 GB con descarga (repositorio) Gráficas medias y altas

Las cifras son las que publican los propios proyectos en septiembre de 2026 y
cambian con cada optimización. Tómalas como punto de partida, no como
límite.

Montarlo en ComfyUI

La forma más rápida de empezar es usar las plantillas de flujo que trae ComfyUI
para estos modelos. Al abrir una plantilla, la propia interfaz indica qué archivos
faltan y en qué carpeta van, lo que evita el error más frecuente de todos: un
archivo correcto en el lugar equivocado.

Cada modelo pide su conjunto de archivos. Para Wan 2.2 son el modelo de difusión
(uno en la 5B, dos en las variantes grandes), el codificador de texto y el VAE
correspondiente. Un detalle importante: la variante 5B usa su propio VAE, distinto
del que usan las variantes grandes, y mezclarlos produce vídeo corrupto o
colores imposibles.

HunyuanVideo 1.5 sigue la misma lógica, con sus propios codificadores. Descarga
siempre el conjunto que indica la plantilla o la documentación de la versión
exacta, en lugar de reutilizar archivos que ya tenías de otro modelo.

Una vez cargado todo, genera primero un clip corto a baja resolución. Si ese
clip sale, la instalación está bien y todo lo demás son ajustes. Si no sale,
resolverlo con un clip de pocos segundos es mucho más rápido que con uno
largo.

Texto a vídeo o imagen a vídeo

Con texto a vídeo, el prompt lo decide todo: la persona, la escena, la luz y el
movimiento. Es el modo más libre y el menos predecible, porque el modelo tiene que
inventar el aspecto y animarlo a la vez.

Con imagen a vídeo partes de un fotograma que ya has aprobado, y el prompt solo
tiene que describir qué se mueve. Para contenido con una persona concreta suele
dar resultados mucho más consistentes, porque el aspecto queda fijado por la
imagen de partida.

La calidad de esa imagen importa mucho. Un fotograma con manos deformes o cara
blanda produce un vídeo con manos deformes y cara blanda, y el movimiento tiende a
amplificar los defectos. Corrige la imagen antes de animarla: cara, manos y
resolución. Si necesitas ampliarla, el procedimiento está en la guía de escalar
imágenes NSFW
. Y si no tienes todavía una imagen de partida, puedes generarla
en un generador online
y animarla después en local.

La licencia de HunyuanVideo no se aplica en la Unión Europea

Fotogramas, duración y resolución

La duración se controla con el número de fotogramas, no con segundos. Estos
modelos trabajan habitualmente con recuentos del tipo cuatro por un número más uno,
y las plantillas ya vienen con valores válidos; conviene cambiarlos en saltos que
respeten ese patrón para no recibir errores.

La coherencia se degrada con la longitud. Un clip corto que se sostiene bien vale
más que uno largo que se deforma a mitad. La técnica habitual para conseguir algo
más largo es encadenar: usar el último fotograma de un clip como imagen de
partida del siguiente, manteniendo prompt y ajustes.

Con la resolución pasa algo parecido. Genera a la resolución nativa para la que
se entrenó la variante que usas y amplía el clip terminado en un paso aparte.
Generar directamente a una resolución alta cuesta mucha más memoria y rara vez
compensa frente a ampliar después.

Cómo escribir prompts para vídeo

La diferencia principal con los prompts de imagen es que hay que describir el
movimiento, y hacerlo con verbos concretos y ritmos tranquilos. Pedir un
movimiento suave y deliberado da clips más limpios que pedir acción rápida y
compleja, que es donde estos modelos se deforman.

Un orden que funciona: primero quién aparece, después qué hace, después dónde
y con qué luz, y al final cómo se mueve la cámara. Las descripciones de cámara,
como un acercamiento lento o una cámara fija, se entienden bien y ayudan a que el
fondo no se mueva por su cuenta.

Evita pedir dos movimientos grandes a la vez. Una persona que gira mientras la
cámara rodea la escena es una receta segura para rasgos que cambian entre
fotogramas. Una sola acción clara por clip, y el resto se construye
encadenando.

El negativo también cuenta. Mencionar parpadeo, deformación y miembros
adicionales reduce la frecuencia de esos defectos, aunque no los elimina, porque
buena parte del problema está en el movimiento pedido y no en el estilo.

LoRAs en vídeo

Los LoRAs permiten fijar un estilo, un tipo de cuerpo o un personaje sin
reentrenar el modelo. Se añaden con un nodo cargador entre el modelo y el sampler,
igual que en imagen, con dos diferencias que conviene conocer.

La primera es la compatibilidad. Un LoRA de imagen no sirve para un modelo de
vídeo, y un LoRA de Wan no sirve para HunyuanVideo. Incluso dentro de Wan, los
entrenados para una variante no siempre rinden bien en otra. La ficha del LoRA
indica el modelo base, y es lo primero que hay que mirar.

La segunda es el efecto sobre el movimiento. Un LoRA con demasiada fuerza no
solo cambia el aspecto: suele endurecer o romper el movimiento. Empieza con una
fuerza moderada y súbela poco a poco, vigilando si el clip empieza a temblar. En
las variantes grandes de Wan, muchos flujos aplican el LoRA a los dos modelos, el
de ruido alto y el de ruido bajo.

Entrenar un LoRA propio para un personaje recurrente es la forma más fiable de
mantenerlo igual entre clips. Los principios son los mismos que en imagen, y están
en la guía para entrenar
un LoRA NSFW
.

Acelerar sin comprar hardware

El mayor inconveniente práctico es el tiempo de generación. Varias costumbres lo
reducen mucho.

Itera en pequeño. Ajusta prompt, semilla y LoRAs con clips cortos y a baja
resolución, y guarda la versión completa para cuando ya sepas lo que quieres. Es
el cambio que más tiempo ahorra.

La comunidad publica LoRAs de aceleración que permiten generar con muy pocos
pasos. Ahorran mucho tiempo y suelen costar algo de riqueza de movimiento, así que
compensa usarlos para probar y quitarlos en la pasada final si notas la
diferencia.

Cuando la gráfica propia no da para la variante que quieres, alquilar una por
horas mantiene todo lo bueno del camino local: el mismo ComfyUI, los mismos
archivos y ningún filtro. Agrupa las generaciones largas en una sola sesión y
apaga la máquina en cuanto termines. El procedimiento está en la guía de RunPod en
español
.

Problemas frecuentes

El vídeo sale negro, verde o con colores imposibles. Casi siempre es un VAE o un
codificador de texto que no corresponde a la variante del modelo. Comprueba que el
conjunto de archivos coincide con el de la plantilla de esa variante exacta.

El movimiento tiembla o la cara cambia entre fotogramas. Baja la intensidad del
movimiento pedido, simplifica el prompt a una sola acción y prueba otra semilla. Si
usas LoRAs, reduce su fuerza antes de tocar nada más.

Un LoRA no hace nada. Suele estar entrenado para otro modelo base o para otra
variante. Revisa la ficha antes de seguir subiendo la fuerza.

Error de memoria a mitad de generación. Baja fotogramas y resolución, pasa a
pesos fp8 o a una versión cuantizada, y cierra otros programas que usen la
gráfica, incluido el navegador con muchas pestañas abiertas.

La generación tarda muchísimo aunque la gráfica es buena. Probablemente el
modelo no cabe entero y ComfyUI está moviendo partes a la memoria del sistema.
Una versión más ligera de los pesos suele ser más rápida en la práctica que la
completa descargándose a trozos.

Si el problema está en la propia interfaz y no en el modelo, la guía de generadores
de código abierto en GitHub
repasa cómo instalar y actualizar sin romper las
extensiones.

Encadenar clips cortos suele dar más calidad que forzar uno largo

Consentimiento: en vídeo pesa más

Un vídeo realista de una persona real es mucho más creíble, y mucho más dañino,
que una imagen. Usa estos modelos con personajes ficticios, con tu propia imagen o
con adultos que hayan dado su consentimiento. Crear o difundir montajes sexuales
de personas reales sin su permiso puede ser delito en muchos países, incluida
España, y es la línea que no conviene acercarse a cruzar. El marco legal está
resumido en la guía sobre deepfakes,
ética y ley
.

Después de generar

Dos pasos convierten un clip correcto en uno pulido. La interpolación de
fotogramas añade cuadros intermedios y suaviza el movimiento, algo especialmente
visible en clips generados a pocos fotogramas por segundo. Y la ampliación lleva
el clip a una resolución mayor sin el coste de generar directamente en ella.

Ambos se hacen dentro de ComfyUI con nodos específicos, en el mismo flujo o en
uno aparte. Hacerlos al final, sobre el clip que ya te gusta, evita gastar tiempo
en mejorar tomas que ibas a descartar. Si en algún momento prefieres saltarte la
parte técnica, puedes
probar la generación online
y volver al montaje local cuando lo
necesites.

Preguntas frecuentes

¿Qué modelo elijo para empezar, Wan 2.2 o HunyuanVideo?

Para la mayoría, Wan 2.2 en su variante 5B: es la que menos memoria pide, tiene
un ecosistema de LoRAs amplio y su licencia Apache 2.0 no tiene restricción
territorial según su repositorio. HunyuanVideo 1.5 es una buena segunda opción si
tu gráfica tiene más memoria, teniendo presente su licencia si estás en la Unión
Europea.

¿Puedo generar vídeo NSFW en local con una gráfica de 8 GB?

Con la variante 5B de Wan 2.2 es posible: la documentación de ComfyUI indica que
cabe en esa memoria con descarga automática, a cambio de tardar bastante más. Mantén
clips cortos y resolución moderada, y considera alquilar una gráfica para las
variantes grandes.

¿Estos modelos tienen filtro de contenido?

Ejecutados en tu propio equipo, no. No hay ningún servidor que revise el prompt
ni el resultado. Lo que sí existe es la licencia del modelo y la ley de tu país,
que siguen aplicando aunque nadie lo compruebe.

¿Cuánto dura un clip?

Unos pocos segundos por generación en las configuraciones habituales. Para algo
más largo, lo que suele funcionar es encadenar clips usando el último fotograma
de uno como inicio del siguiente, en lugar de forzar un solo clip largo que acaba
deformándose.

¿Por qué importa la licencia de HunyuanVideo en España?

Porque, según el texto de la Tencent Hunyuan Community License, el acuerdo no se
aplica en la Unión Europea, el Reino Unido ni Corea del Sur. El modelo funciona
igual técnicamente, pero la licencia no te concede derechos en esos territorios.
Si piensas publicar o monetizar lo que generes, consulta a un profesional antes de
elegir este modelo.