Os modelos da linha Illustrious, e os derivados WAI, são a escolha usual para
anime NSFW com bom controle por etiquetas. Eles entendem nomes de personagens e
vocabulário de tags, o que muda completamente a forma de escrever o prompt. Este
guia cobre ajustes, etiquetas e limites.
O que é Illustrious e o que o WAI acrescenta
O Illustrious XL é um modelo base construído sobre a arquitetura SDXL e
treinado com forte ênfase em ilustração e em vocabulário de etiquetas. A
consequência prática é que ele responde a listas de tags no estilo dos grandes
acervos de imagem de anime, em vez de responder a frases descritivas. Isso o
aproxima de como os modelos de anime sempre funcionaram, mas com a qualidade de
imagem da geração SDXL.
O WAI é uma família de checkpoints derivada dessa base, ajustada para produzir
resultado mais acabado já sem muito esforço de prompt. Na prática, as pessoas
costumam escolher um derivado em vez do base porque ele entrega estilo mais
consistente e exige menos calibragem inicial. A contrapartida é a de sempre em
modelos ajustados: parte da flexibilidade do base se perde em troca de um visual
característico.
A diferença mais importante em relação a um modelo fotográfico como o Juggernaut
XL não é a qualidade, é a linguagem. Escrever uma frase bem construída rende
pouco aqui. Escrever uma sequência de etiquetas rende muito. Quem chega vindo de
modelos fotográficos costuma concluir que o modelo é ruim quando na verdade está
falando o idioma errado com ele.

Como escrever o prompt
O formato esperado é uma lista de termos separados por vírgula, do mais geral
para o mais específico. Costuma funcionar começar pelo número de personagens e
pelo enquadramento, seguir para o personagem ou suas características, depois
roupa, pose, cenário e por fim iluminação e estilo.
A ordem tem peso real: termos no começo tendem a influenciar mais o resultado.
Isso não é uma regra rígida, e a intensidade varia entre versões, mas na prática
mover um termo para o início costuma ser mais eficaz do que aumentar seu peso
com parênteses.
O vocabulário específico de etiquetas é o que separa um resultado medíocre de
um bom. Termos de enquadramento, de ângulo e de expressão vêm do mesmo
vocabulário usado nos acervos em que o modelo foi treinado, e usar a forma exata
tende a funcionar melhor do que uma descrição equivalente em linguagem corrente.
Esse vocabulário está detalhado no guia de tags
Danbooru para NSFW.
Sobre etiquetas de qualidade: os modelos dessa linha costumam ter sido
treinados com marcadores de pontuação, e incluí-los no começo do prompt
geralmente ajuda. A forma exata varia entre versões, então vale conferir o que a
página do modelo recomenda em vez de copiar de uma discussão antiga.
Negativo
O prompt negativo aqui costuma ser mais padronizado do que em modelos
fotográficos. Marcadores de baixa pontuação e de qualidade ruim aparecem na
maioria das configurações recomendadas, e incluí-los normalmente melhora o
acabamento. Ainda assim, listas gigantescas continuam custando influência sem
retorno proporcional.
Um detalhe que causa confusão: como o modelo entende etiquetas, colocar uma
etiqueta no negativo é uma forma eficaz de remover um elemento específico. Isso
funciona melhor do que tentar descrever a ausência no prompt positivo, que
tipicamente produz o efeito contrário.
Ajustes
Resolução segue o padrão SDXL, perto de 1024 por 1024 e proporções
equivalentes. Retratos em torno de 832 por 1216 são comuns e costumam se
comportar bem.
Para amostrador, Euler a é a escolha tradicional em modelos de anime e segue
funcionando bem nesta linha, com algo entre 25 e 30 passos. Os amostradores
DPM++ também servem e tendem a dar bordas um pouco mais definidas. A diferença
entre eles é menor do que a diferença causada por uma etiqueta bem escolhida.
O CFG costuma ficar bem em torno de 5 a 7. Valores altos endurecem a linha e
saturam a cor, o que em ilustração aparece rápido. Se o modelo estiver ignorando
parte do prompt, reordenar as etiquetas geralmente rende mais do que aumentar o
CFG.
Personagens nomeados
Uma característica marcante desta linha é conhecer muitos personagens pelo
nome, herdado do vocabulário de etiquetas do treino. Isso permite gerar alguém
reconhecível sem LoRA, o que economiza bastante trabalho.
O reconhecimento é desigual: personagens muito representados no material de
treino saem consistentes, enquanto os menos comuns podem sair apenas
aproximados. Quando o resultado não convence, acrescentar as características
visuais principais junto ao nome costuma estabilizar, e para casos em que a
fidelidade importa muito o caminho continua sendo treinar um LoRA, processo
descrito em como
treinar LoRA em português.
Vale lembrar que o nome traz junto o estilo associado ao personagem no
material de treino, incluindo roupa e cabelo típicos. Se você quer o personagem
com outra aparência, precisa dizer explicitamente, porque o padrão tende a
vencer.
A ordem das etiquetas na prática
Vale detalhar a estrutura, porque ela é o que mais separa um prompt que
funciona de um que produz ruído bonito. A primeira posição costuma ser reservada
aos marcadores de qualidade, quando a versão do modelo os utiliza. Logo depois
vem a contagem de personagens, que é a informação que mais evita confusão de
membros e de rostos em cenas com mais de uma pessoa.
Em seguida entra o personagem, seja pelo nome, quando o modelo o conhece, seja
por características. Depois vem o enquadramento, porque ele determina quanto do
corpo aparece e portanto o que faz sentido descrever adiante. Só então roupa,
pose e expressão, que são detalhes do que já foi estabelecido.
O cenário costuma vir perto do fim, e a iluminação por último. Essa ordem não
é arbitrária: informação que define a estrutura da imagem rende mais quando
chega cedo, e informação que apenas modifica a aparência rende bem mesmo no
final. Inverter isso, começando por luz e estilo, é um erro comum de quem vem de
modelos fotográficos.
Sobre pesos com parênteses, o conselho prático é usá-los pouco. Eles
funcionam, mas costumam resolver um problema que reordenar o prompt resolveria
melhor e sem efeitos colaterais. Quando o peso passa de um valor moderado, é
comum que o termo comece a contaminar o resto da imagem, aparecendo onde não
deveria. A mecânica geral de montar prompts está no material sobre prompts
NSFW em português.

Controlando a composição
Modelos de anime respondem bem a etiquetas de enquadramento, e usar a forma
certa evita muita frustração. Termos que indicam plano fechado, meio corpo,
corpo inteiro ou plano geral mudam a imagem de forma confiável, e escolher um
deles explicitamente é quase sempre melhor do que deixar o modelo decidir.
Ângulo funciona pela mesma lógica. Vista de cima, vista de baixo e vista de
perfil são compreendidas, e combinam com o enquadramento para definir a cena
antes de qualquer outro detalhe. O cuidado é não pedir combinações
contraditórias, como plano fechado no rosto e corpo inteiro na mesma lista, o
que costuma gerar um meio-termo estranho.
Quando a pose precisa ser exata, o texto tem limite. Nesses casos, travar a
estrutura com ControlNet e deixar o modelo cuidar apenas do estilo entrega muito
mais controle do que insistir em descrever a posição de cada membro. Vale
lembrar que quanto mais específica a pose pedida por texto, maior a chance de
anatomia estranha, porque o modelo tenta satisfazer uma descrição para a qual
tem poucos exemplos.
Consistência entre imagens
Manter a mesma personagem em várias imagens é uma das perguntas mais
frequentes, e a resposta depende de quanta fidelidade você precisa. Para
consistência aproximada, repetir exatamente as mesmas etiquetas de aparência e
manter a seed fixa já leva longe, mudando apenas pose e cenário.
Para consistência alta, o caminho confiável continua sendo um LoRA treinado
com imagens da personagem. É mais trabalho na primeira vez e muito menos em
todas as seguintes, principalmente se a ideia é produzir uma série. O processo
está descrito em detalhe no guia de treino.
Há um meio-termo útil: gerar uma imagem de referência boa e usá-la como base
em img2img para as demais, com denoising médio. A personagem se mantém
reconhecível e a cena muda, ao custo de menos liberdade de enquadramento. O
funcionamento dessa técnica está no guia de
img2img.
Instalação e desempenho
A instalação é a de qualquer checkpoint SDXL: o arquivo vai para a pasta de
modelos da interface e aparece na lista depois de atualizar. Se você ainda não
montou nada, o passo a passo está em Stable
Diffusion Forge em português.
Em termos de exigência, o comportamento é o típico de SDXL. A maioria das
pessoas roda bem com 8 GB de memória de vídeo gerando uma imagem por vez na
resolução nativa, e com menos costuma ser possível usando as opções de economia
de memória da interface. Lote grande e resolução alta continuam sendo o que mais
derruba a geração, então reduzir o lote é o primeiro ajuste quando algo falha.
Uma observação sobre tempo: modelos de anime costumam convergir mais cedo que
os fotográficos, então o número de passos que parece pouco muitas vezes já
basta. Testar com menos passos antes de assumir que precisa de mais é uma forma
barata de acelerar todo o fluxo. Quem quiser comparar o resultado com um serviço
pronto, sem instalar nada, pode testar direto no navegador.

Onde encontrar e o que verificar
Os derivados dessa linha circulam nos repositórios comunitários de
checkpoints. Em setembro de 2026 as variantes WAI costumavam ser encontradas no
Civitai, mas convém verificar a página do modelo antes de baixar, já que versões
e hospedagem mudam com frequência. O caminho está no tutorial
de Civitai em português.
Sobre condições de uso, o mais seguro é ler o que a página do modelo informa.
Modelos derivados costumam herdar termos do base e às vezes acrescentam
restrições próprias, e isso varia entre versões.
Um cuidado adicional na hora de baixar: essas famílias têm muitos derivados
com nomes parecidos, e não é raro alguém baixar uma variante diferente da que
pretendia e concluir que os ajustes recomendados não funcionam. Conferir o nome
completo e a versão antes de gerar evita boa parte dessa confusão, e anotar qual
arquivo está carregado poupa tempo quando for comparar resultados depois.
Problemas frequentes
O resultado saiu genérico, sem nada do que foi pedido. Normalmente o prompt
está escrito em frases em vez de etiquetas. Reescreva como lista separada por
vírgulas e compare.
Os rostos saem borrados em plano aberto. É o problema clássico de poucos
pixels no rosto, e a correção automática resolve bem, como descrito no guia de
ADetailer
para rostos.
O estilo puxa para um visual fixo que você não pediu. É o comportamento
esperado de um checkpoint ajustado. Etiquetas de estilo no negativo ajudam, mas
se o conflito for grande, trocar para o modelo base ou para outro derivado tende
a resolver mais rápido.
As cores ficaram estouradas. Costuma ser CFG alto combinado com marcadores de
qualidade em excesso. Baixe o CFG antes de mexer em qualquer outra coisa.
Aparecem membros a mais em cenas com duas pessoas. A causa mais comum é
faltar a etiqueta de contagem de personagens no começo do prompt. Sem ela, o
modelo frequentemente mistura características entre as figuras. Declarar
quantas pessoas existem na cena, logo no início, resolve a maioria desses
casos, e separar bem as descrições de cada uma ajuda no resto.
O personagem nomeado saiu com a roupa errada. O nome carrega consigo a
aparência mais comum no material de treino, então é preciso dizer
explicitamente o que deve mudar. Colocar a roupa indesejada no negativo costuma
funcionar melhor do que apenas pedir a nova no positivo. Quem quiser comparar o
comportamento com um serviço que já vem ajustado pode testar um gerador pronto antes de
seguir ajustando o seu.
Perguntas frequentes
Qual a diferença entre Illustrious e Pony?
Ambos trabalham com etiquetas e servem bem a anime, mas foram treinados de
formas diferentes e respondem a conjuntos de marcadores próprios. Na prática, os
ajustes recomendados de um raramente funcionam bem no outro, e é comum que uma
pessoa prefira um dos dois por afinidade de estilo mais do que por qualidade
objetiva.
Preciso usar as etiquetas de qualidade no prompt?
Em geral ajuda, porque esses modelos costumam ter sido treinados com esses
marcadores. A forma exata varia entre versões, então vale seguir o que a página
do modelo recomenda. Se os resultados vierem estranhos depois de copiar uma
configuração antiga, esse é um bom primeiro suspeito.
Funciona com LoRAs de SDXL comuns?
Frequentemente sim, já que a base é SDXL, mas a compatibilidade é menos
confiável do que entre checkpoints da mesma família. LoRAs treinados sobre a
mesma linha tendem a se comportar melhor. Ajustar o peso para baixo é o primeiro
teste quando algo sai deformado.
Dá para gerar estilo realista com ele?
Até certo ponto, mas não é o forte. Modelos dessa linha foram ajustados para
ilustração, e pedir fotorrealismo normalmente rende algo intermediário. Para
imagem fotográfica, um checkpoint voltado a isso entrega mais.
Quantos passos devo usar?
Algo entre 25 e 30 cobre a maioria dos casos com Euler a. Subir muito além
disso raramente muda o suficiente para compensar o tempo, e em ilustração a
diferença some depois de qualquer redimensionamento.
Por que o modelo ignora parte das minhas etiquetas?
Prompts muito longos diluem a influência de cada termo, e os que estão no fim
costumam ser os primeiros a se perder. Se algo importante não está aparecendo,
mova o termo para perto do início antes de aumentar o peso dele. Outra causa
frequente é conflito: pedir duas coisas incompatíveis, como dois enquadramentos
diferentes, faz o modelo escolher um meio-termo que não corresponde a
nenhum dos dois.
Posso misturar etiquetas com frases descritivas?
Pode, e em pequenas doses costuma funcionar. O que raramente dá certo é
escrever o prompt inteiro como texto corrido, porque o treino privilegiou listas
de termos. Uma estrutura mista, com as etiquetas essenciais primeiro e uma frase
curta no fim para algo que não tem etiqueta equivalente, tende a ser o melhor
dos dois mundos.
O modelo serve para imagens sem conteúdo adulto?
Serve normalmente. Nada na linha obriga o conteúdo a ser explícito, e boa
parte das pessoas usa esses checkpoints para ilustração comum. As etiquetas que
controlam esse aspecto são apenas mais uma parte do vocabulário, e omiti-las ou
colocá-las no negativo costuma ser suficiente.



