Maos deformadas na IA: por que acontece e como resolver

17 min read

Voce gerou uma imagem quase perfeita e a mao tem seis dedos. De novo.

Maos saem deformadas porque sao estruturas pequenas, muito articuladas e que se escondem umas nas outras. No espaco latente elas ocupam poucos pixels, entao o modelo tem pouca informacao para acertar a contagem de dedos. A correcao real quase nunca esta no prompt: esta em resolucao, inpainting com mascara e um passe de deteccao automatica.

O que realmente acontece dentro do modelo

Modelos de difusao nao desenham. Eles partem de ruido e vao removendo ruido passo a passo, guiados por uma representacao de texto. Em nenhum momento existe um conceito interno de “mao humana tem cinco dedos”. Existe apenas uma distribuicao estatistica de como pixels de mao costumam aparecer perto de pixels de braco. Contagem discreta nao e algo que esse processo represente bem.

Some a isso quatro fatores que se acumulam:

  • Area minuscula, variancia gigante. Um rosto num retrato de meio corpo ocupa muito mais area do que a mao, e o rosto tem topologia previsivel: dois olhos, um nariz, uma boca, sempre na mesma ordem. A mao muda completamente de silhueta a cada rotacao de pulso. O modelo precisa aprender centenas de configuracoes diferentes com uma fracao dos pixels disponiveis.
  • Auto-oclusao pesada. Na maioria das fotos reais os dedos se sobrepoem. O modelo ve treze mil variacoes de dedos parcialmente escondidos e aprende a produzir algo “tipo dedo” saindo de algo “tipo palma”, sem nunca fechar a conta.
  • Resolucao do latente e baixa demais. A difusao roda num espaco comprimido, nao em pixels. Uma mao que ocupa noventa pixels na imagem final ocupa pouquissimas celulas no latente. Nao existe espaco geometrico ali para separar falange de falange. O VAE depois expande aquilo e voce ve uma pasta de dedos.
  • O dataset e enviesado. Fotos de banco de imagens raramente mostram maos abertas, isoladas, bem iluminadas e em foco. Maos aparecem tremidas, cortadas, segurando objetos, fora do plano focal. E exatamente essa distribuicao que o modelo reproduz.

Por isso escrever “maos perfeitas, cinco dedos” no prompt raramente resolve. O texto guia estilo e semantica, nao aritmetica. Se voce vem de um fluxo que ja funciona bem para o resto da imagem, vale revisar tambem sua base de prompts em portugues para geracao NSFW, porque prompts longos demais diluem a atencao e pioram justamente as regioes pequenas.

Estrutura anatomica que os modelos costumam errar

Diagnostico rapido: onde esta o seu problema

Antes de mudar dez parametros de uma vez, descubra qual dos gargalos e o seu. A ordem abaixo vai do teste mais barato ao mais caro. Pare no primeiro que resolver.

  1. Amplie a mao a 400 por cento na imagem gerada. Se o contorno esta certo e so faltam detalhes, o problema e resolucao, nao o modelo.
  2. Gere a mesma seed em resolucao maior mantendo proporcao. Se a mao melhora sozinha, confirmado: era area de pixels.
  3. Troque o sampler e reduza o CFG em dois ou tres pontos. CFG alto demais endurece bordas e cria dedos duplicados.
  4. Rode o mesmo prompt com quatro seeds diferentes. Se uma em quatro sai aceitavel, o modelo consegue e voce so precisa de mais tentativas mais um passe de correcao.
  5. Troque o checkpoint por outro da mesma familia e mesma seed. Alguns checkpoints foram treinados com muito material de baixa qualidade e simplesmente nao tem a estrutura.
  6. Remova todas as LoRAs e gere de novo. LoRA de estilo com peso alto costuma destruir anatomia fina antes de qualquer outra coisa.
  7. Ative o hires fix e observe se o segundo passe reconstroi ou piora a mao.
  8. Faca inpainting manual na mao com mascara apertada. Se aqui resolve, adote isso como etapa fixa do fluxo.
  9. Adicione controle de pose ou referencia de profundidade so na regiao da mao. Mais caro, mais confiavel.
  10. Corrija a contagem de dedos manualmente num editor e passe um denoise leve por cima para reintegrar textura e luz.

Resolucao e o hires fix: o ajuste de maior impacto

Se voce so puder mudar uma coisa, mude essa. Gerar perto da resolucao nativa de treino do modelo importa mais do que qualquer palavra do prompt. Modelos da geracao SD 1.5 foram treinados em torno de 512 pixels no lado menor; famílias mais novas trabalham confortavelmente perto de 1024. Gerar muito acima da nativa em um unico passe produz corpos duplicados e maos extras. Gerar muito abaixo produz mingau.

O caminho seguro e o hires fix ou upscale latente em dois estagios. Gere no tamanho nativo, aplique upscale de 1.5x a 2x e rode um segundo passe com denoise entre 0.35 e 0.5. Abaixo de 0.3 o segundo passe quase nao redesenha nada e a mao continua errada. Acima de 0.6 ele inventa uma mao nova, muitas vezes em posicao diferente do resto do braco.

Enquadramento tambem e resolucao disfarcada. Um plano americano da a mao muito mais pixels do que um plano geral. Se o seu conceito permite, aproxime a camera. Quem trabalha com geradores focados em realismo sente essa diferenca de imediato, porque em fotorrealismo o olho perdoa estilizacao mas nao perdoa anatomia impossivel.

Prompt negativo: o que ajuda e o que e superstição

Prompt negativo funciona, mas nao do jeito que a maioria acredita. Ele empurra a geracao para longe de um conceito, nao adiciona uma regra. Escrever “seis dedos” no negativo nao ensina o modelo a contar. Na pratica, ajuda mais listar defeitos visuais amplos do que numeros.

Termos que costumam ajudar de verdade: maos deformadas, dedos fundidos, dedos extras, membros extras, anatomia ruim, mao mutilada, dedos longos demais. Mantenha isso curto. Negativos com quarenta termos competem entre si e roubam peso dos que importam.

O que e superstição: embeddings negativos gigantes usados como muleta universal. Eles mudam o estilo global da imagem inteira, deixam tudo mais escuro e contrastado, e o ganho anatomico e pequeno perto do custo. Use com peso moderado ou nao use.

Um detalhe que quase ninguem observa: descrever a mao no positivo aumenta a atencao do modelo naquela regiao. “Mao apoiada no quadril, dedos relaxados” costuma render mais do que qualquer negativo, porque da ao modelo uma pose especifica e comum no dataset em vez de deixar a mao no automatico.

Inpainting: a correcao mais confiavel para maos

Inpainting resolve o problema pela raiz porque muda a economia de pixels. Ao mascarar so a mao e pedir para o modelo redesenhar aquela regiao com a opcao de processar apenas a area mascarada, aquele pedaco recebe a resolucao inteira do modelo. A mao que tinha noventa pixels passa a ser gerada como se fosse uma imagem de 512 ou 1024 pixels dedicada a ela.

Os parametros que realmente decidem o resultado nesse passe sao poucos, e vale memorizar as faixas.

  • Denoise entre 0.5 e 0.75. Abaixo disso o modelo preserva a estrutura errada que voce quer eliminar. Acima disso a mao nova ignora a iluminacao e o angulo do braco.
  • Mascara com folga. Cubra a mao inteira mais um pouco do pulso. Mascara colada no contorno faz o modelo tentar encaixar dedos dentro da silhueta errada. Padding de mascara em torno de 32 a 64 pixels costuma ser um bom ponto de partida.
  • Processar apenas a area mascarada. Esse e o ajuste que muda tudo. Sem ele o inpainting roda na resolucao da imagem inteira e voce nao ganha densidade nenhuma.
  • Prompt curto e local. No inpainting, descreva a mao, nao a cena. “Mao humana detalhada, cinco dedos, pele natural, foco nitido” rende mais do que repetir o prompt de sessenta palavras da imagem original.
  • Lote de varias amostras. Gere quatro a oito variacoes da mesma mascara e escolha. Sai mais barato do que ajustar parametros as cegas.
  • Passos. Faixa de 25 a 40 passos e suficiente para inpainting. Passos altissimos nao corrigem contagem de dedos, so gastam tempo.

Se voce ainda nao domina esse fluxo, vale montar o ambiente com calma primeiro. Tanto o Forge, com interface mais direta, quanto o ComfyUI, com controle por nos, expoem esses parametros. O ComfyUI permite deixar o passe de mao automatico dentro do proprio fluxo, o que economiza muito trabalho repetitivo em lote.

Passes de deteccao automatica no estilo ADetailer

Extensoes de deteccao e refinamento automatico fazem exatamente o que voce faria a mao, mas sozinhas. Um modelo de deteccao localiza a regiao (rosto, mao, corpo), gera uma mascara, recorta, amplia, roda um inpainting local e cola o resultado de volta com blend nas bordas.

Para mao, o segredo esta em tres ajustes. Primeiro, o limiar de confianca da deteccao: modelos de deteccao de mao erram mais que os de rosto, entao um limiar muito alto simplesmente nao detecta nada e voce acha que a extensao esta quebrada. Segundo, o denoise do passe, que deve ficar mais baixo do que num inpainting manual, algo entre 0.35 e 0.5, porque a extensao ja amplia a regiao e um denoise alto desloca a mao. Terceiro, a dilatacao da mascara, para que o pulso entre na conta e a emenda nao fique visivel.

Rode o passe de mao depois do passe de rosto, nunca antes. E aceite que a deteccao vai falhar quando a mao estiver muito borrada ou muito pequena. Nesses casos nao existe automacao: e mascara manual.

Regiao mascarada para corrigir com inpainting

Checkpoints e LoRAs que ajudam

Nem todo modelo tem o mesmo problema. Modelos ilustrativos e de anime costumam sofrer menos com contagem de dedos porque o estilo simplifica a mao para poucas linhas e o olho aceita. Modelos fotorrealistas sofrem muito mais, porque a expectativa visual e maior. Se voce trabalha com geradores de estilo anime, provavelmente ja notou que o mesmo prompt em base fotorrealista produz maos bem piores.

LoRAs de correcao anatomica existem e ajudam, com ressalvas. Elas foram treinadas com recortes de maos limpos e empurram o modelo para essa distribuicao. Use peso baixo, tipicamente algo em torno de 0.4 a 0.7, porque peso alto tende a achatar o estilo e deixar todas as maos com a mesma pose. Teste sempre a mesma seed com e sem a LoRA para ver o efeito isolado.

Se voce quer resolver isso de forma permanente para um personagem recorrente, treinar seu proprio adaptador e o caminho mais confiavel. O processo esta descrito em detalhe no guia de como treinar LoRA em portugues, e o ponto critico e a curadoria: inclua no dataset varios recortes nitidos de maos do personagem, nao so rostos. Para achar modelos e adaptadores ja prontos antes de treinar do zero, o tutorial de Civitai cobre como filtrar por tipo e ler os exemplos com honestidade.

Controle de pose e referencia estrutural

Quando a mao precisa estar numa posicao especifica, prompt nao basta. Condicionamento estrutural resolve: voce fornece uma imagem de referencia com o esqueleto, a profundidade ou o contorno da mao, e o modelo passa a ter geometria explicita em vez de adivinhar.

Duas abordagens funcionam bem. A primeira e usar deteccao de pose com suporte a maos, que gera um esqueleto com os dedos. A segunda, muitas vezes mais precisa, e fotografar ou renderizar uma mao de referencia, extrair o mapa de profundidade ou o contorno, e aplicar isso so na regiao da mao durante um inpainting. Modelos 3D de mao articulada servem perfeitamente como fonte, e quem ja trabalha com fluxos de geracao 3D costuma ter esse tipo de asset a mao.

O peso do condicionamento importa. Peso muito alto congela a mao numa pose rigida com aparencia de manequim. Comece por volta de 0.6 a 0.8 e ajuste. E lembre que condicionamento estrutural corrige posicao, nao textura: quase sempre voce ainda vai querer um passe leve de refinamento depois.

Truques de composicao: evitar o problema em vez de resolver

Metade da profissionalizacao aqui e saber quando nao brigar. Fotografia comercial esconde maos o tempo todo e ninguem reclama. As saidas mais confiaveis:

  • Mao segurando um objeto. Uma xicara, um livro, um tecido. O objeto ocupa os dedos, esconde as pontas e da ao modelo um contexto muito representado no treino.
  • Mao fora do quadro. Corte no antebraco. Enquadramento fechado no rosto e ombros elimina o problema por completo.
  • Mao parcialmente escondida. No bolso, atras das costas, sob o cabelo, apoiada no rosto com dedos fechados.
  • Punho fechado. Muito mais facil para o modelo do que dedos abertos e separados.
  • Mao em perfil. A vista lateral esconde a maior parte dos dedos e reduz drasticamente a chance de contagem errada.
  • Desfoque de profundidade. Se a mao esta claramente fora do plano focal, uma imprecisao leve vira efeito fotografico e nao defeito.

Vale dizer o obvio: isso e contorno, nao solucao. Para material em movimento a limitacao aparece de novo, porque o defeito pisca entre quadros. Quem produz conteudo em video com IA sabe que uma mao instavel chama mais atencao em movimento do que uma mao errada parada.

Sintomas, causas e correcoes

Sintoma Causa provavel Correcao
Seis ou sete dedos Area pequena no latente Inpainting com area mascarada, denoise 0.5 a 0.75
Dedos fundidos numa massa Resolucao final baixa Hires fix 1.5x a 2x, denoise 0.35 a 0.5
Dedos longos como galhos CFG alto demais Baixar CFG em dois ou tres pontos
Mao com aparencia de luva sem detalhe LoRA de estilo com peso alto Reduzir peso da LoRA e testar sem ela
Segunda mao aparecendo do nada Geracao acima da resolucao nativa Gerar no tamanho nativo e ampliar depois
Mao correta mas em angulo impossivel Falta de condicionamento estrutural Referencia de pose ou profundidade local
Emenda visivel depois da correcao Mascara colada no contorno Aumentar padding e dilatacao da mascara
Mao muda de pose no refinamento Denoise alto demais no passe Reduzir denoise para a faixa baixa
Prompts negativos aplicados para corrigir defeitos

O passe manual e o custo real de cada correcao

Existe um ponto em que insistir sai mais caro do que consertar. Se depois de tres rodadas de inpainting a mao continua errada, abra um editor de imagem e faca o seguinte: recorte uma mao correta de outra geracao sua ou de uma foto de referencia sua, encaixe na posicao, ajuste tamanho, rotacao e tom de pele grosseiramente. Nao precisa ficar bonito.

Depois volte para o gerador, mascare a regiao colada e rode um inpainting com denoise baixo, entre 0.25 e 0.4. Esse passe leve nao vai redesenhar a anatomia, apenas unificar iluminacao, grao e textura de pele. E a tecnica mais confiavel que existe, porque a estrutura vem de uma fonte real e a IA so faz o acabamento.

A mesma logica de recorte, encaixe e reintegracao aparece em outros fluxos, como no processo descrito no guia de troca de rosto com IA. O principio e identico: geometria vem de fora, coerencia fotografica vem do modelo.

Vale contabilizar o custo, porque todos os metodos acima custam tempo. Inpainting com area ampliada, passes de deteccao e hires fix multiplicam o numero de etapas por imagem. Numa placa de entrada isso significa organizar o trabalho em duas fases: primeiro uma varredura rapida em resolucao baixa e lote grande so para escolher composicoes, depois o refinamento apenas nas escolhidas.

Memoria de video e o limite real, nao a velocidade bruta. Inpainting com area mascarada em resolucao alta e passes de refinamento em sequencia consomem VRAM. Se voce trabalha numa placa com pouca memoria, gere em resolucao nativa, evite empilhar varias LoRAs e faca os passes de correcao um de cada vez. As restricoes praticas de uma placa de entrada estao detalhadas no guia sobre usar a RTX 3060 com Stable Diffusion no Brasil.

Nada disso e garantia. Nenhum ajuste corrige mao em cem por cento dos casos, e qualquer fluxo maduro assume alguma taxa de descarte. A meta realista e sair de uma imagem aproveitavel em dez para uma em duas, e ter um procedimento fixo para consertar o resto.

Um fluxo de trabalho fechado

Junte tudo numa rotina repetivel em vez de improvisar a cada imagem:

  1. Escreva o prompt descrevendo a pose da mao explicitamente, com um negativo curto e focado em defeitos anatomicos.
  2. Gere um lote em resolucao nativa com seeds variadas e CFG moderado. Nao refine nada ainda.
  3. Escolha as duas ou tres composicoes boas e anote as seeds.
  4. Rode hires fix nas escolhidas com denoise na faixa media baixa.
  5. Aplique o passe automatico de rosto e depois o de mao, com denoise mais baixo no de mao.
  6. O que sobrar errado vai para inpainting manual com mascara folgada e area mascarada ativada, em lote de varias amostras.
  7. O que resistir a tres rodadas vai para o passe manual de recorte mais denoise leve.
  8. Guarde as seeds e os parametros que funcionaram. Isso vira seu preset e economiza horas no proximo projeto.

Essa disciplina e o que separa quem gera imagem por diversao de quem entrega trabalho. Se a sua intencao e transformar isso em produto, a consistencia anatomica vira requisito comercial, nao capricho. Cliente nao aceita seis dedos, por melhor que esteja o resto do quadro.

Perguntas frequentes

Por que a IA erra as maos e nao erra os rostos?

Rostos tem topologia fixa e ocupam muito mais area na imagem, entao o modelo tem pixels e regularidade de sobra para aprender. Maos mudam de silhueta a cada rotacao, se escondem umas nas outras e ocupam poucos pixels. Alem disso, existem muito mais fotos de rosto limpas em datasets do que fotos de mao aberta, nitida e bem iluminada.

Escrever “cinco dedos” no prompt resolve?

Quase nunca sozinho. O prompt guia estilo e semantica, nao contagem. O que ajuda de verdade e descrever uma pose especifica e comum, como mao apoiada no quadril ou segurando um objeto, porque isso puxa o modelo para uma regiao do treino bem representada em vez de deixar a mao no automatico.

Qual denoise usar no inpainting de mao?

Entre 0.5 e 0.75 quando voce quer que o modelo redesenhe a mao inteira, e entre 0.25 e 0.4 quando voce so quer integrar uma mao que ja colou manualmente. Valores baixos preservam a estrutura errada, valores muito altos criam uma mao nova que ignora o angulo do braco.

O ADetailer resolve maos automaticamente?

Ajuda bastante, mas nao e magico. A deteccao de mao falha mais que a de rosto, principalmente com maos borradas ou muito pequenas. Ajuste o limiar de confianca, use denoise mais baixo do que no inpainting manual e aumente a dilatacao da mascara para incluir o pulso. O que a deteccao nao pegar exige mascara manual.

Aumentar a resolucao piora ou melhora as maos?

Depende de como voce aumenta. Gerar direto muito acima da resolucao nativa do modelo piora e chega a duplicar membros. Gerar no tamanho nativo e depois ampliar com um segundo passe de difusao melhora, porque a mao ganha area e o modelo tem espaco para separar os dedos.

Existe LoRA que conserta maos?

Existem adaptadores treinados com recortes de maos limpos que melhoram a media dos resultados. Use com peso baixo, porque peso alto achata o estilo e repete sempre a mesma pose. Teste com a mesma seed, com e sem o adaptador, para medir o efeito isolado antes de adotar.

Vale a pena esconder a mao em vez de consertar?

Sim, e uma decisao profissional legitima. Mao segurando um objeto, fora do quadro, no bolso, em punho fechado ou em perfil resolve o problema na composicao e custa zero processamento. Fotografia comercial faz isso o tempo todo. So nao funciona quando a mao e o assunto da imagem.

Da para corrigir maos em video gerado por IA?

E bem mais dificil. Corrigir quadro a quadro introduz tremulacao, porque cada correcao produz uma mao ligeiramente diferente. Na pratica, a estrategia dominante em video e evitar: enquadramentos que escondam as maos, planos mais fechados no rosto ou movimentos em que as maos ficam parcialmente fora de quadro.