Guia de prompts para Stable Diffusion: modelos para produtos, avatares, pôsteres e assets de jogo

"A página de lançamento do Stable Diffusion 3.5 da Stability AI foi usada para confirmar o posicionamento da série SD 3.5 e o contexto de aderência a prompts."
"A página Stability AI License foi usada para verificar os limites comerciais entre Community License e Enterprise License; em 2026-06-23, ela ainda usava US$ 1 milhão de receita anual como limite importante."
"A documentação do Hugging Face Diffusers foi usada para confirmar o contexto básico de prompt, Negative prompt, pipeline e parâmetros de inferência."
"O tutorial ComfyUI Text to Image foi usado para confirmar a posição do prompt em um workflow texto para imagem e as relações básicas entre nós."
"A model card do SDXL Base 1.0 foi usada para lembrar que é preciso revisar model card, modelo base e limites de uso."
Prompt não é um monte de palavras-chave; é design em camadas
Ao escrever prompts, muita gente comete o mesmo erro. Vê masterpiece, best quality, 8k, ultra detailed, copia e ainda adiciona cinematic lighting, professional photography, award winning. A imagem sai quebrada ou foge bastante do estilo desejado.
O problema não está nessas palavras em si. O problema é que todas ficam na mesma camada. Sujeito, cena, composição, estilo e qualidade não estão separados. O modelo recebe um conjunto de palavras com pesos parecidos, não uma descrição visual com prioridade.
A estrutura correta em camadas
Um prompt estável costuma ter quatro camadas. Em ordem de prioridade:
| Camada | O que escrever | Obrigatório | Opcional | Exemplo |
|---|---|---|---|---|
| Sujeito | O objeto central da imagem | Sujeito + ação/postura | Idade, gênero, roupa, expressão | a woman sitting on a wooden chair |
| Cena | Ambiente e fundo | Lugar ou espaço | Luz, clima, horário, atmosfera | in a cozy library, warm afternoon light |
| Composição | Lente e enquadramento | Tipo de plano ou termo de composição | Ângulo, distância, espaço vazio, corte | medium shot, from side angle |
| Qualidade | Restrições técnicas e de estilo | Estilo base | Termos de qualidade, referência artística, tipo de render | digital illustration, soft color palette |
Por que essa ordem? O mecanismo de atenção dos modelos de difusão costuma priorizar o começo do prompt. Quando o sujeito aparece primeiro, o modelo tende a posicionar antes o elemento central. Cena e composição no meio controlam o quadro. Termos de qualidade entram no fim como restrição de estilo.
Exemplo ruim vs exemplo correto
| Exemplo ruim | Problema | Exemplo melhor | Melhoria |
|---|---|---|---|
masterpiece, best quality, 8k, beautiful woman, sitting, library, cinematic | Termos de qualidade roubam o lugar do sujeito; o modelo não sabe o que desenhar primeiro | a woman sitting in a cozy library, warm afternoon light, medium shot, digital illustration, best quality | Sujeito vem primeiro, camadas ficam ordenadas |
girl, cute, anime style, highly detailed, perfect face, white hair, blue eyes | Características ficam misturadas e os pesos colidem facilmente | a girl with white hair and blue eyes, anime style portrait, close-up, clean line art | Características são agrupadas e o estilo fica claro |
product photo, professional, expensive watch, luxury, gold, macro, sharp focus | Empilha palavras comerciais, mas falta composição concreta | a gold luxury watch on marble surface, macro product shot, shallow depth of field, studio lighting, high resolution | Primeiro o produto, depois as condições de fotografia |
Os três exemplos mostram a mesma coisa. Mais palavras não significam resultado melhor. Camadas mais claras ajudam mais. Escreva primeiro o que será desenhado. Depois onde está. Depois como será enquadrado. Estilo e termos de qualidade ficam no final.
Itens obrigatórios e opcionais por camada
Obrigatório na camada de sujeito:
- Um sujeito central: pessoa, objeto, prédio ou animal
- Uma ação ou postura básica: sitting, standing, walking, holding
Opcional na camada de sujeito:
- Idade, gênero, cor de pele, tipo físico
- Roupa, cabelo, acessórios
- Expressão, olhar, movimento das mãos
- Quantidade: single, group, crowd
Obrigatório na camada de cena:
- Pelo menos um termo de lugar ou espaço: indoor, outdoor, street, forest, studio
Opcional na camada de cena:
- Tipo de luz: sunlight, soft light, hard light, neon
- Clima e horário: morning, night, rainy
- Atmosfera: calm, tense, cozy, cinematic
- Detalhe de fundo: simple background, busy background, bokeh
Obrigatório na camada de composição:
- Um tipo de plano: portrait, medium shot, full body, landscape
Opcional na camada de composição:
- Ângulo: front, side, back, from above, from below
- Enquadramento: close-up, wide shot, cropped
- Direção do espaço vazio: centered, left aligned
Obrigatório na camada de qualidade:
- Um estilo base: photography, illustration, anime, realistic
Opcional na camada de qualidade:
- Termos de qualidade: best quality, high resolution, detailed
- Estilo de artista: style of artist name
- Tipo de render: soft shading, hard edge, line art
- Câmera ou equipamento: DSLR, film grain, HDR
Essa estrutura não é uma regra absoluta. Mas é um modelo estável que veio de muita prática de comunidade. Ao escrever um prompt, preencha primeiro essa tabela e depois ajuste conforme a cena.
Sintaxe de peso e técnicas de mistura
A estrutura em camadas resolve o que escrever e onde colocar. Às vezes você precisa de controle mais fino: reforçar um termo, misturar dois estilos ou fazer a imagem passar de um estado para outro durante a geração. É aí que entram pesos e sintaxes de mistura.
Sintaxe de peso: reforçar ou enfraquecer um termo
A forma mais comum usa parênteses com número:
(keyword:1.5) # aumentar o peso para 1,5
(keyword:0.8) # reduzir o peso para 0,8
(keyword) # peso padrão em torno de 1,1 com um parêntese
((keyword)) # peso padrão em torno de 1,21 com parêntese duplo
Exemplo:
a woman sitting in a library, (soft lighting:1.3), warm atmosphere
Aqui soft lighting ganha peso e o modelo presta mais atenção à luz suave. Se você escrever:
a woman sitting in a library, (harsh lighting:0.7), warm atmosphere
harsh lighting perde peso e a imagem pode se aproximar de uma luz mais neutra.
Mais peso não é sempre melhor. Acima de 2,0, aparecem mais deformações, cores estranhas ou perda de detalhe. Na prática, 0,7 a 1,5 é uma faixa mais segura.
Sintaxe de mistura: alternar dois conceitos
Com colchetes e barra vertical, o modelo pode alternar entre dois termos:
[keyword1|keyword2]
Exemplo:
a [cat|dog] sitting on a chair
O modelo usa cat em alguns passos de sampling e dog em outros. O resultado pode parecer um animal intermediário. Essa sintaxe funciona melhor para misturar estilos, por exemplo:
[anime style|realistic photography] portrait of a woman
Mistura não significa metade exata. O resultado depende de steps, seed e modelo. Às vezes domina o primeiro termo; às vezes o segundo.
Sintaxe de transição: passar de um estado para outro
Com colchetes e dois-pontos, o prompt pode mudar durante a geração:
[from:to:0.5]
O valor 0.5 significa que from é substituído por to depois de 50% dos passos de sampling. Exemplo:
a [white:blue:0.3] dress
Durante os primeiros 30%, o modelo usa white dress; nos 70% restantes, usa blue dress. O resultado pode ser um vestido que vai ficando azul.
A transição serve para ações, expressões ou estilos. Por exemplo:
a woman [smiling:crying:0.5]
A primeira metade favorece sorriso e a segunda favorece choro. Isso pode gerar uma expressão intermediária. Ainda assim, essa sintaxe depende muito do modelo: outro checkpoint pode mudar bastante o resultado.
Diferenças de suporte conforme a UI
A sintaxe de peso e mistura não funciona exatamente igual em todas as UIs. Resumo:
| UI | (keyword:1.5) | [keyword1|keyword2] | [from:to:0.5] | Explicação |
| --- | --- | --- | --- | --- |
| Automatic1111 WebUI | Suportado | Suportado | Suportado | Suporte de sintaxe mais comum |
| ComfyUI | Suportado no nó CLIP Text Encode | Suportado | Suportado | Basta escrever o texto no nó |
| InvokeAI | Suportado | Suportado | Parcialmente suportado | Transições podem variar |
| Diffusers API | Requer implementação manual | Requer implementação manual | Requer implementação manual | A sintaxe precisa ser processada na camada de pipeline |
No ComfyUI, escreva (keyword:1.5) diretamente no campo de prompt do nó CLIP Text Encode. Não é preciso instalar nós ou plugins extras.
Armadilhas que vale evitar
-
Não empilhe pesos: se um prompt tiver mais de 5 termos como
(keyword:1.5)ao mesmo tempo, a distribuição de atenção fica instável. -
Não use mistura no sujeito principal:
[man|woman] sittingpode gerar uma pessoa ambígua. Se você precisa de uma opção clara, escreva diretamente. -
Transição precisa de passos suficientes: com poucos steps, por exemplo 10, o efeito quase não aparece. Em geral, use 20 steps ou mais.
-
Pesos mudam conforme o modelo: o mesmo
(keyword:1.5)se comporta diferente em SDXL e SD 1.5. Se trocar de modelo, teste de novo. -
Não passe de três níveis de parênteses:
(((keyword)))fica em torno de 1,33. Mais níveis ficam difíceis de controlar. É mais claro escrever(keyword:1.5).
Sintaxe de peso e mistura é ferramenta de controle fino, não obrigação. Em muitos casos, uma estrutura clara em camadas basta. Use só quando precisar reforçar um elemento, misturar estilos ou criar uma transição.
Negative prompt não melhora só porque é mais longo
O Negative prompt diz ao modelo o que ele não deve desenhar. Muita gente copia listas universais longas, por exemplo:
low quality, worst quality, lowres, bad anatomy, bad hands, missing fingers, extra digits, cropped, blurry, text, watermark, signature, artist name, error, jpeg artifacts
Essas listas ajudavam em alguns casos na época do SD 1.5. Em SDXL e SD 3.5, o comportamento é diferente. A documentação do Hugging Face Diffusers explica que o Negative prompt influencia a direção do classifier-free guidance (CFG). Se ele for longo demais ou contraditório, pode afastar o modelo do objetivo.
Fluxo de design em 3 passos
O caminho mais robusto é partir do problema visível.
Passo 1: identificar o problema no resultado
Depois de gerar uma imagem, veja primeiro onde está a falha.
| Tipo de problema | Como aparece | Negative prompt correspondente |
|---|---|---|
| Mãos | seis dedos, dedos tortos, dedos grudados | bad hands, mutated hands, extra fingers, missing fingers |
| Rosto | olhos desalinhados, rosto deformado, traços assimétricos | distorted face, asymmetrical eyes, malformed face |
| Composição | sujeito fora do centro, corte apertado demais, imagem desequilibrada | cropped, off-center, bad composition |
| Estilo | estilo esperado não aparece, estilos se misturam | anime, realistic, sketch, oil painting para estilos que você não quer |
| Qualidade | borrado, ruído, baixa resolução | blurry, low resolution, jpeg artifacts |
Passo 2: adicionar por categoria, sem empilhar
Corrija uma categoria por vez. Se só as mãos falham, adicione termos de mãos. Não coloque qualidade, composição e estilo ao mesmo tempo. Exemplo:
# Só as mãos têm problema
bad hands, mutated hands, extra fingers
# Só a composição tem problema
cropped, bad composition, off-center
Depois gere de novo. Se as mãos melhoram, mas o rosto piora, aí sim adicione termos de rosto.
bad hands, mutated hands, extra fingers, distorted face, asymmetrical eyes
Passo 3: limitar o tamanho e evitar contradições
Um Negative prompt não é melhor por ser mais longo. Normalmente 15 a 20 termos bastam. Passando disso, o modelo recebe comandos demais de “não desenhe isso” e entende pior a direção.
Evite também contradições. Se o prompt positivo diz anime style, o Negative prompt não deve incluir anime. O Negative prompt não é o oposto do positivo: é a lista de estilos ou falhas que você realmente quer excluir.
Modelos de Negative prompt para cenas comuns
| Cena | Negative prompt recomendado | Explicação |
|---|---|---|
| Pessoa realista | bad hands, mutated hands, extra fingers, distorted face, blurry, low quality | Foco em mãos e rosto |
| Imagem de produto | background, reflection, shadow, watermark, text, blurry, cropped | Evitar ruído de fundo e elementos indesejados |
| Estilo anime | realistic, photo, 3d render, low quality, bad anatomy, extra fingers | Excluir realismo e elementos 3D |
| Design de interiores | person, cluttered, messy, low quality, blurry, watermark | Evitar pessoas e fundos bagunçados |
Esses modelos são pontos de partida, não respostas fixas. Ajuste conforme a falha real.
Termos que é melhor não empilhar
No Negative prompt, há palavras que ajudam pouco ou criam novos problemas.
worst quality: extremo demais. O modelo pode interpretar como degradação geral de qualidade.normal quality: vago. “normal” não deixa claro o que deve ser excluído.artist name: a menos que você queira evitar um artista específico, estreita demais o espaço de estilos.watermark, signature, text: podem ajudar, mas em excesso fazem o modelo rejeitar texto em geral. Até títulos desejados em pôsteres podem aparecer pior.
Técnica prática: ver o efeito puro do Negative prompt com CFG=0
Na comunidade existe uma técnica: colocar CFG em 0 para observar o efeito do Negative prompt. Com CFG=0, o modelo ignora o prompt positivo e usa apenas o negativo na direção oposta. Assim você vê o que ele tende a excluir.
Não é técnica para geração normal. É depuração. Na geração comum, CFG costuma ficar entre 7 e 12, e prompt positivo e Negative prompt atuam juntos.
O Negative prompt depende do modelo
SDXL e SD 3.5 dependem menos do Negative prompt do que SD 1.5. Model cards oficiais e a documentação do Diffusers também indicam que modelos novos seguem melhor o prompt positivo e às vezes geram resultados estáveis com menos negativo.
Se você continuar empilhando muitos Negative prompts em SDXL ou SD 3.5, pode limitar a expressividade do modelo. Comece curto e adicione termos aos poucos conforme o resultado.
Quatro modelos por cenário: produto / avatar / pôster / asset de jogo
Os capítulos anteriores explicaram a estrutura geral. Este capítulo traz quatro modelos comuns. Ajuste ao seu uso real; não precisa começar do zero.
Comparação de cenários
| Cenário | Definição de uso | Escolha de câmera | Espaço vazio | Limite de formato | Exemplo de estilo |
|---|---|---|---|---|---|
| Produto | Exibição de produto, imagem principal de e-commerce, página de detalhes | macro, close-up, frontal ou leve vista de cima | Espaço ao redor, fundo limpo | Tamanho conforme plataforma, proporção 1:1 ou 3:4 | Fundo branco, studio lighting, minimal |
| Avatar | Redes sociais, marca pessoal, personagem de jogo | portrait, close-up, composição centralizada | Espaço ao redor da cabeça, evitar cortar o rosto | Proporção 1:1, 512×512 ou maior | Realista, anime, illustration |
| Pôster | Divulgação de evento, capa de conteúdo, material publicitário | wide shot, hero composition, centralizado ou regra dos terços | Espaço superior para título, área inferior para logo | Proporção 2:3 ou 9:16, alta resolução | cinematic, bold color, dynamic |
| Asset de jogo | Elementos de UI, ícones de itens, arte de personagem | Conforme uso: ícone frontal, personagem de corpo inteiro | Ícone com silhueta clara, personagem com margem de corte | Ícone 256×256, personagem com proporção variável | pixel art, anime, concept art |
Modelo para produto
Uso: imagem principal de e-commerce, página de detalhes, exibição de produto.
Requisito principal: produto nítido, fundo limpo, luz uniforme, sem elementos estranhos.
Exemplo de prompt:
a [nome do produto] on white marble surface, macro product shot, shallow depth of field, studio lighting, clean background, high resolution, professional photography
Negative prompt:
background clutter, reflection, shadow, watermark, text, blurry, low quality
Pontos de ajuste:
- Troque o nome do produto por um objeto específico, como
a gold luxury watchoua leather handbag. white marble surfacepode virarsimple white background,wooden tableouglass display.shallow depth of fielddesfoca o fundo e destaca o produto.- Se precisar adicionar logo depois, escreva
centered, ample white spaceno prompt.
Modelo para avatar
Uso: avatar de redes sociais, imagem de marca pessoal, avatar de personagem de jogo.
Requisito principal: rosto nítido, expressão natural, estilo consistente, partes importantes sem corte.
Exemplo de prompt (estilo realista):
a [descrição da pessoa] portrait, close-up, looking at camera, soft natural lighting, shallow depth of field, high resolution, professional photography
Negative prompt:
bad hands, distorted face, asymmetrical eyes, blurry, low quality
Exemplo de prompt (estilo anime):
a [descrição da pessoa] anime style portrait, close-up, looking at camera, clean line art, vibrant color, high quality
Negative prompt:
realistic, photo, 3d render, low quality, bad anatomy
Pontos de ajuste:
- A descrição da pessoa inclui gênero, idade, cabelo, roupa e expressão, por exemplo
a young woman with short black hair, confident smile. looking at cameraajuda os olhos a olharem para a câmera, bom para avatares.- Para realismo use
professional photography; para anime useanime style, clean line art. - Recomenda-se proporção 1:1, como 512×512 ou 1024×1024.
Modelo para pôster
Uso: divulgação de eventos, capa de conteúdo, material publicitário.
Requisito principal: impacto visual, espaço para título, elemento principal centralizado ou destacado, estilo consistente.
Exemplo de prompt:
a [descrição do tema] scene, wide shot, cinematic composition, dramatic lighting, dynamic pose, bold color palette, high resolution, poster design
Negative prompt:
text, watermark, signature, blurry, low quality, cropped
Pontos de ajuste:
- A descrição do tema inclui personagem, cena e ação, por exemplo
a superhero standing on rooftop at sunsetoua concert crowd with neon lights. wide shotecinematic compositiontrazem sensação cinematográfica.bold color palettecombina com o impacto visual de pôster.- Se precisar adicionar título depois, escreva
top empty space for textou corte depois no ComfyUI.
Atenção: pôsteres geralmente precisam de composição posterior para título e logo. A imagem gerada é material base. Se quiser gerar pôster com texto diretamente, teste FLUX ou SD 3.5; eles costumam lidar melhor com elementos tipográficos.
Modelo para asset de jogo
Uso: elementos de UI, ícones de itens, artes de personagem.
Requisito principal: estilo consistente, silhueta clara, recortável, compatível com game engine.
Exemplo de prompt (ícone de item):
a [nome do item] icon, front view, clean outline, simple background, pixel art style, bright color, 256x256, game asset
Negative prompt:
realistic, photo, complex background, blurry, low quality
Exemplo de prompt (personagem de corpo inteiro):
a [descrição do personagem] full body, anime style, dynamic pose, clean background, concept art, high resolution, character design
Negative prompt:
bad hands, extra fingers, distorted face, low quality, messy background
Pontos de ajuste:
- Para ícones, use
front view, clean outlinepara garantir silhueta clara. - Para personagens, use
full bodypara obter o corpo inteiro. - Ajuste
pixel art styleouanime styleconforme o tipo de jogo. - Assets de jogo muitas vezes exigem corte, separação em camadas e exportação. A imagem gerada é só o primeiro passo.
O modelo não é resposta fixa
Esses quatro modelos são pontos de partida, não padrões absolutos. Modelos, checkpoints e LoRAs diferentes geram resultados diferentes. Escreva o primeiro prompt com essa estrutura e ajuste conforme a saída real.
O importante é lembrar a restrição central de cada cenário: produto precisa ficar limpo, avatar precisa mostrar bem o rosto, pôster precisa ter impacto e asset de jogo precisa ser recortável. Essas restrições importam mais do que palavras específicas.
Como o modelo afeta o prompt: por que copiar não gera o mesmo resultado
Talvez você já tenha visto isso: encontra um bom prompt, copia com os mesmos parâmetros e o resultado sai totalmente diferente. Muita gente culpa seed ou parâmetros. Muitas vezes, a causa real está no modelo.
Capacidade de seguir prompt por modelo
| Família de modelo | Aderência ao prompt | Tendência de estilo | Impacto na escrita do prompt |
|---|---|---|---|
| SD 1.5 | Mais fraca, facilmente dominada por termos de qualidade | Realista, anime e ilustração têm checkpoints maduros | Precisa de termos mais concretos; termos de qualidade pesam mais |
| SDXL | Melhor que SD 1.5, entende melhor a estrutura | Versátil, modelo base oficial mais realista | Sujeito e cena importam mais; termos de qualidade podem ser menores |
| Stable Diffusion 3.5 | Aderência claramente melhor, entende prompts complexos com mais facilidade | Posicionado como modelo geral de alta qualidade | Dá para escrever prompts mais longos mantendo camadas |
| FLUX.1 | Boa aderência e boa textura visual, melhor com elementos de texto | Fotografia, cinema, estilo pôster | Dá para incluir texto e elementos ligados a marca com mais chance |
A tabela deixa uma ideia simples: o mesmo prompt muda conforme o modelo. Isso não significa necessariamente que o prompt esteja errado. Significa que o modelo interpreta de outra forma.
Na época do SD 1.5, muitos prompts empilhavam masterpiece, best quality, 8k, porque o modelo respondia muito a esses termos. Com SDXL e SD 3.5, o modelo entende melhor sujeito, cena e composição. Quando você descreve bem o conteúdo visual, o resultado tende a ficar mais estável. Termos de qualidade viram apoio, não protagonista.
Como checkpoint e LoRA mudam o resultado
Um “checkpoint de retrato realista” ou “checkpoint estilo anime” baixado costuma ser resultado de treino adicional ou fusão sobre um modelo base. Ele muda a resposta do modelo a certas palavras.
Por exemplo, um checkpoint anime pode responder muito bem a anime style, vibrant color, clean line art, mas pior a realistic photography, studio lighting. Se você copiar um prompt realista para um checkpoint anime, a imagem pode ficar confusa.
Um LoRA parece mais um pacote de capacidade extra. Ele ensina ao modelo um personagem, roupa, estilo ou conceito. Se você usa um LoRA, geralmente convém usar as palavras de gatilho dele. Um cyberpunk style LoRA pode precisar de cyberpunk ou termos específicos para ativar bem.
Check-list quando o mesmo prompt piora ao trocar de modelo
Se o resultado piora depois de trocar de modelo, revise nesta ordem:
| Revisão | Possível problema | Caminho de correção |
|---|---|---|
| Família do modelo base | Prompt de SD 1.5 em workflow SDXL ou FLUX | Usar workflow de exemplo dessa família |
| Tipo de checkpoint | Prompt realista em checkpoint anime | Usar checkpoint que combine com o estilo |
| Gatilho do LoRA | LoRA carregado, mas sem trigger no prompt | Revisar model card do LoRA e adicionar trigger |
| Tamanho do prompt | SDXL/SD 3.5 aceitam mais texto, SD 1.5 talvez não | Simplificar prompt e manter sujeito e cena centrais |
| Sintaxe de peso | Modelos reagem diferente a (keyword:1.5) | Reduzir faixa de peso e testar de novo |
| Negative prompt | Modelos novos dependem menos do negativo | Encurtar Negative prompt e manter só exclusões principais |
| Estrutura do workflow | Novo modelo pode exigir outra cadeia de nós | Usar workflow oficial ou recomendado na model card |
A lógica é: prompt não é texto isolado. Ele está ligado a modelo, checkpoint, LoRA e estrutura de workflow. Se você troca o modelo, também precisa ajustar o prompt.
Um método de teste prático
Ao testar um modelo novo, comece com um conjunto fixo de prompts:
# Teste 1: apenas sujeito
a woman sitting on a chair
# Teste 2: sujeito + cena
a woman sitting on a chair in a library
# Teste 3: sujeito + cena + estilo
a woman sitting on a chair in a library, digital illustration
# Teste 4: sujeito + cena + estilo + peso
a woman sitting on a chair in a library, digital illustration, (soft lighting:1.3)
Fixe seed, tamanho, steps e CFG. Gere 3 imagens por teste e observe como o modelo responde a cada camada. Assim você entende a sensibilidade a sujeito, cena, estilo e pesos antes de escrever prompts mais complexos.
Prática no ComfyUI: iterar prompts dentro do workflow
Os capítulos anteriores cobriram estrutura e teoria. Agora é operação no ComfyUI. A vantagem do ComfyUI é a visualização por nós: você vê onde o prompt fica, com quais nós se conecta e como afeta o resultado final.
Onde fica o nó de prompt no workflow
Um workflow mínimo de texto para imagem costuma ter estes nós:
Load Checkpoint → CLIP Text Encode (positive) → KSampler → VAE Decode → Save Image
→ CLIP Text Encode (negative)
O prompt positivo vai no primeiro nó CLIP Text Encode; o Negative prompt vai no segundo. Ambos se conectam ao KSampler pela saída conditioning. O KSampler gera o latent conforme seed, steps, CFG, sampler e outros parâmetros.
Isso significa que o prompt não decide a imagem sozinho. Ele atua junto com modelo, parâmetros de sampling e VAE. Ao mudar o prompt no ComfyUI, revise também:
- Se o modelo em
Load Checkpointestá correto. - Se o seed em
KSamplerestá fixo. - Se steps, CFG e sampler em
KSamplercontinuam estáveis. - Se o VAE em
VAE Decodecombina com o modelo.
Fixar seed para comparar
Para testar o efeito do prompt, o mais importante é fixar o seed. No KSampler, seed e control_after_generate são dois parâmetros centrais.
Passos:
- Configure
control_after_generatecomofixed. - Anote o valor atual do seed.
- Mude o prompt, mas altere uma única variável, por exemplo só o termo de luz.
- Clique em Queue Prompt para gerar de novo.
- Compare as duas imagens e avalie o efeito do termo de luz.
Assim você elimina a aleatoriedade do seed e observa apenas o impacto da mudança no prompt. Se quiser testar várias versões, mude o seed manualmente, por exemplo seed=100, seed=101, seed=102, e associe cada seed a uma versão do prompt.
Parâmetros relacionados: Steps, CFG e Sampler afetam o prompt
O efeito do prompt também depende dos parâmetros de sampling. Base geral:
| Parâmetro | Efeito sobre o prompt | Faixa recomendada |
|---|---|---|
| Steps | Poucos steps podem perder detalhes do prompt; steps demais podem reforçar detalhes em excesso | 20-30 em testes; 30-50 em geração final |
| CFG (Classifier-Free Guidance Scale) | CFG mais alto segue o prompt com mais rigor; CFG mais baixo dá mais liberdade ao modelo | 7-12 normal; 4-7 estilizado; 12-15 realista estrito |
| Sampler | Cada sampler responde um pouco diferente ao prompt, mas afeta principalmente velocidade e detalhe | Euler, Euler a, DPM++ 2M Karras são opções comuns |
Combinações comuns:
- Pessoa realista: steps=30, CFG=8-10, sampler=DPM++ 2M Karras.
- Estilo anime: steps=25-30, CFG=7-8, sampler=Euler a.
- Imagem de produto: steps=25-30, CFG=9-11, sampler=DPM++ 2M.
Não são respostas fixas. O melhor valor muda com modelo e checkpoint. Fixe o prompt e altere só steps, CFG e sampler para observar.
Boas práticas para comparar em batch
Se quiser testar várias versões de prompt de uma vez, use nós batch ou mude seed manualmente. No ComfyUI há alguns caminhos:
Método 1: mudar seed manualmente
No KSampler, mude o seed à mão, altere uma versão de prompt por vez e registre seed e imagem. É o método mais simples e serve para poucas comparações.
Método 2: usar nó batch
Alguns pacotes de custom nodes oferecem batch, como nós Primitive para inserir vários seeds ou nós específicos de batch prompt. Serve quando você precisa gerar dezenas de imagens comparativas.
Método 3: salvar versões do workflow
Salve diferentes workflows de prompt como JSON:
portrait-prompt-v1.json # prompt original
portrait-prompt-v2.json # adiciona termo de luz
portrait-prompt-v3.json # adiciona termo com peso
Ao carregar, arraste o JSON correspondente e não será preciso redigitar tudo.
Registrar resultados de experimento
Ao testar prompts, vale registrar:
## Registro de teste de prompt
- Modelo: SDXL base 1.0
- Seed: 12345
- Size: 1024×1024
- Steps: 30
- CFG: 8
- Sampler: DPM++ 2M Karras
- Prompt versão 1: a woman sitting in a library, soft lighting
- Prompt versão 2: a woman sitting in a library, (soft lighting:1.3)
- Diferença: a versão 2 tem luz mais suave e sombras mais naturais
Assim você constrói sua própria biblioteca de efeitos de prompt. Na próxima cena parecida, dá para partir dos registros anteriores.
Riscos comerciais e de copyright: o que não convém escrever no prompt
Muita gente trata prompt como “o importante é sair a imagem”. Em uso comercial, o conteúdo do prompt, o uso da imagem gerada e a licença do modelo podem criar riscos legais. Aqui vamos direto à check-list.
Três tipos de conteúdo que você deve evitar
Primeira categoria: marcas e sinais comerciais
Se você escreve Nike shoes, Apple product ou Coca-Cola logo, a imagem pode incluir elementos de marca. Em projeto comercial, isso pode trazer risco de violação de marca registrada. Mesmo que você não tenha desenhado o elemento de marca, usar o resultado pode ser problemático.
Forma correta: substitua marcas por categorias. Por exemplo:
Nike shoes→a pair of running shoes, sporty design.iPhone→a smartphone, modern design.Starbucks logo→a coffee shop logo, circular design.
Se um cliente exige um elemento de marca específico, use material autorizado da marca em vez de gerar com IA.
Segunda categoria: pessoas reais e figuras públicas
Se você escreve Taylor Swift portrait, Elon Musk face ou celebrity name e usa comercialmente uma imagem parecida com uma figura pública, pode haver risco de direito de imagem ou direitos de personalidade. As leis variam por país, mas o risco existe.
Forma correta: substitua nomes por descrições. Por exemplo:
Taylor Swift portrait→a young woman with blonde hair, singer style portrait.Elon Musk face→a middle-aged man with short hair, tech entrepreneur portrait.
Se quiser gerar um personagem fictício, garanta que o conceito seja original e não imite uma pessoa existente.
Terceira categoria: estilo de artista e obras protegidas
Se você escreve style of artist name, especialmente com artistas contemporâneos, o resultado pode se aproximar muito do estilo da pessoa. Em uso comercial, isso pode abrir discussões de copyright. Artistas diferentes têm posições diferentes sobre imitação de estilo. Não assuma que é seguro.
Forma correta: descreva o estilo em vez de citar o artista. Por exemplo:
style of Studio Ghibli→anime style, soft color palette, detailed background.style of Van Gogh→oil painting style, bold brush strokes, vibrant color.
Se a intenção for homenagear claramente um artista, pesquise a posição dele sobre uso comercial ou procure orientação jurídica.
Check-list de licença do modelo
Antes de uso comercial, revise três camadas de licença.
Primeira camada: licença do modelo base
A Stability AI explica na página de licença os limites de uso de modelos como SDXL e SD 3.5. Pontos principais:
- Community License: permite uso pessoal e não comercial, com limite de receita para uso comercial.
- Enterprise License: se ultrapassar o limite ou tiver certos usos, é preciso licença empresarial.
- Alcance de uso das imagens geradas: alguns modelos permitem assets comerciais, outros limitam saídas.
Passos de revisão:
- Abrir Stability AI License.
- Confirmar qual versão do modelo base você está usando.
- Comparar limite de receita e escopo de uso da Community License.
- Decidir se o projeto precisa de Enterprise License.
Segunda camada: licença de checkpoints e LoRAs comunitários
Modelos baixados do Civitai ou Hugging Face têm licença na model card. Casos comuns:
- Alguns checkpoints proíbem uso comercial explicitamente.
- Alguns LoRAs permitem apenas uso não comercial.
- Alguns modelos exigem atribuição ou menção de fonte.
Passos de revisão:
- Abrir a model card e procurar o campo License.
- Confirmar se permite uso comercial.
- Se a licença for ambígua, contatar o autor. Não assuma que poder baixar significa poder vender.
Terceira camada: termos de plataforma ou serviço
Se você usa serviço em nuvem ou API, como Stability AI API ou outro fornecedor, os termos podem definir:
- se a imagem gerada pode ser usada comercialmente;
- se pode ser redistribuída;
- se pode ser vendida como parte de um serviço.
Passos de revisão:
- Abrir os termos de serviço da plataforma.
- Procurar seções sobre direitos de uso e distribuição de conteúdo gerado.
- Confirmar se o seu uso se encaixa.
Check-list antes de usar assets comerciais
Antes de cada projeto comercial, revise nesta ordem:
## Check-list de uso comercial
1. □ A licença do modelo base permite uso comercial?
2. □ A licença do checkpoint/LoRA comunitário permite uso comercial?
3. □ Os termos da plataforma ou serviço combinam com o uso?
4. □ O prompt contém marcas ou termos comerciais?
5. □ O prompt contém nomes de pessoas reais ou figuras públicas?
6. □ O prompt contém referências a estilos de artistas que precisam ser verificadas?
7. □ A imagem gerada será usada em publicidade, entrega a cliente ou asset pago?
8. □ Se houver dúvida, você consultou o autor ou orientação jurídica?
Esta check-list não é orientação jurídica, mas um alerta de risco. Se algo não estiver claro, escolha modelos e materiais com uso comercial explicitamente permitido ou consulte um profissional.
Check-list de solução de problemas: localizar a falha e corrigir
Você escreveu o prompt conforme o modelo, mas o resultado não bate. Não reescreva tudo. Revise ponto por ponto.
Tabela rápida de diagnóstico
| Sintoma | Causa mais provável | Primeiro revise | Correção |
|---|---|---|---|
| Dedos tortos, seis dedos, mãos grudadas | Modelo fraco em mãos, Negative prompt pouco específico | Tipo de modelo, se o Negative prompt inclui mãos | Trocar para checkpoint melhor em mãos, adicionar bad hands, mutated hands, extra fingers |
| Rosto deformado, traços assimétricos | Modelo fraco em rostos, prompt com poucos detalhes faciais | Tipo de modelo, detalhes de rosto no prompt positivo | Usar checkpoint de retrato realista, adicionar traços faciais |
| Composição desviada, corte incorreto | Faltam termos de composição, tamanho incompatível com prompt | Termos de enquadramento e composição, largura/altura | Adicionar medium shot, centered, full body, ajustar proporção |
| Estilo incorreto, imagem confusa | Tendência do modelo em conflito, falta trigger de LoRA | Tipo de checkpoint, triggers do LoRA | Trocar para checkpoint de estilo adequado, adicionar trigger do LoRA |
| Imagem borrada, detalhes perdidos | Steps baixos, CFG baixo, faltam termos de qualidade | Steps e CFG no KSampler, termos de qualidade | Subir steps para 25-30, CFG para 7-10, adicionar termos de qualidade |
| Cor estranha, luz pouco natural | Modelo responde pouco a termos de luz, pesos em conflito | Peso dos termos de luz, termos contraditórios | Ajustar peso da luz, remover termos contraditórios |
| Sujeito pouco visível, imagem bagunçada | Prompt com palavras demais, sujeito sem prioridade | Se o sujeito vem primeiro, se tem peso | Mover sujeito para o início e reforçar com peso |
| Geração muito lenta, VRAM cheia | Resolução alta, batch grande, muitos nós de pós-processamento | Tamanho, batch, estrutura do workflow | Baixar para 512×512, batch em 1, desativar pós-processamento |
Revise em ordem e não mude muitas variáveis de uma vez
O pior no diagnóstico é mudar modelo, prompt e parâmetros ao mesmo tempo. Se melhorar, você não sabe o que funcionou. Na próxima vez, começa do zero.
Ordem recomendada:
- Fixar seed, tamanho, steps, CFG e sampler.
- Revisar primeiro o modelo: o checkpoint combina com a cena? O LoRA está carregado corretamente?
- Revisar depois o prompt: o sujeito está no início? A composição é clara? Os termos de qualidade estão moderados?
- Revisar por fim os parâmetros: steps são suficientes? CFG está em faixa razoável?
- Mudar uma coisa por vez, gerar comparação e registrar diferença.
Passos concretos para problemas comuns
Problema 1: mãos
# Passos de revisão
1. Revisar modelo: você usa um checkpoint de retrato realista?
2. Revisar Negative prompt: ele inclui `bad hands, mutated hands, extra fingers`?
3. Revisar prompt positivo: há descrição de mãos, como `hands visible, holding object`?
# Correção
- Se o modelo for checkpoint anime, testar com um modelo realista.
- Adicionar termos de mãos ao Negative prompt; o peso pode subir: (bad hands:1.2).
- Descrever claramente a ação das mãos e evitar frases vagas.
Problema 2: composição
# Passos de revisão
1. Revisar prompt positivo: há termos de enquadramento como portrait, medium shot, full body?
2. Revisar tamanho: a proporção combina com a composição? Avatar 1:1, pôster 2:3 ou 9:16.
3. Revisar estrutura do prompt: o sujeito está no início?
# Correção
- Adicionar enquadramento: `medium shot, centered composition`.
- Ajustar tamanho: avatar 512×512 ou 1024×1024; pôster 768×1152 ou proporção parecida.
- Mover o sujeito para a primeira frase do prompt.
Problema 3: estilo misturado
# Passos de revisão
1. Revisar checkpoint: ele combina com o estilo alvo, realista, anime ou concept?
2. Revisar LoRA: está carregado corretamente e tem triggers?
3. Revisar prompt: os termos de estilo são claros? Há estilos contraditórios?
# Correção
- Trocar para checkpoint que combine com o estilo.
- Se usar LoRA, confirmar trigger e adicionar ao prompt.
- Remover estilos contraditórios. Se o positivo diz `anime`, o negativo não deve dizer `anime`.
Problema 4: imagem borrada
# Passos de revisão
1. Revisar steps: estão abaixo de 20?
2. Revisar CFG: está abaixo de 7?
3. Revisar termos de qualidade: falta `high resolution, detailed` no prompt positivo?
# Correção
- Subir steps para 25-30.
- Configurar CFG em 7-10.
- Adicionar termos de qualidade, mas sem empilhar.
Registrar o diagnóstico
Depois de diagnosticar, vale anotar:
## Registro de diagnóstico
- Problema original: dedos tortos
- Modelo: SDXL base → realisticVision checkpoint
- Prompt: adicionado (bad hands:1.2)
- Resultado: mãos melhoraram, mas o rosto ainda deforma
- Próximo passo: adicionar termos negativos para rosto
Assim você constrói sua própria biblioteca de diagnóstico. Na próxima vez que algo parecido aparecer, parte das suas anotações.
Próximo passo e leituras úteis
Artigos do site
- Guia de introdução ao ComfyUI: da instalação à primeira imagem com Stable Diffusion
- Guia para reutilizar workflows do ComfyUI: como salvar, importar e iterar workflows
- Guia para escolher modelos Stable Diffusion: comparação SDXL vs SD 3.5 vs FLUX
Documentação oficial
- Stability AI License: limites de licença para uso comercial
- Documentação do Hugging Face Diffusers: explicação oficial sobre prompt e Negative prompt
- Tutorial ComfyUI Text to Image: nós de prompt dentro do workflow
Prompt não é mágica; é estrutura. Se você domina design em camadas, sintaxe de pesos e iteração cuidadosa do Negative prompt, consegue gerar imagens de alta qualidade de forma estável no ComfyUI.
Lembre de três pontos:
- Primeiro escreva sujeito, cena e composição; no fim, estilo e termos de qualidade
- Adicione Negative prompt conforme a falha, passo a passo, sem empilhar
- Antes de uso comercial, revise licença do modelo e termos da plataforma
Como transformar um modelo de prompt do Stable Diffusion em workflow reutilizável
A partir de uso, sujeito, cena, composição, Negative prompt, modelo e parâmetros do ComfyUI, transforme um prompt em um processo de geração testável e reutilizável.
⏱️ Estimated time: 35 min
- 1
Step 1: Definir o uso e o núcleo visual
Decida primeiro se o objetivo é imagem de produto, avatar, pôster ou asset de jogo; depois escreva sujeito, ação, material, cena e composição. - 2
Step 2: Preencher o prompt positivo por camadas
Organize camada de sujeito, camada de cena, camada de composição e camada de qualidade. Não comece empilhando masterpiece, 8k ou cinematic. - 3
Step 3: Testar primeiro com um prompt mínimo
Fixe modelo, tamanho, seed e sampler. Verifique apenas se sujeito, cena, composição e luz foram entendidos. - 4
Step 4: Adicionar Negative prompt conforme a falha
Trate separadamente problemas de mãos, rosto, composição, estilo e qualidade. Adicione só um pequeno grupo de termos negativos por iteração. - 5
Step 5: Iterar no ComfyUI com seed fixo
Quando encontrar um resultado próximo do objetivo, fixe o seed. Em cada rodada, mude apenas uma categoria: sujeito, fundo, luz, estilo ou parâmetros. - 6
Step 6: Registrar modelo e revisão comercial
Salve prompt, Negative prompt, modelo, LoRA, tamanho, seed, CFG, sampler e conclusão da verificação de licença para facilitar reutilização e rastreabilidade.
FAQ
Por que minha imagem fica completamente diferente quando copio o prompt de outra pessoa?
Um Negative prompt mais longo é melhor?
Qual é a diferença entre a estrutura de prompt para produto, avatar, pôster e asset de jogo?
Pesos, parênteses, vírgulas e ordem realmente importam?
O que fazer se o mesmo prompt piora ao trocar de modelo?
Posso escrever nomes de marcas ou pessoas reais em pôsteres e imagens de produto comerciais?
29 min de leitura · Publicado em: 3 jun 2026 · Atualizado em: 30 jul 2026
Guia prático de ComfyUI e Stable Diffusion
Se você chegou pela busca, o caminho mais rápido é ir para o post anterior ou próximo desta série.
Anterior
Guia para escolher um modelo Stable Diffusion: da qualidade da imagem à licença
Não sabe qual modelo Stable Diffusion escolher? Este guia compara SDXL, SD 3.5 e FLUX.1 por qualidade de imagem, VRAM, maturidade do ecossistema e licença comercial, com passos de teste no ComfyUI e armadilhas comuns.
Parte 3 de 10
Próximo
ControlNet no ComfyUI: controle poses e composição com OpenPose, Canny e Depth
Configure o ControlNet no ComfyUI, relacione pré-processadores e modelos, ajuste força e intervalo, combine controles e corrija workflows sem efeito.
Parte 5 de 10



Comentários
Entre com GitHub para comentar