FLUX.1 Kontext vs Midjourney V7, GPT-4o Image e Ideogram 3.0: o que escolher para gerar imagens

29 agosto 20269 visualizações

Testamos quatro redes neurais populares quanto à consistência de personagens, edição local, transferência de estilo e velocidade. O FLUX.1 Kontext se mostrou o mais rápido e preciso na maioria dos cenários, embora na estilização de Van Gogh o Midjourney V7 lidere.

FLUX.1 Kontext vs Midjourney V7, GPT-4o Image e Ideogram 3.0: o que escolher para gerar imagens

No começo de 2025, a Black Forest Labs apresentou um novo modelo de geração de imagens, o FLUX.1 Kontext. Ele rapidamente se espalhou pelas redes sociais e reviews: blogueiros mostram como o modelo lida com composição, estilo e velocidade. O burburinho em torno dele é comparável aos lançamentos das redes neurais mais aguardadas, então decidimos verificar até que ponto esse alvoroço é justificado. Para entender se há uma vantagem real, rodamos os mesmos cenários em quatro modelos-chave: Midjourney V7, GPT-4o Image, Ideogram 3.0 e o próprio FLUX.1 Kontext.

Como testamos

Formulamos o mesmo prompt para cada modelo e avaliamos o resultado com base em quatro critérios. Não é um estudo de laboratório, mas uma comparação prática que reproduz tarefas típicas de um designer ou criador de conteúdo.

Aqui está a lista de verificações:

  • manter o mesmo personagem em cenas diferentes;
  • edição pontual de detalhes específicos sem afetar o restante da imagem;
  • transferência do estilo de um artista famoso;
  • velocidade de geração.

Consistência do personagem

Quando você cria uma série de ilustrações ou um storyboard, o herói não pode "mudar de rosto" de um quadro para outro. Se o personagem se desfaz entre as cenas, a narrativa se perde e o espectador não consegue conectar as imagens em uma história única. Por isso, a estabilidade do personagem é crítica não só para a arte, mas também para campanhas publicitárias, quadrinhos e animatics.

Pedimos aos modelos que retratassem uma jovem com cabelos ruivos e ondulados usando uma jaqueta azul. Ela deveria aparecer em um parque urbano, depois em um café, em uma biblioteca e em um show — com as mesmas roupas.

O FLUX.1 Kontext passou no teste melhor que os outros: traços faciais, penteado e jaqueta permanecem reconhecíveis em todas as cenas. O Midjourney V7 chegou perto disso, mas perdeu a consistência do personagem na última cena. O GPT-4o Image preserva bem a aparência, embora haja pequenas divergências nos detalhes do rosto. O mais fraco foi o Ideogram 3.0: a protagonista literalmente oscila entre estilos — ora parece um personagem de desenho animado, ora quase realista.

Edição local

A segunda tarefa importante é ajustar pontualmente uma imagem sem redesenhar tudo. Esse tipo de edição economiza tempo e recursos, especialmente quando é preciso fazer correções rápidas em um visual já pronto. Mas se o modelo também altera os outros elementos, o sentido dessa função se perde.

Primeiro, geramos uma foto de um gato no parapeito da janela e, em seguida, pedimos para mudar a cor da coleira para vermelho, adicionar um sino dourado e colocar um vaso de girassóis ao lado.

O FLUX.1 Kontext executou as edições corretamente: coleira, sino e vaso apareceram onde deveriam. No entanto, a imagem mudou mais do que gostaríamos — o gato virou levemente a cabeça em comparação com o original. O GPT-4o Image também deu conta, mas introduziu mudanças de cor desnecessárias, fazendo a imagem parecer diferente. Já o Midjourney V7 e o Ideogram 3.0, no momento do teste, não ofereciam edição local, então não foi possível compará-los plenamente aqui.

Transferência de estilo

O estilo artístico ajuda a criar imagens para uma marca, um clima ou uma época específicos. Uma boa transferência de estilo não é uma simples correção de cor, mas um verdadeiro "revestimento" da cena em uma nova abordagem. Esse recurso é frequentemente necessário em branding, ensaios de moda e design de redes sociais.

Pedimos aos modelos que mostrassem um cachorro correndo por um campo no estilo de "A Noite Estrelada" de Van Gogh. O melhor resultado foi do Midjourney V7 — o estilo é transmitido de forma expressiva e muito próxima do original. O FLUX.1 Kontext fica logo atrás, reproduzindo muito bem as pinceladas características e a paleta de Van Gogh. O GPT-4o Image entrega uma estilização boa, mas não tão vibrante, e o Ideogram 3.0 claramente perde neste teste.

Velocidade

O tempo de geração é crítico ao trabalhar com grandes volumes de conteúdo. Se você precisa rodar dezenas de variações para testes A/B ou montar rapidamente uma série de posts, cada segundo conta. Aqui o líder é óbvio:

  • FLUX.1 Kontext — 3–5 segundos;
  • Ideogram 3.0 — 10–15 segundos;
  • Midjourney V7 — 15–20 segundos;
  • GPT-4o Image — 20–25 segundos.

Ou seja, o participante mais rápido consegue entregar um resultado quatro a cinco vezes mais rápido que o mais lento. Isso é especialmente perceptível quando você precisa gerar não uma imagem, mas um lote inteiro.

O que escolher?

Não há um vencedor absoluto para todos os casos, mas a direção geral é clara. Vamos resumir os resultados em uma tabela:

ModeloPersonagemEdições locaisEstiloVelocidade
FLUX.1 KontextÓtimoBomBomÓtimo
Midjourney V7BomIndisponívelÓtimoBom
GPT-4o ImageBomBomBomMédio
Ideogram 3.0FracoIndisponívelMédioMédio

O FLUX.1 Kontext parece a solução mais equilibrada. Ele é rápido, mantém bem o personagem e lida com confiança com edições locais e estilização. Esse conjunto o torna um versátil conveniente para criadores de conteúdo, designers e profissionais de marketing que precisam de geração rápida e precisa.

Ao mesmo tempo, para tarefas específicas, os líderes podem ser outros. Se a prioridade é um estilo artístico expressivo, vale a pena considerar o Midjourney V7. Se a precisão no trabalho com detalhes e texto é o mais importante, o GPT-4o Image será útil. E o Ideogram 3.0, por enquanto, perde nos principais parâmetros, embora tenha seus próprios recursos que não entraram nesta comparação.

Perguntas mais frequentes

FLUX.1 Kontext vs Midjourney V7, GPT-4o Image e Ideogram 3.0: o que escolher para gerar imagens