FLUX.1 Kontext frente a Midjourney V7, GPT-4o Image e Ideogram 3.0: qué elegir para la generación de imágenes

29 agosto 20269 vistas

Probamos cuatro redes neuronales populares en consistencia de personajes, edición local, transferencia de estilo y velocidad. FLUX.1 Kontext resultó ser el más rápido y preciso en la mayoría de los escenarios, aunque en la estilización de Van Gogh lidera Midjourney V7.

FLUX.1 Kontext frente a Midjourney V7, GPT-4o Image e Ideogram 3.0: qué elegir para la generación de imágenes

A principios de 2025, Black Forest Labs presentó un nuevo modelo de generación de imágenes, FLUX.1 Kontext. Rápidamente se extendió por las redes sociales y las reseñas: los creadores de contenido muestran cómo el modelo maneja la composición, el estilo y la velocidad. El revuelo que lo rodea es comparable al de los lanzamientos de las redes neuronales más esperadas, por lo que decidimos comprobar hasta qué punto es justificada tanta expectación. Para entender si tiene una ventaja real, ejecutamos los mismos escenarios en cuatro modelos clave: Midjourney V7, GPT-4o Image, Ideogram 3.0 y el propio FLUX.1 Kontext.

Cómo probamos

Formulamos el mismo prompt para cada modelo y evaluamos el resultado según cuatro criterios. No es una investigación de laboratorio, sino una comparación práctica que replica las tareas típicas de un diseñador o creador de contenido.

Esta es la lista de comprobaciones:

  • mantener al mismo personaje en diferentes escenas;
  • modificar con precisión detalles concretos sin afectar al resto de la imagen;
  • transferir el estilo de un artista conocido;
  • velocidad de generación.

Consistencia del personaje

Cuando creas una serie de ilustraciones o un storyboard, el protagonista no debe «cambiar de cara» de un fotograma a otro. Si el personaje se desmorona entre escenas, se pierde la narrativa y el espectador no puede conectar las imágenes en una historia coherente. Por eso, la estabilidad del personaje es crítica no solo para el arte, sino también para campañas publicitarias, cómics y animáticas.

Pedimos a los modelos que representaran a una mujer joven con el pelo pelirrojo y ondulado y una chaqueta azul. Debía aparecer en un parque urbano, luego en una cafetería, en una biblioteca y en un concierto, con la misma ropa.

FLUX.1 Kontext superó la prueba mejor que los demás: los rasgos faciales, el peinado y la chaqueta se mantienen reconocibles en todas las escenas. Midjourney V7 estuvo cerca, pero en la última escena perdió la coherencia del personaje. GPT-4o Image conserva bien el aspecto, aunque hay pequeñas discrepancias en los detalles del rostro. El peor fue Ideogram 3.0: la protagonista literalmente salta entre estilos, a veces parece un personaje de dibujos animados y otras, casi realista.

Edición local

La segunda tarea importante es corregir con precisión una imagen sin redibujarla por completo. Este tipo de edición ahorra tiempo y recursos, especialmente cuando necesitas hacer ajustes rápidos a un visual ya terminado. Pero si el modelo además cambia el resto de los elementos, esa función pierde su sentido.

Primero generamos una foto de un gato en el alféizar de una ventana y luego pedimos cambiar el color del collar a rojo, añadir un cascabel dorado y colocar junto a él un jarrón con girasoles.

FLUX.1 Kontext realizó los ajustes correctamente: el collar, el cascabel y el jarrón aparecieron donde debían. Sin embargo, la imagen cambió más de lo deseado: el gato giró ligeramente la cabeza en comparación con el original. GPT-4o Image también lo logró, pero introdujo cambios de color innecesarios que hacen que la imagen se vea distinta. En cambio, Midjourney V7 e Ideogram 3.0 no ofrecían edición local en el momento de la prueba, por lo que no pudimos compararlos plenamente aquí.

Transferencia de estilo

El estilo artístico ayuda a crear imágenes para una marca, un ambiente o una época concretos. Una buena transferencia de estilo no es un simple ajuste de color, sino un verdadero «disfraz» de la escena con una nueva manera. Este recurso suele ser necesario en branding, sesiones de moda y diseño de redes sociales.

Pedimos a los modelos que mostraran a un perro corriendo por un campo al estilo de «La noche estrellada» de Van Gogh. El mejor resultado lo obtuvo Midjourney V7: el estilo se transmite de forma expresiva y muy cercana al original. Le sigue muy de cerca FLUX.1 Kontext, que reproduce excelentemente las pinceladas características y la paleta de Van Gogh. GPT-4o Image ofrece una estilización buena, pero no tan llamativa, e Ideogram 3.0 pierde claramente en esta prueba.

Velocidad

El tiempo de generación es crítico cuando se trabaja con grandes volúmenes de contenido. Si necesitas probar decenas de variantes para pruebas A/B o crear rápidamente una serie de publicaciones, cada segundo cuenta. Aquí el líder es evidente:

  • FLUX.1 Kontext: 3–5 segundos;
  • Ideogram 3.0: 10–15 segundos;
  • Midjourney V7: 15–20 segundos;
  • GPT-4o Image: 20–25 segundos.

Resulta que el participante más rápido puede generar resultados de cuatro a cinco veces más rápido que el más lento. Esto se nota especialmente cuando necesitas generar no una imagen, sino un lote completo.

¿Qué elegir?

No hay un ganador único para todos los casos, pero la tendencia general está clara. Resumamos los resultados en una tabla:

ModeloPersonajeEdición localEstiloVelocidad
FLUX.1 KontextExcelenteBuenaBuenoExcelente
Midjourney V7BuenoNo disponibleExcelenteBueno
GPT-4o ImageBuenoBuenaBuenoMedia
Ideogram 3.0DébilNo disponibleMedioMedia

FLUX.1 Kontext parece la opción más equilibrada. Es rápido, mantiene bien al personaje y maneja con soltura la edición local y la estilización. Este conjunto lo convierte en una herramienta versátil y cómoda para creadores de contenido, diseñadores y especialistas en marketing que necesitan una generación rápida y precisa.

Sin embargo, para tareas concretas los líderes pueden ser otros. Si la prioridad es un estilo artístico expresivo, vale la pena mirar a Midjourney V7. Si lo importante es la precisión con los detalles y el texto, GPT-4o Image será útil. E Ideogram 3.0, por ahora, pierde en los parámetros clave, aunque también tiene funciones propias que no entraron en esta comparación.

Preguntas frecuentes

FLUX.1 Kontext frente a Midjourney V7, GPT-4o Image e Ideogram 3.0: qué elegir para la generación de imágenes