FLUX.1 Kontext против Midjourney V7, GPT-4o Image и Ideogram 3.0: что выбрать для генерации картинок

29 августа 20269 просмотров

Проверили четыре популярных нейросети на постоянство персонажей, локальное редактирование, перенос стиля и скорость. FLUX.1 Kontext оказался самым быстрым и точным в большинстве сценариев, хотя в стилизации Ван Гога лидирует Midjourney V7.

FLUX.1 Kontext против Midjourney V7, GPT-4o Image и Ideogram 3.0: что выбрать для генерации картинок

В начале 2025 года Black Forest Labs представила новую модель генерации изображений FLUX.1 Kontext. Она быстро разлетелась по соцсетям и обзорам: блогеры показывают, как модель справляется с композицией, стилем и скоростью. Шумиха вокруг неё сравнима с релизами самых ожидаемых нейросетей, поэтому мы решили проверить, насколько обоснован такой ажиотаж. Чтобы понять, есть ли у неё реальное преимущество, мы прогнали одинаковые сценарии через четыре ключевые модели: Midjourney V7, GPT-4o Image, Ideogram 3.0 и сам FLUX.1 Kontext.

Как мы тестировали

Мы формулировали один и тот же промпт для каждой модели и оценивали результат по четырём критериям. Это не лабораторное исследование, а практическое сравнение, которое повторяет типичные задачи дизайнера или контент-мейкера.

Вот список проверок:

  • сохранение одного и того же персонажа в разных сценах;
  • точечное изменение отдельных деталей без влияния на остальную картинку;
  • перенос стиля известного художника;
  • скорость генерации.

Постоянство персонажа

Когда вы создаёте серию иллюстраций или раскадровку, герой не должен «менять лицо» от кадра к кадру. Если персонаж разваливается между сценами, теряется нарратив, и зритель не может связать картинки в единую историю. Поэтому стабильность героя критична не только для арта, но и для рекламных кампаний, комиксов и аниматиков.

Мы попросили модели изобразить молодую женщину с рыжими волнистыми волосами в синей куртке. Она должна была появиться в городском парке, затем в кафе, в библиотеке и на концерте — в той же одежде.

FLUX.1 Kontext выдержал тест лучше остальных: черты лица, причёска и куртка остаются узнаваемыми во всех сценах. Midjourney V7 был близок к этому, но к последней сцене потерял согласованность персонажа. GPT-4o Image неплохо сохраняет облик, однако в деталях лица есть небольшие расхождения. Слабее всех выступил Ideogram 3.0: героиня буквально скачет между стилями — то выглядит как мультяшный персонаж, то почти реалистично.

Локальное редактирование

Вторая важная задача — точечно поправить изображение, не перерисовывая его целиком. Такое редактирование экономит время и ресурсы, особенно когда нужно быстро внести правки в уже готовый визуал. Но если модель заодно меняет остальные элементы, смысл такой функции теряется.

Сначала мы сгенерировали фото кота на подоконнике, затем попросили изменить цвет ошейника на красный, добавить золотой колокольчик и поставить рядом вазу с подсолнухами.

FLUX.1 Kontext выполнил правки корректно: ошейник, колокольчик и ваза появились там, где нужно. Однако картинка изменилась сильнее, чем хотелось бы — кот немного повернул голову по сравнению с исходником. GPT-4o Image тоже справился, но внёс лишние цветовые изменения, из-за чего изображение выглядит иначе. А вот Midjourney V7 и Ideogram 3.0 на момент тестирования не давали возможности локального редактирования, поэтому полноценно сравнить их здесь не получилось.

Перенос стиля

Художественный стиль помогает создавать картинки под конкретный бренд, настроение или эпоху. Хороший перенос стиля — это не простая цветокоррекция, а настоящее «переодевание» сцены в новую манеру. Такой приём часто нужен в брендинге, модных съёмках и оформлении соцсетей.

Мы попросили модели показать собаку, бегущую по полю, в стиле «Звёздной ночи» Ван Гога. Лучший результат показал Midjourney V7 — стиль передаётся выразительно и очень близко к оригиналу. Совсем немного ему уступает FLUX.1 Kontext, который отлично воспроизводит характерные мазки и палитру Ван Гога. GPT-4o Image даёт хорошую, но не такую яркую стилизацию, а Ideogram 3.0 в этом тесте явно проигрывает.

Скорость

Время генерации критично при работе с большими объёмами контента. Если нужно прогнать десятки вариантов для A/B-тестов или быстро собрать серию постов, каждая секунда на счету. Здесь лидер очевиден:

  • FLUX.1 Kontext — 3–5 секунд;
  • Ideogram 3.0 — 10–15 секунд;
  • Midjourney V7 — 15–20 секунд;
  • GPT-4o Image — 20–25 секунд.

Получается, что самый быстрый участник способен выдавать результат в четыре-пять раз быстрее самого медленного. Это особенно ощутимо, когда нужно сгенерировать не одну картинку, а целую пачку.

Что выбрать?

Однозначного победителя на все случаи нет, но общий вектор понятен. Сведём результаты в таблицу:

МодельПерсонажЛокальные правкиСтильСкорость
FLUX.1 KontextОтличноХорошоХорошоОтлично
Midjourney V7ХорошоНедоступноОтличноХорошо
GPT-4o ImageХорошоХорошоХорошоСредне
Ideogram 3.0СлабоНедоступноСреднеСредне

FLUX.1 Kontext выглядит самым сбалансированным решением. Он быстрый, хорошо держит персонажа и уверенно справляется с локальными правками и стилизацией. Такой набор делает его удобным универсалом для контент-мейкеров, дизайнеров и маркетологов, которым нужна быстрая и точная генерация.

При этом для отдельных задач лидеры могут быть другими. Если приоритет — выразительный художественный стиль, стоит присмотреться к Midjourney V7. Если важна аккуратность работы с деталями и текстом, полезным окажется GPT-4o Image. А Ideogram 3.0 пока проигрывает по ключевым параметрам, хотя у него есть и собственные функции, которые не попали в это сравнение.

Часто задаваемые вопросы

Похожие материалы

Все материалы
FLUX.1 Kontext против Midjourney V7, GPT-4o Image и Ideogram 3.0 — сравнение