FLUX.1 Kontext vs Midjourney V7, GPT-4o Image, dan Ideogram 3.0: mana yang dipilih untuk menghasilkan gambar

29 Agustus 20269 tampilan

Kami menguji empat jaringan saraf populer untuk konsistensi karakter, pengeditan lokal, transfer gaya, dan kecepatan. FLUX.1 Kontext terbukti paling cepat dan akurat di sebagian besar skenario, meskipun dalam penataan gaya Van Gogh, Midjourney V7 memimpin.

FLUX.1 Kontext vs Midjourney V7, GPT-4o Image, dan Ideogram 3.0: mana yang dipilih untuk menghasilkan gambar

Pada awal tahun 2025, Black Forest Labs memperkenalkan model generasi gambar baru, FLUX.1 Kontext. Model ini dengan cepat menyebar di media sosial dan berbagai ulasan: para blogger menunjukkan bagaimana model ini menangani komposisi, gaya, dan kecepatan. Kehebohan di sekitarnya sebanding dengan perilisan jaringan saraf yang paling dinantikan, jadi kami memutuskan untuk menguji seberapa beralasan kegaduhan ini. Untuk memahami apakah model ini benar-benar memiliki keunggulan nyata, kami menjalankan skenario yang sama melalui empat model kunci: Midjourney V7, GPT-4o Image, Ideogram 3.0, dan FLUX.1 Kontext itu sendiri.

Cara Kami Menguji

Kami merumuskan prompt yang sama untuk setiap model dan mengevaluasi hasilnya berdasarkan empat kriteria. Ini bukan penelitian laboratorium, melainkan perbandingan praktis yang mengulangi tugas-tugas umum seorang desainer atau pembuat konten.

Berikut daftar pengujiannya:

  • menjaga karakter yang sama di berbagai adegan;
  • mengubah detail tertentu secara presisi tanpa memengaruhi bagian gambar lainnya;
  • mentransfer gaya seniman terkenal;
  • kecepatan generasi.

Konsistensi Karakter

Saat Anda membuat serangkaian ilustrasi atau storyboard, karakter tidak boleh "berganti wajah" dari satu bingkai ke bingkai lainnya. Jika karakter berantakan di antara adegan, narasi akan hilang, dan penonton tidak dapat menghubungkan gambar-gambar tersebut menjadi satu cerita yang utuh. Oleh karena itu, stabilitas karakter sangat penting tidak hanya untuk seni, tetapi juga untuk kampanye iklan, komik, dan animatik.

Kami meminta model untuk menggambarkan seorang wanita muda dengan rambut keriting merah dan jaket biru. Dia harus muncul di taman kota, lalu di kafe, di perpustakaan, dan di konser — dengan pakaian yang sama.

FLUX.1 Kontext lulus uji ini lebih baik daripada yang lain: fitur wajah, gaya rambut, dan jaket tetap dikenali di semua adegan. Midjourney V7 hampir mencapai hal ini, tetapi kehilangan konsistensi karakter menjelang adegan terakhir. GPT-4o Image cukup baik dalam mempertahankan penampilan, namun ada sedikit perbedaan pada detail wajah. Yang paling lemah adalah Ideogram 3.0: karakternya benar-benar melompat-lompat antar gaya — kadang terlihat seperti karakter kartun, kadang hampir realistis.

Pengeditan Lokal

Tugas penting kedua adalah mengoreksi gambar secara presisi tanpa menggambar ulang seluruhnya. Pengeditan semacam ini menghemat waktu dan sumber daya, terutama saat Anda perlu melakukan revisi cepat pada visual yang sudah jadi. Tetapi jika model ikut mengubah elemen lain, fungsi seperti ini menjadi tidak berguna.

Pertama, kami membuat foto kucing di ambang jendela, lalu meminta untuk mengubah warna kalung menjadi merah, menambahkan lonceng emas, dan meletakkan vas berisi bunga matahari di sebelahnya.

FLUX.1 Kontext melakukan koreksi dengan benar: kalung, lonceng, dan vas muncul di tempat yang seharusnya. Namun, gambar berubah lebih banyak dari yang diinginkan — kucing sedikit menoleh dibandingkan dengan gambar aslinya. GPT-4o Image juga berhasil, tetapi menambahkan perubahan warna yang tidak perlu, sehingga gambar terlihat berbeda. Sementara itu, Midjourney V7 dan Ideogram 3.0 pada saat pengujian belum menyediakan fitur pengeditan lokal, jadi kami tidak dapat membandingkannya secara menyeluruh di sini.

Transfer Gaya

Gaya artistik membantu menciptakan gambar yang sesuai dengan merek, suasana hati, atau era tertentu. Transfer gaya yang baik bukan sekadar koreksi warna, melainkan benar-benar "mengenakan" adegan dengan gaya baru. Teknik semacam ini sering dibutuhkan dalam branding, pemotretan mode, dan desain media sosial.

Kami meminta model untuk menampilkan seekor anjing berlari melintasi ladang dengan gaya "Starry Night" karya Van Gogh. Hasil terbaik ditunjukkan oleh Midjourney V7 — gayanya tersampaikan dengan ekspresif dan sangat dekat dengan aslinya. Sedikit di bawahnya ada FLUX.1 Kontext, yang mereproduksi sapuan kuas dan palet khas Van Gogh dengan sangat baik. GPT-4o Image memberikan stilasi yang bagus, tetapi tidak terlalu mencolok, sementara Ideogram 3.0 jelas kalah dalam pengujian ini.

Kecepatan

Waktu generasi sangat penting saat bekerja dengan volume konten yang besar. Jika Anda perlu menjalankan puluhan varian untuk uji A/B atau dengan cepat menyusun serangkaian postingan, setiap detik sangat berharga. Di sini pemimpinnya jelas:

  • FLUX.1 Kontext — 3–5 detik;
  • Ideogram 3.0 — 10–15 detik;
  • Midjourney V7 — 15–20 detik;
  • GPT-4o Image — 20–25 detik.

Jadi, peserta tercepat mampu menghasilkan hasil empat hingga lima kali lebih cepat daripada yang paling lambat. Ini sangat terasa ketika Anda perlu menghasilkan bukan hanya satu gambar, tetapi banyak gambar sekaligus.

Apa yang Harus Dipilih?

Tidak ada pemenang tunggal untuk semua situasi, tetapi arah umumnya jelas. Mari kita rangkum hasilnya dalam sebuah tabel:

ModelKarakterKoreksi LokalGayaKecepatan
FLUX.1 KontextSangat BaikBaikBaikSangat Baik
Midjourney V7BaikTidak TersediaSangat BaikBaik
GPT-4o ImageBaikBaikBaikSedang
Ideogram 3.0LemahTidak TersediaSedangSedang

FLUX.1 Kontext tampak sebagai solusi paling seimbang. Ia cepat, mampu menjaga karakter dengan baik, dan andal menangani koreksi lokal serta stilasi. Kombinasi ini menjadikannya alat serbaguna yang nyaman bagi pembuat konten, desainer, dan pemasar yang membutuhkan generasi cepat dan akurat.

Namun, untuk tugas-tugas tertentu, pemimpinnya bisa berbeda. Jika prioritas Anda adalah gaya artistik yang ekspresif, sebaiknya pertimbangkan Midjourney V7. Jika ketelitian dalam menangani detail dan teks yang penting, GPT-4o Image akan berguna. Sementara Ideogram 3.0 masih kalah dalam parameter-parameter kunci, meskipun ia memiliki fitur-fitur tersendiri yang tidak termasuk dalam perbandingan ini.

Pertanyaan yang sering ditanyakan

FLUX.1 Kontext vs Midjourney V7, GPT-4o Image, dan Ideogram 3.0: mana yang dipilih untuk menghasilkan gambar