২০২৫ সালের শুরুতে ব্ল্যাক ফরেস্ট ল্যাবস নতুন ইমেজ জেনারেশন মডেল FLUX.1 Kontext প্রকাশ করেছে। এটি দ্রুত সোশ্যাল মিডিয়া এবং রিভিউতে ছড়িয়ে পড়েছে: ব্লগাররা দেখাচ্ছেন কীভাবে মডেলটি কম্পোজিশন, স্টাইল এবং গতির সাথে মোকাবিলা করে। এর আশেপাশের শোরগোল সবচেয়ে প্রত্যাশিত নিউরাল নেটওয়ার্কগুলির রিলিজের সাথে তুলনীয়, তাই আমরা পরীক্ষা করার সিদ্ধান্ত নিয়েছি যে এই হাইপ কতটা যুক্তিযুক্ত। এর আসল সুবিধা আছে কিনা তা বোঝার জন্য, আমরা চারটি মূল মডেলের মাধ্যমে একই ধরনের দৃশ্যকল্প চালিয়েছি: Midjourney V7, GPT-4o Image, Ideogram 3.0 এবং নিজেই FLUX.1 Kontext।
আমরা কীভাবে পরীক্ষা করেছি
আমরা প্রতিটি মডেলের জন্য একই প্রম্পট তৈরি করেছি এবং চারটি মানদণ্ডে ফলাফল মূল্যায়ন করেছি। এটি একটি ল্যাবরেটরি গবেষণা নয়, বরং একটি ব্যবহারিক তুলনা যা ডিজাইনার বা কন্টেন্ট নির্মাতার সাধারণ কাজগুলিকে প্রতিফলিত করে।
এখানে পরীক্ষাগুলির তালিকা দেওয়া হলো:
- বিভিন্ন দৃশ্যে একই চরিত্র বজায় রাখা;
- বাকি ছবিকে প্রভাবিত না করে নির্দিষ্ট বিবরণে পয়েন্ট-বাই-পয়েন্ট পরিবর্তন;
- বিখ্যাত শিল্পীর শৈলী স্থানান্তর;
- জেনারেশনের গতি।
চরিত্রের ধারাবাহিকতা
যখন আপনি ইলাস্ট্রেশনের একটি সিরিজ বা স্টোরিবোর্ড তৈরি করেন, তখন নায়কের ফ্রেম থেকে ফ্রেমে "মুখ বদলানো" উচিত নয়। যদি চরিত্রটি দৃশ্যের মধ্যে ভেঙে পড়ে, তাহলে বর্ণনা হারিয়ে যায় এবং দর্শক ছবিগুলিকে একটি একক গল্পে যুক্ত করতে পারে না। তাই নায়কের স্থিতিশীলতা শুধু আর্টের জন্যই নয়, বিজ্ঞাপন প্রচারণা, কমিকস এবং অ্যানিমেটিক্সের জন্যও গুরুত্বপূর্ণ।
আমরা মডেলগুলিকে একটি নীল জ্যাকেট পরা লাল ঢেউ খেলানো চুলের তরুণীকে চিত্রিত করতে বলেছি। তাকে শহরের পার্কে, তারপর ক্যাফেতে, লাইব্রেরিতে এবং কনসার্টে — একই পোশাকে উপস্থিত হতে হয়েছিল।
FLUX.1 Kontext বাকিদের চেয়ে ভালো পরীক্ষায় উত্তীর্ণ হয়েছে: মুখের বৈশিষ্ট্য, চুলের স্টাইল এবং জ্যাকেট সব দৃশ্যে চেনা যায়। Midjourney V7 এর কাছাকাছি ছিল, কিন্তু শেষ দৃশ্যে চরিত্রের ধারাবাহিকতা হারিয়ে ফেলেছে। GPT-4o Image চেহারা ভালোভাবে ধরে রাখে, তবে মুখের বিবরণে সামান্য পার্থক্য রয়েছে। সবার চেয়ে খারাপ করেছে Ideogram 3.0: নায়িকা আক্ষরিক অর্থে স্টাইলগুলির মধ্যে লাফিয়ে বেড়াচ্ছে — কখনও কার্টুন চরিত্রের মতো দেখাচ্ছে, কখনও প্রায় বাস্তবসম্মত।

স্থানীয় সম্পাদনা
দ্বিতীয় গুরুত্বপূর্ণ কাজটি হলো ছবিটি পুরোপুরি পুনরায় আঁকা ছাড়াই পয়েন্ট-বাই-পয়েন্ট সংশোধন করা। এই ধরনের সম্পাদনা সময় এবং সম্পদ সাশ্রয় করে, বিশেষ করে যখন প্রস্তুত ভিজ্যুয়ালে দ্রুত পরিবর্তন আনার প্রয়োজন হয়। কিন্তু যদি মডেলটি অন্যান্য উপাদানও পরিবর্তন করে, তাহলে এই ফাংশনের অর্থ হারিয়ে যায়।
প্রথমে আমরা জানালার সিলে একটি বিড়ালের ছবি তৈরি করেছি, তারপর কলারটির রঙ লাল করতে, একটি সোনালি ঘণ্টা যোগ করতে এবং পাশে সূর্যমুখীর ফুলদানি রাখতে বলেছি।
FLUX.1 Kontext সঠিকভাবে সম্পাদনা করেছে: কলার, ঘণ্টা এবং ফুলদানি যেখানে প্রয়োজন সেখানে উপস্থিত হয়েছে। তবে ছবিটি যতটা চাওয়া হয়েছিল তার চেয়ে বেশি পরিবর্তিত হয়েছে — বিড়ালটি মূলের তুলনায় মাথা কিছুটা ঘুরিয়েছে। GPT-4o Image-ও কাজটি করেছে, কিন্তু অতিরিক্ত রঙের পরিবর্তন এনেছে, যার ফলে ছবিটি ভিন্ন দেখাচ্ছে। আর Midjourney V7 এবং Ideogram 3.0 পরীক্ষার সময় স্থানীয় সম্পাদনার সুযোগ দেয়নি, তাই এখানে তাদের সম্পূর্ণ তুলনা করা সম্ভব হয়নি।

স্টাইল স্থানান্তর
শৈল্পিক স্টাইল একটি নির্দিষ্ট ব্র্যান্ড, মেজাজ বা যুগের জন্য ছবি তৈরি করতে সাহায্য করে। ভালো স্টাইল স্থানান্তর মানে শুধু রঙ সংশোধন নয়, বরং দৃশ্যটিকে একটি নতুন পদ্ধতিতে সত্যিকারের "সাজানো"। এই কৌশলটি প্রায়শই ব্র্যান্ডিং, ফ্যাশন শুট এবং সোশ্যাল মিডিয়া ডিজাইনে প্রয়োজন।
আমরা মডেলগুলিকে ভ্যান গঘের "স্টারি নাইট" স্টাইলে মাঠ জুড়ে দৌড়ানো একটি কুকুর দেখাতে বলেছি। সেরা ফলাফল দেখিয়েছে Midjourney V7 — স্টাইলটি অভিব্যক্তিপূর্ণভাবে এবং মূলের খুব কাছাকাছি স্থানান্তরিত হয়েছে। FLUX.1 Kontext এর থেকে খুব সামান্য পিছিয়ে, যা ভ্যান গঘের বৈশিষ্ট্যযুক্ত ব্রাশস্ট্রোক এবং প্যালেটটি চমৎকারভাবে পুনরুত্পাদন করে। GPT-4o Image একটি ভালো, কিন্তু তেমন উজ্জ্বল নয় এমন স্টাইলাইজেশন দেয়, আর Ideogram 3.0 এই পরীক্ষায় স্পষ্টভাবে পিছিয়ে পড়ে।
গতি
বিপুল পরিমাণ কন্টেন্ট নিয়ে কাজ করার সময় জেনারেশনের সময় গুরুত্বপূর্ণ। A/B-পরীক্ষার জন্য কয়েক ডজন ভেরিয়েন্ট চালাতে বা দ্রুত পোস্টের সিরিজ তৈরি করতে হলে, প্রতিটি সেকেন্ড মূল্যবান। এখানে নেতা স্পষ্ট:
- FLUX.1 Kontext — ৩–৫ সেকেন্ড;
- Ideogram 3.0 — ১০–১৫ সেকেন্ড;
- Midjourney V7 — ১৫–২০ সেকেন্ড;
- GPT-4o Image — ২০–২৫ সেকেন্ড।
দাঁড়াচ্ছে, সবচেয়ে দ্রুত অংশগ্রহণকারী সবচেয়ে ধীরের চেয়ে চার থেকে পাঁচ গুণ দ্রুত ফলাফল দিতে সক্ষম। এটি বিশেষভাবে অনুভূত হয় যখন একটি ছবি নয়, বরং পুরো একটি গুচ্ছ তৈরি করতে হয়।

কী বেছে নেবেন?
সব ক্ষেত্রে একক বিজয়ী নেই, তবে সাধারণ দিকটি স্পষ্ট। ফলাফলগুলি একটি টেবিলে সংক্ষিপ্ত করা যাক:
| মডেল | চরিত্র | স্থানীয় সম্পাদনা | স্টাইল | গতি |
|---|---|---|---|---|
| FLUX.1 Kontext | চমৎকার | ভালো | ভালো | চমৎকার |
| Midjourney V7 | ভালো | অনুপলব্ধ | চমৎকার | ভালো |
| GPT-4o Image | ভালো | ভালো | ভালো | মাঝারি |
| Ideogram 3.0 | দুর্বল | অনুপলব্ধ | মাঝারি | মাঝারি |
FLUX.1 Kontext সবচেয়ে সুষম সমাধান বলে মনে হচ্ছে। এটি দ্রুত, চরিত্রটি ভালোভাবে ধরে রাখে এবং স্থানীয় সম্পাদনা ও স্টাইলাইজেশনে আত্মবিশ্বাসের সাথে কাজ করে। এই ধরনের বৈশিষ্ট্য এটিকে কন্টেন্ট নির্মাতা, ডিজাইনার এবং মার্কেটারদের জন্য একটি সুবিধাজনক সর্ব-উদ্দেশ্য টুল করে তোলে যাদের দ্রুত এবং নির্ভুল জেনারেশন প্রয়োজন।
একই সাথে, নির্দিষ্ট কাজের জন্য নেতারা ভিন্ন হতে পারে। যদি অগ্রাধিকারটি অভিব্যক্তিপূর্ণ শৈল্পিক স্টাইল হয়, তাহলে Midjourney V7 দেখার মতো। যদি বিবরণ এবং টেক্সট নিয়ে কাজের নির্ভুলতা গুরুত্বপূর্ণ হয়, তাহলে GPT-4o Image কার্যকর হবে। আর Ideogram 3.0 আপাতত মূল প্যারামিটারগুলিতে পিছিয়ে আছে, যদিও এর নিজস্ব ফাংশনও রয়েছে যা এই তুলনায় অন্তর্ভুক্ত হয়নি।



