সেম্যান্টিক টাস্ক কমপ্লিশন: ভিডিও জেনারেশনে নতুন দৃষ্টিভঙ্গি
আধুনিক ভিডিও জেনারেশন মডেলগুলো «বিড়াল বল নিয়ে খেলছে»—এর মতো ছোট প্রশ্নগুলোর সাথে ভালোভাবে মোকাবিলা করে—ফলাফল সুন্দর এবং বাস্তবসম্মত দেখায়। কিন্তু সিস্টেমটি কি সত্যিই বুঝতে পারে ব্যবহারকারী কী ফলাফল চান? চীনের গবেষকরা SemComp-Bench নামে একটি বেঞ্চমার্ক প্রস্তাব করেছেন, যা শুধু ভিজ্যুয়াল মান নয়, বরং কাজটি অর্থগতভাবে সম্পন্ন হয়েছে কিনা তা পরীক্ষা করে।
Keyu Tu-এর নেতৃত্বে লেখকদের একটি দল (মোট আটজন গবেষক) arXiv-এ SemComp-Bench-এর বিবরণ সহ একটি নিবন্ধ উপস্থাপন করেছে। কাজটি ১৮ আগস্ট ২০২৬ তারিখে প্রকাশিত হয়েছে, এটি কম্পিউটার ভিশন এবং কৃত্রিম বুদ্ধিমত্তার ক্ষেত্রগুলির সাথে সম্পর্কিত। একটি নতুন ধারণা চালু করা হয়েছে—সেম্যান্টিক টাস্ক কমপ্লিশন ভিডিও জেনারেশন, অর্থাৎ ভিডিও জেনারেশন যেখানে কাজটি অর্থগতভাবে সম্পন্ন হয়। এখানে সাফল্য নির্ধারিত হয় না বস্তুগুলো কত মসৃণভাবে চলছে বা ফ্রেম-টু-ফ্রেম রেফারেন্সের সাথে মিলে যাচ্ছে কিনা, বরং নির্ধারিত হয় অনুরোধ করা ফলাফল অর্জিত হয়েছে কিনা এবং নমুনার সাথে অর্থগত সংযোগ বজায় আছে কিনা।
মূল ধারণা হলো «সেম্যান্টিক গ্রাউন্ডিং»। মডেলটিকে শুধু ছবিটি কপি করতে হবে না, বরং কাজের উচ্চ-স্তরের অর্থ বুঝতে হবে: উদাহরণস্বরূপ, যদি রেফারেন্স ছবিতে সাজানো টেবিল দেখানো হয় এবং নির্দেশনায় «চা-পাতি যোগ করুন» বলা হয়, তাহলে চূড়ান্ত ভিডিওতে টেবিলে চা-পাতি দেখা যেতে হবে। এখানে প্রতিটি মধ্যবর্তী ধাপ দেখানো বা নমুনার ফ্রেম-বাই-ফ্রেম কপি তৈরি করার প্রয়োজন নেই—শুধু চূড়ান্ত দৃশ্য এবং কাজের সাথে তার সামঞ্জস্যই গুরুত্বপূর্ণ।

SemComp-Bench-এর ডেটা এবং মূল্যায়ন কীভাবে সাজানো হয়েছে
পদ্ধতিগত পরীক্ষার জন্য লেখকরা SemComp-Data নামে একটি ডেটাসেট তৈরি করেছেন। এতে ছয়টি ভিন্ন ক্ষেত্রের উদাহরণ অন্তর্ভুক্ত করা হয়েছে—এইভাবে লেখকরা সর্বাধিক বিস্তৃত পরিসরের পরিস্থিতি কভার করার চেষ্টা করেছেন। ডেটাসেটের প্রতিটি উপাদানে রয়েছে:
- রেফারেন্স ছবি (শেষ পর্যন্ত কী হওয়া উচিত);
- বিস্তারিত নির্দেশনা সহ বিশদ বিবরণ;
- সংক্ষিপ্ত নির্দেশনা—যে সংস্করণটি বাস্তব প্রশ্নে বেশি দেখা যাবে;
- চূড়ান্ত ভিডিও ক্লিপ, যা প্রত্যাশিত ফলাফল প্রদর্শন করে।
ডেটা প্রস্তুত করতে গবেষকরা চারটি ধাপের একটি পাইপলাইন তৈরি করেছেন। এটি কাঁচা ভিডিওগুলিকে প্রমিত SemComp-Data উদাহরণে রূপান্তরিত করে। এই স্বয়ংক্রিয়করণ প্রতিটি ভিডিও ম্যানুয়ালি লেবেল না করেই ডেটাসেটটি স্কেল করতে সক্ষম করেছে।
SemComp-Bench-এর মূল্যায়ন একটি ভিশন-ল্যাঙ্গুয়েজ মডেল (VLM) কে ঘিরে নির্মিত। মডেলটি কাঠামোবদ্ধ বাইনারি প্রশ্নের উত্তর দেয়—অর্থাৎ প্রতিটি প্রশ্নের একটি স্পষ্ট «হ্যাঁ» বা «না» উত্তর আছে। এটি পরীক্ষাকে স্বচ্ছ এবং পুনরুত্পাদনযোগ্য করে তোলে। ফলাফলের ভিত্তিতে দুটি সূচক গণনা করা হয়:
- OA স্কোর (আউটকাম অ্যাচিভমেন্ট) — নির্ধারিত ফলাফল অর্জিত হয়েছে কিনা;
- GR স্কোর (জেনারেশন রিলায়েবিলিটি) — মডেলটি রেফারেন্স ছবির সাথে সংযোগ বজায় রেখে সমাধানটি কতটা নির্ভরযোগ্যভাবে পুনরুত্পাদন করে।
মূলত, প্রথম সূচকটি «যা চাওয়া হয়েছিল তা করা হয়েছে কিনা» প্রশ্নের উত্তর দেয়, আর দ্বিতীয়টি «এটি উদাহরণের প্রেক্ষাপটে করা হয়েছে কিনা» প্রশ্নের উত্তর দেয়।
প্রথম পরীক্ষাগুলি কী দেখিয়েছে
লেখকরা বেঞ্চমার্কের মাধ্যমে বেশ কয়েকটি প্রতিনিধিত্বমূলক ভিডিও জেনারেশন মডেল চালিয়েছেন। দেখা গেছে যে সেম্যান্টিক্সকে শেষ পর্যন্ত পৌঁছে দেওয়ার কাজটি এখনও অমীমাংসিত। এমনকি আধুনিক সিস্টেমগুলিও প্রায়শই এমন একটি ভিডিও তৈরি করে যা দেখতে মানসম্মত, কিন্তু প্রশ্নের সারাংশের সাথে মেলে না: চা-পাতি দেখা যায় না, বস্তুটি একই রকম কিছুতে পরিবর্তিত হয়, এবং ফলাফলটি প্রত্যাশিত থেকে শুধু দূরবর্তীভাবে সাদৃশ্যপূর্ণ।
মডেলগুলির জন্য রেফারেন্স ছবির সাথে সংযোগ বজায় রাখা বিশেষভাবে কঠিন যখন নির্দেশনাটি সংক্ষিপ্ত এবং সমস্ত বিবরণ ধারণ করে না। OA স্কোর এবং GR স্কোর কম থাকে, অর্থাৎ মডেলটি অর্থের স্তরে কাজটি «বুঝতে পারে না»। এটি নিশ্চিত করে: আজকের ভিডিও জেনারেশন আসলে «সুন্দর ছবি» তৈরির বিষয়ে, নির্দেশ পালনের বিষয়ে নয়।

SemComp-Bench-এর আবির্ভাব ভিডিও মডেল পরীক্ষার জোর পরিবর্তন করে: ফ্রেমের বাস্তবসম্মততা মূল্যায়নের পরিবর্তে—ব্যবহারকারীর জন্য অর্থপূর্ণ ফলাফল যাচাই করা। আগে বেঞ্চমার্কগুলো জিজ্ঞাসা করত «ভিডিওটি কি বাস্তবতার মতো দেখাচ্ছে», এখন প্রশ্নটি ভিন্নভাবে করা হয়: «কাজটি সম্পন্ন হয়েছে কিনা»। এটি একটি পদক্ষেপ যাতে জেনারেটিভ ভিডিও শুধু ডেমো নয়, বরং ব্যবহারিক সমস্যা সমাধানের একটি হাতিয়ার হয়ে ওঠে।
লেখকরা কাজটি arXiv প্ল্যাটফর্মে নম্বর 2608.17426-এর অধীনে প্রকাশ করেছেন, DOI: https://doi.org/10.48550/arXiv.2608.17426. উপকরণগুলো অধ্যয়নের জন্য উপলব্ধ, এবং মূল্যায়নের এই পদ্ধতিটি ভিডিও জেনারেটরের পরবর্তী প্রজন্মের ভিত্তি হয়ে উঠতে পারে।



