नया बेंचमार्क SemComp-Bench जाँचता है कि क्या वीडियो मॉडल कार्य को पूरा करते हैं

3 सितम्बर 202614 बार देखा गया

शोधकर्ताओं ने कार्यों के अर्थपूर्ण निष्पादन के आधार पर वीडियो निर्माण के मूल्यांकन के लिए एक डेटासेट और पद्धति प्रस्तुत की है: मॉडल को केवल एक विश्वसनीय क्लिप बनाना ही नहीं चाहिए, बल्कि वांछित परिणाम प्राप्त करना चाहिए और संदर्भ के साथ अर्थपूर्ण संबंध बनाए रखना चाहिए। प्रारंभिक प्रयोगों से पता चलता है कि यह आधुनिक वीडियो मॉडलों के लिए अभी भी एक कठिन कार्य है।

नया बेंचमार्क SemComp-Bench जाँचता है कि क्या वीडियो मॉडल कार्य को पूरा करते हैं

सिमेंटिक कार्य पूर्णता: वीडियो जनरेशन पर एक नया दृष्टिकोण

आधुनिक वीडियो जनरेशन मॉडल "बिल्ली धागे की गेंद से खेल रही है" जैसे छोटे प्रॉम्प्ट को बखूबी संभाल लेते हैं — परिणाम सुंदर और यथार्थवादी होता है। लेकिन क्या सिस्टम वास्तव में समझता है कि उपयोगकर्ता को किस परिणाम की आवश्यकता है? चीन के शोधकर्ताओं ने SemComp-Bench बेंचमार्क प्रस्तावित किया है, जो केवल दृश्य गुणवत्ता की जाँच नहीं करता, बल्कि यह देखता है कि कार्य अर्थ के स्तर पर पूरा हुआ है या नहीं।

Keyu Tu के नेतृत्व में लेखकों के समूह (कुल आठ शोधकर्ता) ने arXiv पर SemComp-Bench का वर्णन करने वाला एक पेपर प्रस्तुत किया। यह कार्य 18 अगस्त 2026 को प्रकाशित हुआ है और कंप्यूटर विज़न तथा आर्टिफिशियल इंटेलिजेंस के क्षेत्रों से संबंधित है। इसमें एक नई अवधारणा पेश की गई है — Semantic Task Completion Video Generation, यानी सिमेंटिक कार्य पूर्णता के साथ वीडियो जनरेशन। यहाँ सफलता इस बात से निर्धारित नहीं होती कि वस्तुएँ कितनी सहजता से चलती हैं या फ्रेम-दर-फ्रेम संदर्भ से कितना मेल खाता है, बल्कि इससे कि अनुरोधित परिणाम प्राप्त हुआ है या नहीं और नमूने के साथ अर्थपूर्ण संबंध बना रहता है या नहीं।

मुख्य विचार — "सिमेंटिक ग्राउंडिंग" (semantic grounding) है। मॉडल को केवल छवि की नकल नहीं करनी चाहिए, बल्कि कार्य के उच्च-स्तरीय अर्थ को समझना चाहिए: उदाहरण के लिए, यदि संदर्भ छवि में सजी हुई मेज दिखाई गई है और निर्देश "चायदानी जोड़ें" कहता है, तो अंतिम वीडियो में चायदानी मेज पर दिखनी चाहिए। साथ ही, हर मध्यवर्ती चरण दिखाना या नमूने की फ्रेम-दर-फ्रेम प्रति बनाना आवश्यक नहीं है — केवल अंतिम दृश्य और उसका कार्य से मेल महत्वपूर्ण है।

SemComp-Bench का डेटा और मूल्यांकन कैसे संरचित है

व्यवस्थित जाँच के लिए, लेखकों ने SemComp-Data डेटासेट बनाया। इसमें छह अलग-अलग क्षेत्रों के उदाहरण शामिल हैं — इस प्रकार लेखकों ने परिदृश्यों की अधिकतम विस्तृत श्रृंखला को कवर करने का प्रयास किया। डेटासेट का प्रत्येक तत्व शामिल करता है:

  • संदर्भ छवि (अंतिम परिणाम क्या होना चाहिए);
  • विस्तृत निर्देश, जिसमें सभी विवरण हों;
  • संक्षिप्त निर्देश — वह संस्करण जो वास्तविक अनुरोध में मिलने की अधिक संभावना है;
  • अंतिम वीडियो क्लिप, जो अपेक्षित परिणाम प्रदर्शित करता है।

डेटा तैयार करने के लिए, शोधकर्ताओं ने चार चरणों वाली एक पाइपलाइन बनाई। यह कच्चे वीडियो को SemComp-Data के मानकीकृत उदाहरणों में बदल देती है। इस स्वचालन ने प्रत्येक क्लिप की मैन्युअल लेबलिंग के बिना डेटासेट को स्केल करना संभव बनाया।

SemComp-Bench में मूल्यांकन एक vision-language model (VLM) के इर्द-गिर्द बनाया गया है। मॉडल संरचित बाइनरी प्रश्नों का उत्तर देता है — यानी हर प्रश्न का स्पष्ट उत्तर "हाँ" या "नहीं" होता है। यह जाँच को पारदर्शी और पुनरुत्पादनीय बनाता है। परिणामों के आधार पर दो मीट्रिक की गणना की जाती है:

  • OA Score (Outcome Achievement) — क्या निर्धारित परिणाम प्राप्त हुआ है;
  • GR Score (Generation Reliability) — मॉडल संदर्भ छवि के साथ संबंध बनाए रखते हुए समाधान को कितनी विश्वसनीय रूप से पुन: प्रस्तुत करता है।

संक्षेप में, पहला मीट्रिक इस प्रश्न का उत्तर देता है "जो माँगा गया था क्या वह किया गया", और दूसरा — "क्या यह उदाहरण के संदर्भ में ही किया गया"।

पहले परीक्षणों ने क्या दिखाया

लेखकों ने बेंचमार्क के माध्यम से कई प्रतिनिधि वीडियो जनरेशन मॉडल चलाए। यह पता चला कि सिमेंटिक्स को अंत तक पहुँचाने का कार्य अभी भी खुला है। यहाँ तक कि आधुनिक सिस्टम भी अक्सर एक ऐसा वीडियो उत्पन्न करते हैं जो गुणवत्ता में अच्छा दिखता है, लेकिन अनुरोध के सार से मेल नहीं खाता: चायदानी प्रकट नहीं होती, वस्तु समान किसी अन्य वस्तु में बदल जाती है, और परिणाम केवल दूर से ही अपेक्षित जैसा दिखता है।

मॉडलों के लिए संदर्भ छवि के साथ संबंध बनाए रखना विशेष रूप से कठिन होता है जब निर्देश छोटा होता है और उसमें सभी विवरण नहीं होते। OA Score और GR Score कम होते हैं, यानी मॉडल कार्य को अर्थ के स्तर पर "समझता" नहीं है। यह पुष्टि करता है: आज वीडियो जनरेशन "सुंदर तस्वीर" के बारे में अधिक है, न कि किसी कार्य को पूरा करने के बारे में।

SemComp-Bench का आगमन वीडियो मॉडल के परीक्षण में जोर को स्थानांतरित करता है: फ्रेम की प्रामाणिकता का मूल्यांकन करने के बजाय — उपयोगकर्ता के लिए महत्वपूर्ण परिणाम की जाँच। यदि पहले बेंचमार्क पूछते थे "क्या वीडियो वास्तविकता जैसा दिखता है", तो अब प्रश्न अलग तरीके से रखा गया है: "क्या कार्य पूरा हुआ"। यह इस दिशा में एक कदम है कि जनरेटिव वीडियो केवल डेमो नहीं, बल्कि व्यावहारिक कार्यों को हल करने का उपकरण बनें।

लेखकों ने कार्य को arXiv प्लेटफ़ॉर्म पर संख्या 2608.17426 के तहत प्रकाशित किया है, DOI: https://doi.org/10.48550/arXiv.2608.17426. सामग्री अध्ययन के लिए उपलब्ध है, और मूल्यांकन का यह दृष्टिकोण वीडियो जनरेटर की अगली पीढ़ियों का आधार बन सकता है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
नया बेंचमार्क SemComp-Bench जाँचता है कि क्या वीडियो मॉडल कार्य को पूरा करते हैं