न्यायाधीश सूक्ष्मदर्शी के नीचे: D3-Omni परीक्षण जाँचता है कि क्या मल्टीमॉडल मॉडल अपनी ही गलतियाँ पहचान पाते हैं

16 सितम्बर 202623 बार देखा गया

मल्टीमॉडल "ओमनी-जज" छवियों, वीडियो और भाषण का मूल्यांकन करते हैं, लेकिन पारंपरिक बेंचमार्क सफल उदाहरणों की ओर झुके हुए हैं और इसलिए विफलताओं को छिपा देते हैं। नया संतुलित सेट D3-Omni विफलता के प्रकारों को अलग-अलग अक्षों पर बाँटता है और दिखाता है: मॉडल पूरी की गई आवश्यकता की पुष्टि तो खुशी-खुशी कर देते हैं, लेकिन उल्लंघन की गई आवश्यकता को पकड़ने में कहीं कमज़ोर हैं।

न्यायाधीश सूक्ष्मदर्शी के नीचे: D3-Omni परीक्षण जाँचता है कि क्या मल्टीमॉडल मॉडल अपनी ही गलतियाँ पहचान पाते हैं

निर्णायक, जिस पर भरोसा करना बहुत आसान है

मल्टीमॉडल मॉडल अब अक्सर मध्यस्थ की भूमिका निभाते हैं: वे तस्वीर, वीडियो देखते हैं या ऑडियो सुनते हैं और फैसला सुनाते हैं — क्या परिणाम टेक्स्ट प्रॉम्प्ट से मेल खाता है। ऐसे "सर्वभक्षी" निर्णायकों का इस्तेमाल जनरेटिव सिस्टम के मूल्यांकन और डेटा की स्वचालित लेबलिंग दोनों के लिए किया जाता है, जब हर चीज़ के लिए जीवित विशेषज्ञ उपलब्ध नहीं होते।

तर्क स्पष्ट है: अगर मॉडल एक साथ कई मोडैलिटीज़ को समझ सकता है, तो उसे text-to-image, text-to-video और text-to-speech की जाँच क्यों न सौंपी जाए? लेकिन यहीं एक असुविधाजनक सवाल छिपा है। ऐसे निर्णायक की अच्छी कुल सटीकता का मतलब यह नहीं है कि वह वाकई देख रहा है कि वह क्या आँक रहा है। मौजूदा टेस्ट सेट और प्रशिक्षण संग्रह आमतौर पर सफल उदाहरणों की ओर झुके होते हैं, और उनमें विफलता के विभिन्न प्रकार एक ही ढेर में मिला दिए जाते हैं।

नतीजा — एक विकृत तस्वीर। निर्णायक अच्छे आँकड़े दिखाता है, क्योंकि उसने "हाँ" कहना सीख लिया है, और उसके असली अंधे धब्बे अनदेखे रह जाते हैं। यही समस्या arXiv की एक नई शोध-रचना में उठाई गई है।

लेखक क्या पेश करते हैं: D3-Omni

यह शोध उस शीर्षक के तहत आया है जिसे लेखकों ने खुद विरोधाभास पर बनाया: "OmniJudge or OmniBias?"। एक और रैंकिंग के बजाय उन्होंने एक नैदानिक उपकरण तैयार किया — D3-Omni, एक बेंचमार्क, जिसे इस तरह बनाया गया है कि निर्णायक सामान्य आँकड़ों के पीछे छिप न सके। नाम तीन सिद्धांतों में खुलता है, और उनमें से हर एक सामान्य परीक्षणों की एक विशिष्ट कमज़ोरी पर प्रहार करता है।

Dual-balanced: "सब ठीक है" की ओर झुकाव हटाया जाता है

पहला सिद्धांत संतुलन के लिए ज़िम्मेदार है। उदाहरणों को जैसे बन पड़े इकट्ठा करने के बजाय, संग्रह को संतुलित किया जाता है: हर जाँची जाने वाली विशेषता के लिए सफल और विफल मामलों की तुलनीय संख्या होनी चाहिए। इस तरह वह स्थिति गायब हो जाती है जहाँ मॉडल सिर्फ़ इसलिए अंक बटोरता है क्योंकि सही जवाब अक्सर "हाँ" होता है।

Decoupled: एक गलती — एक कारण

दूसरा सिद्धांत — वियोजन। परीक्षण में हर दोष ठीक एक क्षमता से जुड़ा होता है। अगर निर्णायक गलती करता है, तो स्पष्ट होता है कि उसमें वास्तव में किस चीज़ की कमी थी: संयोजन की समझ, रंग, ध्वनि की समकालिकता या कुछ और। ऐसे कोई मिश्रित उदाहरण नहीं जहाँ यह स्पष्ट न हो कि तीन में से किस उल्लंघन ने मॉडल को भ्रमित किया।

Dynamic: परीक्षण जनरेटर की प्रगति के अनुसार ढलता है

तीसरा सिद्धांत — गतिशीलता। परीक्षण की संरचना वहाँ निर्देशित की जाती है जहाँ उदाहरणों का representation अभी अपर्याप्त है, जैसे-जैसे जनरेटिव मॉडल नए क्षेत्रों में महारत हासिल करते हैं। लक्ष्य है — हर विशेषता पर लगभग एक-से-एक समानता बनाए रखना और अंतिम स्कोर के सभी स्तरों का समान भरण।

डेटासेट कैसे बना है

D3-Omni का पैमाना अच्छा-खासा है: 53 बाइनरी विशेषताएँ, तीन कार्यों में बँटी हुई (हर एक पर 17, 22 और 14), और 10,671 उदाहरण (क्रमशः 3,526, 1,998 और 5,147)। विशेषताएँ रूढ़िलंबवत चुनी गई हैं — वे एक-दूसरे की पुनरावृत्ति नहीं करतीं।

एक अलग इंजीनियरिंग ब्यौरा — नकारात्मक उदाहरण कैसे प्राप्त किए जाते हैं। लेखकों ने सिद्धांततः आउटपुट के पुनः-जनन से इनकार कर दिया: ऐसा रास्ता विशेषताओं के बीच सूचना के रिसाव की ओर ले जाता है, और परीक्षण शुद्ध नहीं रहता। इसके बजाय पूरी तरह सकारात्मक सत्यापित "बीज" लिए जाते हैं, और उल्लंघन नियंत्रित ढंग से डाले जाते हैं — प्रॉम्प्ट को फिर से लिखकर और एक विशेषता को अलग करने वाले सूक्ष्म विक्षोभ जोड़कर।

क्या पता चला: निर्णायक आत्मविश्वास से तारीफ़ करते हैं और खराबी पकड़ने में कमज़ोर हैं

इस शोध में सबसे दिलचस्प बात बेंचमार्क की बनावट नहीं, बल्कि यह है कि उसने क्या दिखाया। मज़बूत मल्टीमॉडल निर्णायक भी सीधे मोडैलिटी से जुड़ी विशेषताओं पर लड़खड़ा जाते हैं। सरल शब्दों में, उन्हें ठीक वही मुश्किल लगता है जिसके लिए उन्हें मूल्यांकनकर्ता बनाया जाता है।

दूसरा अवलोकन और भी अप्रिय है। मॉडल पूरी की गई आवश्यकताओं की पुष्टि कहीं अधिक विश्वसनीयता से करते हैं, बजाय उल्लंघन की गई आवश्यकताओं का पता लगाने के। यह असममिति स्थायी है: निर्णायक के लिए "यहाँ सब कुछ अनुरोध के अनुरूप है" कहना किसी विशिष्ट असंगति को पकड़ने से कहीं आसान है।

तीसरा — नाममात्र रूप से अलग-अलग गुणों को मॉडल एक समग्र समाधान के रूप में ग्रहण करता है। विशेषताओं के बीच अंतर मिट जाते हैं, और निर्णायक बिंदुवार विश्लेषण के बजाय एक सामान्य फैसला सुना देता है।

संयुक्त प्रतिशत क्यों धोखा देता है

इन अवलोकनों से मुख्य निष्कर्ष निकलता है: अंतिम सटीकता व्यवस्थित अंधे धब्बों को छिपा सकती है। लगातार "सकारात्मक" जवाब का अनुमान लगाने वाला निर्णायक झुके हुए संग्रह पर अच्छा दिखेगा — और वहाँ विफल हो जाएगा जहाँ जनरेटर की गलती पकड़नी हो।

संतुलित और वियोजित दृष्टि मीट्रिक की सुंदरता के लिए नहीं, बल्कि इन धब्बों को दिखाई देने लायक बनाने के लिए चाहिए। और उन्हें देखकर — लक्षित रूप से भरा जा सकता है: समस्याग्रस्त विशेषताओं पर अतिरिक्त प्रशिक्षण देना, न कि औसत अंक के पीछे भागना।

व्यवहार में इसका मतलब एक सरल बात है। अगर आप ऐसा पाइपलाइन बना रहे हैं जहाँ मॉडल-निर्णायक जनरेशन के परिणामों को फ़िल्टर करता है या डेटासेट को लेबल करता है, तो उसकी जाँच नकारात्मकताओं की ओर झुके संग्रह पर करनी चाहिए, न कि सफल उदाहरणों के सुविधाजनक नमूने पर। वरना मूल्यांकनकर्ता खराबी छोड़ता रहेगा, और आपको इसका पता मीट्रिक्स से नहीं, उपयोगकर्ताओं से चलेगा।

संक्षेप में

  • D3-Omni मल्टीमॉडल निर्णायकों के निदान के लिए एक बेंचमार्क है, मॉडलों की रैंकिंग नहीं।
  • तीन सिद्धांत: सकारात्मक और नकारात्मक उदाहरणों का संतुलन, हर गलती को एक क्षमता से जोड़ना, जनरेटर के विकास के अनुसार परीक्षण का अनुकूलन।
  • text-to-image, text-to-video और text-to-speech कार्यों पर 53 विशेषताएँ और लगभग 11 हज़ार उदाहरण।
  • नकारात्मक उदाहरण प्रॉम्प्ट फिर से लिखकर और सूक्ष्म विक्षोभों से बनाए जाते हैं, पुनः-जनन से नहीं — ताकि विशेषताएँ न मिलें।
  • मुख्य निष्कर्ष: उच्च औसत परिणाम स्थायी अंधे धब्बों को छिपा सकता है, खासकर वहाँ जहाँ अनुरूपता की पुष्टि के बजाय उल्लंघन को नोटिस करना हो।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
न्यायाधीश सूक्ष्मदर्शी के नीचे: D3-Omni परीक्षण जाँचता है कि क्या मल्टीमॉडल मॉडल अपनी ही गलतियाँ पहचान पाते हैं