PTXBench: LLM द्वारा GPU-कोर अनुकूलन क्षमता मापने का नया तरीका

3 सितम्बर 202617 बार देखा गया

H100 और B200 GPU के लिए GEMM और attention कार्यों पर मॉडलों का बेंचमार्क परीक्षण — शुद्धता से लेकर वास्तविक गति लाभ तक। परिणाम दिखाते हैं कि लक्षित निर्देशों का सटीक निष्पादन भी प्रतिस्पर्धी प्रदर्शन की गारंटी नहीं देता।

PTXBench: LLM द्वारा GPU-कोर अनुकूलन क्षमता मापने का नया तरीका

PTXBench — GPU कोर के अनुकूलन के लिए आमतौर पर हार्डवेयर आर्किटेक्चर और निम्न-स्तरीय निर्देशों की गहरी समझ की आवश्यकता होती है। भाषा मॉडल अभी इस कार्य में अस्थिर रूप से सफल हो रहे हैं: वे विश्वसनीय दिखने वाला कोड उत्पन्न कर सकते हैं, लेकिन यह हमेशा सही और तेज़ नहीं होता। PTXBench एक नया बेंचमार्क है जो इस प्रक्रिया में मापनीयता और स्पष्टता लाने का प्रयास करता है।

PTXBench क्या है और इसकी आवश्यकता क्यों है

PTXBench बड़े भाषा मॉडलों के लिए एक मूल्यांकन मंच है जो GPU कोर के अनुकूलन के लिए आर्किटेक्चर-विशिष्ट PTX (Parallel Thread Execution) का उपयोग करने का प्रयास करते हैं। PTX, NVIDIA GPU के लिए निर्देशों का एक मध्यवर्ती प्रतिनिधित्व है, और इसी स्तर पर रजिस्टरों, मेमोरी और शेड्यूलर को सूक्ष्मता से नियंत्रित किया जा सकता है। सामान्य बेंचमार्क केवल अंतिम कोड की जाँच करते हैं, लेकिन PTXBench गहराई से देखता है: क्या मॉडल वास्तव में लक्षित निम्न-स्तरीय निर्देशों को लागू करता है, या केवल 'C-जैसा' कोड उत्पन्न करता है।

लेखकों ने दो क्लासिकल कार्यभारों पर ध्यान केंद्रित किया: मैट्रिक्स गुणन (GEMM) और अटेंशन तंत्र, जो ट्रांसफॉर्मर के लिए महत्वपूर्ण है। परीक्षण वर्तमान एक्सेलेरेटर — H100 और B200 पर किए गए। यह चयन न केवल मॉडल के बुनियादी कौशल की जाँच करने की अनुमति देता है, बल्कि आधुनिक आर्किटेक्चर और उनकी विशिष्ट विशेषताओं के अनुकूल होने की क्षमता का भी परीक्षण करता है।

बेंचमार्क क्या मापता है

PTXBench मॉडलों का मूल्यांकन तीन प्रमुख मापदंडों पर करता है:

  • कार्यात्मक शुद्धता — उत्पन्न कर्नेल का परिणाम संदर्भ के अनुरूप होना चाहिए।
  • लक्षित निर्देशों का निष्पादन — यह जाँचा जाता है कि रनटाइम में वे PTX-निर्देश मौजूद हैं या नहीं जिनका उपयोग मॉडल को करना था।
  • त्वरण — प्राप्त कर्नेल frontier-लाइब्रेरीज़, यानी सर्वोत्तम तैयार कार्यान्वयन, से कितना तेज़ है।

यह दृष्टिकोण तीन अलग-अलग समस्याओं को अलग करता है। मॉडल सही कोड लिख सकता है, लेकिन आवश्यक निर्देशों का उपयोग नहीं कर सकता। या उनका उपयोग कर सकता है, लेकिन मानक लाइब्रेरी से खराब प्रदर्शन प्राप्त कर सकता है। PTXBench यह देखने की अनुमति देता है कि विफलता वास्तव में किस चरण में होती है।

परिणाम: अनुकूलन अभी भी मॉडलों के लिए असमान रूप से सुलभ है

मूल्यांकन से पता चला कि PTX के साथ काम करने की LLM की क्षमता कार्य पर अत्यधिक निर्भर है। सरल मामलों में मॉडल अच्छे परिणाम दिखाते हैं, लेकिन अटेंशन के लिए जटिल backward-कार्यों पर सफल समाधानों का अनुपात तेजी से गिर जाता है। यह अपेक्षित है: बैकवर्ड पास के लिए ग्रेडिएंट्स और मेमोरी के साथ अधिक सावधानीपूर्वक कार्य की आवश्यकता होती है।

एक और महत्वपूर्ण निष्कर्ष: लक्षित निर्देशों का निष्पादन स्वयं गति की गारंटी नहीं देता। मॉडल सही PTX-निर्देशों को 'हिट' कर सकता है, लेकिन समानांतरीकरण की खराब रणनीति या सिंक्रोनाइज़ेशन की गलत व्यवस्था चुन सकता है। अंततः, परीक्षण किए गए किसी भी मॉडल ने सभी कार्यों पर frontier-लाइब्रेरीज़ के साथ स्थिर रूप से प्रतिस्पर्धा नहीं की।

मॉडल को कैसे फाइन-ट्यून किया गया और क्या काम आया

यह समझने के लिए कि क्या इन कौशलों में सुधार किया जा सकता है, लेखकों ने supervised fine-tuning के माध्यम से Qwen3.6-27B मॉडल का फाइन-ट्यूनिंग किया। इसके अतिरिक्त, उन्होंने एक तकनीक का उपयोग किया जिसे सुधार पर शर्त के साथ सीखना कहा जा सकता है: मॉडल केवल कोड उत्पन्न करना नहीं सीखता, बल्कि गलत चरणों के बारे में प्रतिक्रिया प्राप्त करके उसे सुधारना भी सीखता है।

इस दृष्टिकोण ने वास्तव में कई कार्यों में सुधार किया, लेकिन समान प्रगति सुनिश्चित नहीं की। सामान्यीकरण कमजोर रहा: मॉडल कुछ प्रकार के कर्नेल के साथ अच्छी तरह से सामना कर सकता था और दूसरों पर विफल हो सकता था। विश्लेषण से पता चला कि केवल प्रशिक्षण डेटासेट का आकार ही निर्णायक नहीं है। इसका कवरेज, विभिन्न परिदृश्यों के बीच संतुलन और 'शिक्षक' की गुणवत्ता अधिक महत्वपूर्ण है, जो reasoning-श्रृंखलाओं के लिए उदाहरण उत्पन्न करता है। यदि डेटा में सरल मामलों की ओर झुकाव है, तो मॉडल जटिलता नहीं सीख पाएगा।

मुख्य निष्कर्ष

PTXBench समुदाय को एक सत्यापन योग्य परीक्षण मंच प्रदान करता है जिस पर GPU कोर अनुकूलन में LLM की प्रगति को ट्रैक किया जा सकता है। यह केवल 'तेज़/धीमा' का आकलन नहीं देता, बल्कि दिखाता है कि मॉडल की योजनाएँ किस स्तर पर विफल होती हैं: सिंटैक्स पर, विशिष्ट निर्देशों के अनुप्रयोग पर, या रणनीति के चयन पर। यह स्वचालित कर्नेल अनुकूलन को पूर्वानुमानित और व्यावहारिक बनाने की दिशा में एक महत्वपूर्ण कदम है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
PTXBench: LLM द्वारा GPU-कोर अनुकूलन क्षमता मापने का नया तरीका