ChannelFlow-Tools: मशीन लर्निंग कार्यों के लिए त्रि-आयामी प्रवाह डेटासेट बनाने हेतु अनुकूलन योग्य पाइपलाइन

7 सितम्बर 202625 बार देखा गया

लेखकों ने एक खुला पाइपलाइन प्रस्तुत किया है जो स्वचालित रूप से बाधा ज्यामिति उत्पन्न करता है, हाइड्रोडायनामिक मॉडलिंग करता है, और परिणामों को तंत्रिका नेटवर्क प्रशिक्षण के लिए टेंसर में बदल देता है। प्रणाली को प्रतिलिपि प्रस्तुतिकरण और डेटा गुणवत्ता पर सत्यापित किया गया है, और प्राप्त डेटासेट ने कई सरोगेट मॉडलों को सफलतापूर्वक प्रशिक्षित करने में सक्षम बनाया है।

ChannelFlow-Tools: मशीन लर्निंग कार्यों के लिए त्रि-आयामी प्रवाह डेटासेट बनाने हेतु अनुकूलन योग्य पाइपलाइन

डेटासेट के लिए एक और पाइपलाइन की आवश्यकता क्यों है

तीन-आयामी प्रवाह के आसपास वस्तुओं के प्रवाह की भविष्यवाणी करने वाले मॉडलों के प्रशिक्षण के लिए डेटा तैयार करना आमतौर पर न्यूरल नेटवर्क में नहीं, बल्कि दिनचर्या में फंस जाता है: ज्यामिति उत्पन्न करना, कम्प्यूटेशनल ग्रिड बनाना, सिमुलेशन चलाना और परिणामों को एक समान प्रारूप में लाना आवश्यक होता है। यह सब स्वचालित रूप से पुन: प्रस्तुत करना कठिन है, इसलिए तैयार डेटासेट महंगे हो जाते हैं और अच्छी तरह से स्केल नहीं होते हैं।

ओपन-सोर्स टूल ChannelFlow-Tools एक अलग दृष्टिकोण प्रस्तुत करता है: डेटासेट को एक-एक उदाहरण के रूप में नहीं, बल्कि एक पूरे कन्वेयर के रूप में इकट्ठा करना — बाधाओं की प्रक्रियात्मक पीढ़ी से लेकर प्रशिक्षण के लिए उपयुक्त टेंसर में त्रि-आयामी प्रवाह क्षेत्रों की पैकेजिंग तक। arXiv पर परियोजना के विवरण के अनुसार, लेखकों का मुख्य लक्ष्य मैन्युअल संचालन को हटाना और प्रक्रिया को यथासंभव पुन: प्रस्तुत करने योग्य बनाना है।

कन्वेयर के अंदर क्या होता है

एक सामान्य कार्य इस प्रकार दिखता है: चैनल में एक बाधा रखी जाती है, और इनपुट प्रवाह स्थितियों के आधार पर वस्तु के चारों ओर वेग और दबाव के त्रि-आयामी क्षेत्र की भविष्यवाणी करने की आवश्यकता होती है। ChannelFlow-Tools की विशेषता यह है कि यह स्वचालित रूप से छह आकार परिवारों से ज्यामितीय विकल्पों का चयन करता है। मैन्युअल रूप से वस्तुओं का चयन करने के बजाय, प्रक्रियात्मक पीढ़ी का उपयोग किया जाता है, जो नियंत्रित मापदंडों के साथ विभिन्न प्रकार की बाधाएं उत्पन्न कर सकती है।

इसके बाद ज्यामिति को साइन-डिस्टेंस फ़ील्ड के आधार पर वोक्सेल प्रतिनिधित्व में बदल दिया जाता है। ऐसा प्रतिनिधित्व कन्वोल्यूशनल मॉडल के लिए सुविधाजनक है और अनियमित कम्प्यूटेशनल ग्रिड के साथ सीधे काम करने की आवश्यकता नहीं होती है। उसके बाद, लैटिस-बोल्ट्ज़मैन सिमुलेशन शुरू किया जाता है — हाइड्रोडायनामिक समीकरणों को संख्यात्मक रूप से हल करने की एक विधि जो समानांतर कंप्यूटिंग के लिए अच्छी तरह से उपयुक्त है। अंत में, सिमुलेशन के परिणाम और ज्यामिति के मूल मास्क को टेंसर में संकलित किया जाता है, जो न्यूरल नेटवर्क आर्किटेक्चर के लिए तैयार होते हैं।

पूरी प्रक्रिया कॉन्फ़िगरेशन फ़ाइलों द्वारा नियंत्रित होती है। इसका मतलब है कि पीढ़ी के पैरामीटर, सिमुलेशन की स्थितियाँ और आउटपुट डेटा का प्रारूप घोषणात्मक रूप से निर्धारित किया जा सकता है, न कि कोड में "हार्डकोड" किया जा सकता है। लेखकों के अनुसार, ज्यामिति पीढ़ी का चरण बाइट-दर-बाइट पुन: प्रस्तुत करने योग्य है: समान कॉन्फ़िगरेशन बार-बार चलाने पर भी समान वस्तुएं देते हैं। भौतिक सिम्युलेटर के लिए, पूर्ण बिट-स्तरीय पुनरुत्पादकता अधिक कठिन है, लेकिन परियोजना का प्रक्रियात्मक हिस्सा कम से कम सख्ती से बनाया गया है।

डेटा की जाँच "आँख से" नहीं

डेटासेट बनाना आधा काम है। इसे प्रशिक्षण के लिए उपयोग करने से पहले, लेखकों ने सत्यापन के कई स्तर किए। इनमें कम्प्यूटेशनल ग्रिड की अखंडता की एंड-टू-एंड जाँच, साइन-डिस्टेंस फ़ंक्शन के विश्लेषणात्मक परीक्षण और एक ज्ञात गोला-प्रवाह बेंचमार्क के साथ तुलना शामिल है। सभी परिवर्तनों के बाद डेटा की बाइट अखंडता की भी जाँच की गई।

ऐसा ऑडिट न केवल एक व्यक्तिगत नमूने की गुणवत्ता के लिए महत्वपूर्ण है, बल्कि यह सुनिश्चित करने के लिए भी है कि डेटा का पूरा समूह सुसंगत है। यदि कोई मॉडल हजारों सिमुलेशन के नमूने पर प्रशिक्षित होता है, तो ज्यामिति या पैकेजिंग में दुर्लभ विफलताएं भी एक व्यवस्थित त्रुटि में बदल सकती हैं।

क्या डेटा व्यवहार में काम करता है

परिणामी डेटासेट की उपयुक्तता प्रदर्शित करने के लिए, लेखकों ने तीन सरोगेट मॉडल प्रशिक्षित किए: 3D U-Net, FNO और U-FNO। उनमें से प्रत्येक ने ज्ञात ज्यामिति और प्रवाह मापदंडों के आधार पर प्रवाह क्षेत्र की भविष्यवाणी करना सीखा। प्रशिक्षण के लिए नमूने में लगभग 1000 से 10 000 तक की कम रेनॉल्ड्स संख्या वाले 450 सिमुलेशन शामिल थे।

प्रशिक्षण पर कम त्रुटि का तथ्य अपने आप में बहुत कुछ नहीं कहता। अधिक दिलचस्प परिणाम प्रशिक्षण वितरण से परे जाने वाले परीक्षण विभाजनों पर मॉडल का व्यवहार है: आकार परिवारों के अन्य समूह और पहले से न देखी गई रेनॉल्ड्स संख्याएं। लेखकों के अनुसार, भविष्यवाणियां भौतिक रूप से व्याख्या योग्य बनी रहती हैं। यह परोक्ष रूप से पुष्टि करता है कि कन्वेयर द्वारा एकत्र की गई डेटा संरचना मॉडल को प्रवाह के वास्तविक पैटर्न बताती है, न कि केवल प्रशिक्षण नमूने से उदाहरणों को "याद" करती है।

निष्कर्ष

उपलब्ध सामग्रियों के अनुसार, ChannelFlow-Tools CFD सॉल्वर और मशीन लर्निंग के बीच एक महत्वपूर्ण अंतर को भरता है। अलग-अलग प्रीप्रोसेसिंग स्क्रिप्ट के बजाय, परियोजना एक अनुकूलन योग्य, सत्यापन योग्य और पुन: प्रस्तुत करने योग्य पाइपलाइन प्रदान करती है। यह इसे उन शोधकर्ताओं के लिए एक उपयोगी उपकरण बनाता है जो त्रि-आयामी प्रवाह के साथ काम करते हैं और मॉडल आर्किटेक्चर पर अधिक ध्यान देना चाहते हैं, न कि एक और डेटासेट बनाने पर।

यह लेख arXiv पर संख्या 2509.15236 के तहत उपलब्ध है; लेखकों की सूची में — Shubham Kavane, Lukas Schröder, Kajol Kulkarni, Fernando Gonzalez और Harald Koestler शामिल हैं।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
ChannelFlow-Tools: मशीन लर्निंग कार्यों के लिए त्रि-आयामी प्रवाह डेटासेट बनाने हेतु अनुकूलन योग्य पाइपलाइन