कच्चे I/Q, तालिकाओं के बजाय: EMRB जाँचता है कि क्या LLM कोड के ज़रिए रेडियो सिग्नलों पर तर्क कर सकते हैं

16 सितम्बर 202620 बार देखा गया

नया EMRB बेंचमार्क मॉडल्स को तैयार विशेषताएँ नहीं, बल्कि सिग्नल की कच्ची रिकॉर्डिंग देता है: आवश्यक मात्राएँ अभी खोजनी बाकी हैं, कोड लिखकर और चलाकर। सेट में पाँच कठिनाई स्तरों और 27 प्रश्न प्रकारों के 200 कार्य हैं, और परीक्षण किए गए LLM में सरल मापों और सिस्टम डिज़ाइन के बीच का अंतर बहुत स्पष्ट निकला।

कच्चे I/Q, तालिकाओं के बजाय: EMRB जाँचता है कि क्या LLM कोड के ज़रिए रेडियो सिग्नलों पर तर्क कर सकते हैं

कच्चा डेटा, तैयार तालिकाओं के बजाय

मॉडल अब तेज़ी से कोड एजेंट की भूमिका निभा रहे हैं: उन्हें डेटा प्रोसेसिंग के लिए स्क्रिप्ट लिखने, ग्राफ़ बनाने, मेट्रिक्स की गणना करने और इंजीनियरिंग डेटा एक्सपोर्ट को संभालने का काम सौंपा जाता है। लेकिन कार्यों की एक श्रेणी ऐसी है, जिसकी अब तक लगभग जाँच नहीं हुई है — भौतिक स्तर के "कच्चे माल" के साथ काम करना। यही क्षेत्र EMRB (Electromagnetic Reasoning Benchmark) बेंचमार्क भरता है, जिसका वर्णन arXiv:2608.24086 प्रीप्रिंट में किया गया है (अनुभाग cs.AI, cs.CE, cs.SE)।

मुख्य विचार सरल है और इसीलिए ठोस भी। इनपुट में केवल कच्ची I/Q रिकॉर्डिंग होती है, यानी सिग्नल के क्वाडरेचर सैंपल, जैसे वे रिसीवर से आते हैं। कोई पूर्व-प्रोसेस किए गए फ़ीचर नहीं, लेबल वाले स्पेक्ट्रोग्राम तो बिल्कुल नहीं, और तैयार मानों वाली तालिकाएँ तो कहिए ही नहीं। जिस राशि से प्रश्न संबंधित है, मॉडल को उसे पहले डेटा में खोजना होता है — उस कोड के ज़रिए जो वह खुद लिखेगा और चलाएगा।

यह सामान्य मापों से कैसे अलग है

पिछले कुछ वर्षों में ऐसे कई कार्य-संग्रह सामने आए हैं जिनमें मॉडलों से रेडियो सिग्नल पर विचार करने को कहा जाता है। लेकिन अक्सर वहाँ मॉडल का काम पहले ही किया जा चुका होता है: रिकॉर्डिंग से फ़ीचर निकाल लिए गए, स्पेक्ट्रम की गणना कर ली गई, शोर का स्तर आँक लिया गया, और सब कुछ एक संरचित तालिका में सजा दिया गया। ऐसी स्थिति में केवल अंकगणित और संख्याओं की तुलना बचती है — कौशल उपयोगी हैं, पर रेडियोभौतिकी से उनका कोई संबंध नहीं।

अंतर मूलभूत है। जब राशियाँ पहले से दी गई हों, तो शुरुआती चरण की त्रुटि दिखती ही नहीं: बैंडविड्थ या आवृत्ति का गलत अनुमान उठता ही नहीं, क्योंकि ये मान शर्त में दे दिए गए। जब डेटा अनप्रोसेस्ड हो, तो सिग्नल की खोज के चरण में हुई कोई भी त्रुटि अपने साथ पूरी आगे की गणना खींच ले जाती है। इसीलिए EMRB शब्दावली का ज्ञान नहीं, बल्कि एक श्रृंखला बनाने की क्षमता जाँचता है: सैंपलों को देखना, समझना कि वहाँ कौन-सा सिग्नल है, आवश्यक विशेषता अलग करना, उसकी सही गणना करना और आयाम न खोना।

बेंचमार्क कैसे बना है

लेखक — Mingxu Zhang, Ying Sun, Yuhan Li, Yang Ji, Dazhong Shen, Ke Zhang और Shan Huang — ने 200 कार्य तैयार किए। कार्यों को पाँच कठिनाई स्तरों और 27 प्रश्न प्रकारों में बाँटा गया है: साधारण सिग्नल डिटेक्शन से लेकर OFDM सिस्टम के डिज़ाइन तक। सामग्री का स्रोत 11 प्रकार के सिग्नल हैं, और हर एक के लिए सत्यापित संदर्भ सत्य तैयार किया गया है।

पाँच स्तर

स्तर मॉडल की बढ़ती स्वायत्तता के क्रम में बनाए गए हैं। सबसे नीचे बुनियादी मापदंडों का मापन है: सिग्नल खोजना, उसकी विशेषताओं का अनुमान लगाना। ऊपर व्याख्या और तुलना है, फिर कई चरणों वाला विश्लेषण, उसके बाद निदान, और अंत में सिस्टम डिज़ाइन, जहाँ मॉडल से मापने के बजाय दी गई आवश्यकताओं के अनुरूप समाधान डिज़ाइन करने की अपेक्षा होती है।

27 प्रश्न प्रकार और 11 सिग्नल प्रकार

इतनी विविधता इसलिए ज़रूरी है ताकि परिणाम किसी एक सफल या असफल शब्दावली पर निर्भर न हो। अलग-अलग सिग्नल प्रकार अलग-अलग जाल बिछाते हैं: कहीं शोर परेशान करता है, कहीं स्पेक्ट्रम में ओवरलैप, और कहीं सैंपलिंग के साथ सावधानी से निपटना पड़ता है। प्रश्न और सिग्नल प्रकार मिलकर एक ऐसा क्षेत्र बनाते हैं जिसमें संयोग से सही अनुमान लगाना मुश्किल है।

खुला डेटा

सभी सामग्री और कोड एक सार्वजनिक GitHub रिपॉज़िटरी में रखे गए हैं, इसलिए परिणाम को स्वतंत्र रूप से दोबारा जाँचा जा सकता है। बेंचमार्क के लिए यह सामान्य से अधिक महत्वपूर्ण है: यदि कार्य फ़ील्ड रिकॉर्डिंग से हाथ से जोड़े जाने के बजाय जनरेट किए गए हैं, तो संदर्भ सत्य की सटीकता का प्रश्न केंद्रीय हो जाता है — और यहाँ खुलापन ही एकमात्र कारगर उत्तर है।

मॉडलों ने क्या दिखाया

14 भाषा मॉडलों की जाँच की गई: प्रोप्राइटरी, खुले वज़न वाले, और अलग से तर्क-केंद्रित मॉडल। कुल विस्तार — 24.1% से 78.9% तक। यह दायरा अपने आप में बहुत कुछ कहता है: सर्वश्रेष्ठ और सबसे खराब मॉडल के बीच का अंतर यहाँ प्रतिशत में नहीं, गुणकों में मापा जाता है।

लेकिन इससे भी दिलचस्प बात और है। स्तर जैसे-जैसे कठिन होता जाता है, औसत परिणाम तेज़ी से गिरता है: बुनियादी मापों पर 84.9% से लेकर सिस्टम डिज़ाइन पर 21.2% तक। यानी जब किसी मापी जा सकने वाली राशि की गणना करनी हो तो मॉडल ठीक-ठाक काम करते हैं, और जब इन राशियों से एक काम करने वाला समाधान जोड़ना हो तो लगभग बिखर जाते हैं।

इसे रैंकिंग के बजाय निदान की तरह पढ़ना चाहिए। आज के मॉडलों की ताकत कोड का निष्पादन और ज्ञात समस्या-रचना पर अंकगणित है। कमज़ोरी है इंजीनियरिंग कार्य को मापे जा सकने वाले चरणों की भाषा में बदलना: यह समझना कि कौन-सी राशियाँ चाहिए, किस क्रम में खोजनी हैं, और यह कैसे जाँचना है कि जो मिला वह सच जैसा भी लगता है या नहीं। यही खाई बेंचमार्क को उपयोगी बनाती है।

ReconPilot: खोज, विश्लेषण, जाँच

लेखक केवल मापन तक सीमित नहीं रहे। उन्होंने ReconPilot प्रस्तावित किया — एक संरचित दृष्टिकोण, जिसमें काम तीन चरणों में बाँटा गया है: सिग्नल की खोज, लक्षित विश्लेषण और स्व-जाँच। पहले मॉडल रिकॉर्डिंग का अध्ययन करता है और यह समझ बनाता है कि उसका सामना किससे है। फिर वह विशिष्ट कार्य हल करता है। इसके बाद अपने परिणाम पर लौटता है और उसकी संगति जाँचता है।

तीन बुनियादी मॉडलों पर यह विधि कुल स्कोर में 3.8 से 17.6 अंक जोड़ती है। परीक्षण किए गए 15 में से 13 "बैकबोन + स्तर" संयोजनों में सुधार हासिल हुआ। शब्दावली पर ध्यान दें: लाभ एक समान नहीं है, और दो मामलों में तो बिल्कुल भी नहीं है। यह ईमानदार प्रयोग का सामान्य लक्षण है — कोई सर्वव्यापी रामबाण नहीं मिला, पर प्रवृत्ति स्थिर है।

यह संकेतक है कि मदद ठीक चरणों के स्पष्ट विभाजन से मिलती है। जिस मॉडल से बस "सिग्नल का विश्लेषण करो" कहा जाए, वह यह सुनिश्चित किए बिना कि उसने डेटा समझा है, गणना की ओर कूद जाता है। एक अलग अनिवार्य चरण के रूप में खोज मॉडल को पहले देखने पर और फिर गिनने पर मजबूर करती है।

इससे क्या निकलता है

इंजीनियरिंग अभ्यास के लिए निष्कर्ष काफ़ी सीधा है: वास्तविक मापों पर एजेंट की गणनाओं पर भरोसा करने से पहले, उसे बिना संकेतों वाले डेटा पर जाँच लेना चाहिए। सुविधाजनक इंटरफ़ेस और चैट में चिकना जवाब यह नहीं बताते कि मॉडल रिसीवर से आए अनप्रोसेस्ड एक्सपोर्ट से टकराकर टिकेगा या नहीं।

एक और व्यापक विचार भी है, जो रेडियो की सीमाओं से आगे जाता है। किसी भी ऐसे क्षेत्र में जहाँ तर्क कच्चे मापों पर टिकता है — जलध्वनिकी, कंपन, टेलीमेट्री — एजेंट को पहले डेटा में राशि खोजनी आनी चाहिए, और फिर उस पर काम करना। फ़ीचर वाली तालिकाएँ काम का यह हिस्सा छिपा देती हैं, और उसके साथ त्रुटियाँ भी छिप जाती हैं।

सीमाएँ और आगे क्या

प्रश्न को पूरी तरह बंद नहीं कहा जा सकता। 200 कार्य एक ठीक-ठाक आकार है, पर असीमित नहीं, और 11 सिग्नल प्रकारों पर आधारित जनरेशन का मतलब है कि अपने सभी आर्टिफ़ैक्ट्स के साथ वास्तविक फ़ील्ड रिकॉर्डिंग वहाँ फिर भी मौजूद नहीं हैं। 14 मॉडलों का मूल्यांकन क्षण की एक तस्वीर है, फ़ैसला नहीं: इस क्षेत्र में अग्रणियों की सूची तेज़ी से बदलती है।

फिर भी कार्य की रचना सही लगती है। अगर हम चाहते हैं कि LLM डेटा के पुनर्कथन के बजाय डेटा के साथ ही काम करें, तो उन्हें ठीक वहीं जाँचना चाहिए जहाँ संकेत समाप्त हो जाते हैं। EMRB यही करता है — और दिखाता है कि सिग्नल की खोज में मॉडलों के पास बढ़ने की गुंजाइश अभी बहुत बड़ी है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
कच्चे I/Q, तालिकाओं के बजाय: EMRB जाँचता है कि क्या LLM कोड के ज़रिए रेडियो सिग्नलों पर तर्क कर सकते हैं