अनुभव के साथ बदलती सावधानी: अनिश्चितता में सुरक्षित निर्णयों के लिए RATTL विधि

28 अगस्त 202615 बार देखा गया

यह नया कार्य RATTL एल्गोरिदम प्रस्तुत करता है, जो पर्यावरण मॉडल में एजेंट की वर्तमान अनिश्चितता के माध्यम से जोखिम स्तर निर्धारित करता है: जितना कम डेटा होगा, व्यवहार उतना ही सतर्क होगा, और आत्मविश्वास बढ़ने के साथ नीति धीरे-धीरे अधिक साहसी बन जाती है। यह दृष्टिकोण सबसे खराब स्थिति से सुरक्षा और अधिकतम पुरस्कार की खोज के बीच मध्यवर्ती गारंटी प्रदान करता है।

अनुभव के साथ बदलती सावधानी: अनिश्चितता में सुरक्षित निर्णयों के लिए RATTL विधि

अनुभव के साथ बदलती सावधानी: अनिश्चितता में सुरक्षित निर्णयों के लिए RATTL विधि

जब कोई एजेंट वास्तविक दुनिया में कार्य करता है, तो उसे लगभग हमेशा पर्यावरण के बारे में अधूरी जानकारी का सामना करना पड़ता है। यह समस्या उन प्रणालियों के लिए विशेष रूप से गंभीर है जिन्हें वास्तविक समय में काम करना होता है: रोबोट, स्वायत्त वाहन, या बड़े भाषा मॉडल पर आधारित सेवाएँ। इतना सतर्क रहना कि सभी संभावित परिदृश्यों को ध्यान में रखा जाए, असंभव है, और अत्यधिक साहसिक व्यवहार दुर्घटना का कारण बन सकता है। एक संतुलन की आवश्यकता है, और ठीक यही संतुलन Deep Kumar Ganguly और Jan Kretinsky के शोध में प्रस्तावित नए दृष्टिकोण की तलाश है।

समस्या कहाँ से आई

लेखकों ने «Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making» (arXiv:2608.17574) शीर्षक से कार्य प्रस्तुत किया। यह पेपर अगस्त 2026 में प्रस्तुत किया गया था और IJCAI-ECAI 2026 सम्मेलन के RobustifAI कार्यशाला में स्वीकार किया गया। केंद्र में है — RATTL, या Risk-Adversarial Total-Reward Learning। यह एक ऐसी विधि है जो एजेंट को ऐसे वातावरण में निर्णय लेने की अनुमति देती है जहाँ पर्यावरण की गतिशीलता केवल आंशिक रूप से ज्ञात होती है, जोखिमों का मूल्यांकन करते हुए।

RATTL का मुख्य विचार यह है कि सावधानी की डिग्री निश्चित नहीं होती, बल्कि सीधे तौर पर इस बात पर निर्भर करती है कि एजेंट वास्तव में अपने परिवेश के बारे में कितना अनिश्चित है। यदि साक्ष्य कम हैं — हम सावधानी से कार्य करते हैं। यदि वे अधिक हो जाते हैं — हम अधिक साहसिक कार्य कर सकते हैं। यही अनुकूलनशीलता इस विधि को शास्त्रीय दृष्टिकोणों से अलग करती है, जहाँ जोखिम का स्तर पहले से निर्धारित होता है और अपरिवर्तित रहता है।

विधि कैसे काम करती है: अनिश्चितता एक त्रिज्या के रूप में

RATTL के आधार पर अज्ञात पर्यावरणीय गतिशीलता पर बायेसियन पश्च प्रायिकता है। सीधे शब्दों में, एजेंट लगातार अपने विचारों को अद्यतन करता रहता है कि दुनिया कैसे काम करती है — जैसे-जैसे अवलोकन जमा होते हैं। लेकिन योजना बनाने के लिए यह पर्याप्त नहीं है: यह भी समझना आवश्यक है कि ये विचार कितने गलत हो सकते हैं।

लेखकों का समाधान पर्यावरण के संभावित मॉडलों के समुच्चय को तथाकथित Wasserstein-अनिश्चितता समुच्चय के रूप में देखना है। इस समुच्चय की त्रिज्या — यह माप कि हम वर्तमान अपेक्षाओं से कितना विचलन स्वीकार करते हैं — पश्च प्रायिकता के एक मोनोटोनिक फलन के रूप में निर्धारित होती है। प्रारंभिक चरणों में, जब डेटा कम होता है, त्रिज्या बड़ी होती है: एजेंट मानता है कि पर्यावरण लगभग किसी भी तरह व्यवहार कर सकता है। जैसे-जैसे साक्ष्य आते हैं, त्रिज्या सिकुड़ती है, और «संभावित दुनिया» का दायरा संकीर्ण होता जाता है।

यह तंत्र एक दिलचस्प प्रक्षेप प्रभाव देता है। सीमा में, जब त्रिज्या अधिकतम होती है, एजेंट का व्यवहार सबसे खराब स्थिति की गारंटी देने वाली मजबूती के बराबर होता है — एक ऐसी रणनीति जो सबसे अप्रिय परिदृश्यों में सुरक्षित होती है। जब त्रिज्या शून्य की ओर बढ़ती है, एजेंट एक जोखिम-तटस्थ अनुकूलक बन जाता है जो केवल अपेक्षित कुल पुरस्कार को अधिकतम करता है। मध्यवर्ती बिंदुओं पर, हमें व्यवहारों का एक सतत स्पेक्ट्रम मिलता है — अत्यंत रूढ़िवादी से लेकर लगभग आत्मविश्वासी तक।

ऐसी कसौटी का निर्माण Entropic Value-at-Risk के आधार पर निहित द्वैत पर निर्भर करता है। यह संबंध जोखिम स्तर की पसंद को अनिश्चितता की त्रिज्या की पसंद में बदलने की अनुमति देता है, जो संगणनात्मक रूप से सुविधाजनक और अवधारणात्मक रूप से स्पष्ट है: अमूर्त «सावधानी गुणांक» के बजाय, हम एक ज्यामितीय मात्रा के साथ काम करते हैं जिसे ज्ञात मॉडल से स्वीकार्य विचलन के रूप में व्याख्यायित किया जा सकता है।

गारंटी और सुरक्षा: «Safety Sandwich»

लेखकों ने खुद को अनुमानित तरीकों तक सीमित नहीं रखा। उन्होंने दिखाया कि RATTL में योजना की समस्या क्षणिकता और राज्य स्थान की संहतता की शर्तों के तहत सुसंगत है। इसका मतलब है कि एल्गोरिथ्म अनंत प्रक्षेप पथों पर «टूटता» नहीं है और उपयोगिता फलन के सार्थक मान देता है।

केंद्रीय सैद्धांतिक परिणाम को Safety Sandwich — «सुरक्षा सैंडविच» नाम दिया गया है। RATTL का मान हमेशा दो चरम मानों के बीच होता है। नीचे से इसे सूचनाहीन मजबूत मान द्वारा सीमित किया जाता है — अर्थात, वह अनुमान जो एक एजेंट को मिलता यदि उसके पास कोई डेटा न हो और वह सबसे खराब स्थिति के लिए तैयार हो। ऊपर से — गतिशीलता के पूर्ण ज्ञान पर इष्टतम मान। जैसे-जैसे पश्च प्रायिकता सत्य मॉडल के चारों ओर केंद्रित होती है, इन सीमाओं के बीच का अंतर कम होता जाता है, और RATTL का अनुमान इष्टतम की ओर बढ़ता है। दूसरे शब्दों में, विधि गारंटी देती है कि शुरुआत में अत्यधिक सावधानी विनाशकारी रूप से कम पुरस्कार की ओर नहीं ले जाती, और अंत में आत्मविश्वास एजेंट को अवशिष्ट जोखिमों के प्रति अंधा नहीं बनाता।

उदाहरणों में व्यवहार: अमूर्तता से व्यवहार तक

चित्रण के लिए, लेखक द्विआधारी खतरे के साथ एक विहित उदाहरण पर विचार करते हैं — एक ऐसी स्थिति जहाँ पर्यावरण की दो अवस्थाएँ होती हैं, एक सुरक्षित और दूसरी घातक रूप से खतरनाक। इस मामले में, प्रेरित RATTL कसौटी Conditional Value-at-Risk में बदल जाती है, जिसका स्तर पश्च प्रायिकता की एन्ट्रॉपी द्वारा निर्धारित होता है। दूसरे शब्दों में, एजेंट के विश्वास वितरण का वितरण जितना अधिक «फैला हुआ» होता है, वह उतनी ही सख्त हानि सीमा चुनता है।

एक अन्य कार्यशील उदाहरण दिलचस्प व्यवहार दिखाता है: एजेंट प्रभावी कार्रवाई को लंबे समय तक टालता है, तब तक प्रतीक्षा करता है जब तक कि पहचान की तीव्र सीमा तक नहीं पहुँच जाती। अर्थात, वह गैर-इष्टतमता सहन करने को तैयार है — उदाहरण के लिए, धीरे-धीरे चलना या जानबूझकर सबसे लाभदायक रणनीति न चुनना — बस आँख बंद करके जोखिम न लेने के लिए। जैसे ही साक्ष्य पर्याप्त रूप से ठोस हो जाते हैं, एक गुणात्मक छलांग होती है: एजेंट आत्मविश्वासपूर्ण कार्यों पर स्विच करता है। यह एक इंसान के व्यवहार की याद दिलाता है जो किसी अपरिचित स्थान पर पहले धीरे-धीरे चलता है और चारों ओर देखता है, और फिर रास्ता जानने के बाद गति बढ़ा देता है।

ऐसा कार्य मोड वास्तविक समय प्रणालियों के लिए विशेष रूप से महत्वपूर्ण है। लेखक इस बात पर जोर देते हैं कि RATTL डेटा की निरंतर धारा की स्थितियों में कार्य करने वाले एजेंटों की सुरक्षा के लिए डिज़ाइन किया गया है, जिसमें बड़े भाषा मॉडल पर आधारित प्रणालियाँ भी शामिल हैं। उनके लिए, अनिश्चितता न केवल भौतिक पर्यावरण के कारण उत्पन्न होती है, बल्कि उपयोगकर्ताओं के व्यवहार या संसाधित पाठ की गुणवत्ता में अनिश्चितता के कारण भी होती है।

यह क्यों महत्वपूर्ण है

RATTL का मुख्य योगदान «सावधानी बनाम दक्षता» की कठोर द्वंद्वात्मकता को अस्वीकार करना है। इसके बजाय, लेखक उन्हें एक ही प्रक्रिया के दो पहलुओं के रूप में देखने का प्रस्ताव करते हैं: हम जितना अधिक जानते हैं, उतने साहसी हो सकते हैं, और साथ ही हम अपने ज्ञान की डिग्री और स्वीकार्य जोखिम के बीच एक स्पष्ट संबंध बनाए रखना चाहते हैं। ऐसा दृष्टिकोण स्वचालित निर्णय लेने के तरीकों को अधिक पारदर्शी और पूर्वानुमान योग्य बनाता है, जो व्यावहारिक कार्यान्वयन के लिए महत्वपूर्ण है।

बड़े राज्य स्थानों के साथ काम करते समय संगणनात्मक जटिलता का प्रश्न खुला रहता है, लेकिन सैद्धांतिक आधार पहले ही रखा जा चुका है। संभवतः, निकट भविष्य में हम विशिष्ट डोमेन के लिए RATTL के संशोधन देखेंगे — ड्रोन नियंत्रण से लेकर AI-आधारित सहायकों तक, जो अपने अनुभव से सीखते हैं, बिना खुद को या दूसरों को जोखिम में डाले।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
अनुभव के साथ बदलती सावधानी: अनिश्चितता में सुरक्षित निर्णयों के लिए RATTL विधि