Wuying-Browser-Agent: ब्राउज़र-आधारित AI जो वास्तविक वेब पर लंबे परिदृश्यों को संभालता है

27 अगस्त 202615 बार देखा गया

शोधकर्ताओं ने एक खुला फ्रेमवर्क प्रस्तुत किया है जो स्थिर ब्राउज़र हार्नेस, त्रुटि-पुनर्प्राप्ति पर आधारित प्रशिक्षण और विशेष reinforcement learning को जोड़ता है। मॉडल WebVoyager, Online-Mind2Web और नए BrowserBench बेंचमार्क पर रिकॉर्ड परिणाम दिखाता है, और यह दृष्टिकोण ब्राउज़र के बाहर के कार्यों पर भी लागू होता है।

Wuying-Browser-Agent: ब्राउज़र-आधारित AI जो वास्तविक वेब पर लंबे परिदृश्यों को संभालता है

आदर्श डेमो से लाइव वेबसाइटों तक

AI-आधारित ब्राउज़र असिस्टेंट छोटे और साफ-सुथरे परिदृश्यों को आत्मविश्वास से संभाल लेते हैं: उत्पाद ढूंढना, ऑर्डर देना, फॉर्म भरना। लेकिन जैसे ही ऐसा एजेंट किसी असली वेबसाइट पर पहुंचता है — धीमी लोडिंग, अचानक पॉप-अप, बदलता लेआउट और दर्जनों बीच के क्लिक के साथ — तस्वीर बदल जाती है। हकीकत में, AI को क्रियाओं की लंबी श्रृंखला के दौरान लक्ष्य बनाए रखना होता है, अपनी गलतियों को नोटिस करके सुधारना होता है, और भीड़भाड़ वाले इंटरफेस को समझना होता है।

व्यवहार में "लंबा परिदृश्य" क्या है? यह एक क्लिक नहीं है और न ही दस: एजेंट वांछित परिणाम तक पहुंचने से पहले 30–40 या उससे अधिक कदम उठा सकता है। हर कदम पिछले कदम पर निर्भर करता है, और एक गलती पूरी मेहनत पर पानी फेर सकती है। इसके अलावा, असली वेब पेज लगातार बदलते रहते हैं: लेआउट "तैरता" है, नए तत्व सामने आते हैं, और डेटा एसिंक्रोनस रूप से लोड होता है। स्थिर डेमो पर प्रशिक्षित मॉडल ऐसी परिस्थितियों में भटक जाता है।

समस्या यह है कि अधिकांश मौजूदा दृष्टिकोण सरलीकृत डेमो पर प्रशिक्षित होते हैं और जटिलता के इस स्तर के लिए डिज़ाइन नहीं किए गए हैं। यहां मॉडल का सरल स्केलिंग मदद नहीं करता: प्रयोगशाला स्थितियों और असली वेब के बीच का अंतर पूरे पाइपलाइन पर पुनर्विचार की मांग करता है — क्रिया निष्पादन से लेकर अंतिम मूल्यांकन तक।

लंबे क्षितिजों के लिए एकीकृत फ्रेमवर्क

यही कार्य AIMAE टीम ने अपने सामने रखा, जिसने Wuying-Browser-Agent प्रस्तुत किया — एक ओपन-सोर्स फ्रेमवर्क जो ब्राउज़र एजेंट के काम के सभी स्तरों को कवर करता है। केवल एक हिस्से पर ध्यान केंद्रित करने के बजाय, लेखकों ने निष्पादन, नियंत्रण, अनुकूलन और मूल्यांकन को संरेखित किया।

आइए प्रत्येक स्तर को विस्तार से देखें। निष्पादन — यह है कि एजेंट पेज के साथ कैसे इंटरैक्ट करता है: क्लिक करना, टेक्स्ट दर्ज करना, टैब स्विच करना। नियंत्रण — क्रियाओं की निगरानी और कुछ गलत होने पर समय पर हस्तक्षेप। अनुकूलन — सीखने की प्रक्रिया जो मॉडल को सफल ट्रैजेक्टरीज़ पर ट्यून करती है। और अंत में, मूल्यांकन — यह मापने का तरीका कि एजेंट असली वेब में कार्यों को कितनी अच्छी तरह संभालता है। ये सभी स्तर समन्वित रूप से काम करने चाहिए, अन्यथा सिस्टम लंबी दूरी पर बिखर जाता है।

सिस्टम के कामकाज को सुनिश्चित करने वाले तीन प्रमुख घटक हैं:

  • संरचित ब्राउज़र हार्नेस — क्रियाओं को निष्पादित करने के लिए स्थिर प्रिमिटिव का सेट। यह एजेंट को एक पूर्वानुमेय वातावरण देता है और निर्णय लेने पर ध्यान केंद्रित करते हुए संदर्भ प्रबंधित करने में मदद करता है। अविश्वसनीय सेलेक्टर या यादृच्छिक टाइमिंग पर निर्भर रहने के बजाय, एजेंट को स्पष्ट निर्देश मिलते हैं जो समान रूप से निष्पादित होते हैं।
  • RUIC-SFT — त्रुटि-पुनर्प्राप्ति ट्रैजेक्टरीज़ और जटिल इंटरफेस तत्वों के साथ इंटरैक्शन पर सुपरवाइज़्ड फाइन-ट्यूनिंग की विधि। मॉडल केवल सफल श्रृंखलाओं पर ही नहीं, बल्कि गतिरोध से बाहर निकलने के तरीके पर भी सीखता है।
  • DAO-GRPO — अनुकूलन एल्गोरिदम जो संभावित रिवॉर्ड शेपिंग और डाइवर्जेंस द्वारा चरणों के भारांकन के माध्यम से लंबे क्षितिजों पर "क्रेडिट" वितरण में सुधार करता है। प्रत्येक क्रिया का मूल्यांकन समग्र परिणाम में उसके योगदान के आधार पर किया जाता है, न कि अलगाव में।

यह दृष्टिकोण मॉडल को केवल आदर्श कदम उठाने की अनुमति नहीं देता, बल्कि वास्तविक बाधाओं पर प्रतिक्रिया करने और यह समझने की अनुमति देता है कि कौन सी क्रियाएं वास्तव में उसे लक्ष्य की ओर ले जाती हैं। फ्रेमवर्क पहले से ही दिखा रहा है कि पाइपलाइन का संरेखण मॉडल के आकार को बढ़ाने से अधिक प्रभाव देता है।

BrowserBench: वास्तविक लंबाई की परीक्षा

यह कैसे जांचें कि एजेंट वास्तव में असली वेब के लिए तैयार है? मौजूदा बेंचमार्क अक्सर बहुत छोटे होते हैं और लंबी दूरी पर विशिष्ट विफलताओं को उजागर नहीं करते। एक सामान्य परीक्षण में 5–10 कदम हो सकते हैं, जबकि वास्तविक जीवन में एजेंट को काफी लंबे समय तक काम करना पड़ता है। इसलिए टीम ने अपना खुद का — BrowserBench बनाया। यह वास्तविक वेबसाइटों से लिए गए 350 कार्यों का द्विभाषी सेट है, जिसमें परिदृश्य की औसत लंबाई लगभग 38 कदम है।

ऐसी लंबाई — एक मौलिक अंतर है। छोटे कार्यों पर एजेंट लगभग बेतरतीब ढंग से कार्य कर सकता है और फिर भी उच्च परिणाम प्राप्त कर सकता है। लंबे कार्यों पर, हर गलती जमा होती है, और सही "क्रेडिट" वितरण के बिना सिस्टम जल्दी से रास्ते से भटक जाता है। BrowserBench इन विफलताओं को देखने और यह समझने की अनुमति देता है कि वास्तव में किन तंत्रों को सुधारने की आवश्यकता है।

परिणाम खुद बोलते हैं। Wuying-Browser-Agent 27 बिलियन पैरामीटर के साथ WebVoyager पर 80.6%, Online-Mind2Web पर 66.7% और BrowserBench पर 65.1% तक पहुंचता है — यह ब्राउज़र उपयोग बेंचमार्क पर एक नया ओपन रिकॉर्ड है। वही पाइपलाइन अन्य क्षेत्रों में भी सफलतापूर्वक स्थानांतरित होती है: Tau2-Bench, Claw-Eval और BFCL-v4 सेट पर औसत स्कोर 73.8।

यह महत्वपूर्ण है कि सफलता किसी एक विशिष्ट कार्य पर नहीं, बल्कि कई स्वतंत्र परीक्षणों पर एक साथ प्राप्त होती है। इसका मतलब है कि फ्रेमवर्क वेब इंटरफेस के साथ काम करने के सामान्य सिद्धांतों को आत्मसात करता है, न कि किसी विशिष्ट बेंचमार्क के अनुकूल होता है। अच्छी सामान्यीकरण क्षमता — यह संकेत है कि एजेंट वास्तव में समझता है कि वह क्या कर रहा है, न कि केवल पैटर्न रट रहा है।

AI एजेंटों के विकास के लिए इसका क्या मतलब है

मुख्य निष्कर्ष विशिष्ट आंकड़ों में नहीं है, हालांकि वे प्रभावशाली हैं। दृष्टिकोण अधिक महत्वपूर्ण है: एजेंट को वास्तविक दुनिया में काम करने के लिए, स्वच्छ डेमो पर अलग-अलग रिकॉर्ड का पीछा करना बंद करना होगा और इसके बजाय पूरे सिस्टम को लंबे, जटिल परिदृश्यों के लिए बनाना होगा। Wuying-Browser-Agent दिखाता है कि यह प्राप्त करने योग्य है, और ओपन-सोर्स रूप में — शोधकर्ता इसके परिणामों को दोहरा सकते हैं और आगे विकसित कर सकते हैं।

इस दृष्टिकोण का व्यावहारिक मूल्य भी है। कल्पना करें कि आपको दर्जनों साइटों पर शर्तों की तुलना करनी है, टिकट बुक करना है या एक लंबा फॉर्म भरना है। अभी यह मैन्युअल रूप से करना पड़ता है, क्योंकि कोई भी असिस्टेंट इतनी देर तक संदर्भ बनाए नहीं रख सकता। Wuying-Browser-Agent जैसे फ्रेमवर्क के साथ, ऐसे कार्य निकट भविष्य में स्वचालित किए जा सकते हैं।

ब्राउज़र एजेंट प्रयोगशाला प्रयोग नहीं रह गए हैं और व्यावहारिक उपकरण बन रहे हैं। बस इंतजार करना बाकी है जब ऐसी प्रणालियाँ सामान्य ब्राउज़रों में दिखाई दें और दिनचर्या अपने हाथ में लें — खरीदारी से लेकर दस्तावेज़ भरने तक। और इस फ्रेमवर्क को देखते हुए, इंतजार ज्यादा लंबा नहीं है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
Wuying-Browser-Agent: ब्राउज़र-आधारित AI जो वास्तविक वेब पर लंबे परिदृश्यों को संभालता है