फ़ीड

37 सामग्री

क्रमबद्धता
समाचार10 सितम्बर 2026

Telco-GAIA: वास्तविक दूरसंचार ऑपरेटर के डेटा पर AI एजेंट का परीक्षण कैसे करें

एक नया बेंचमार्क अंग्रेजी और अरबी में 100 प्रश्न-उत्तर परिदृश्य पेश करता है, जो ऑपरेटर के वास्तविक डेटा—वेबसाइट, SQL डेटाबेस और वेब आर्काइव—के आसपास बनाए गए हैं। 12 मॉडलों पर परीक्षण से पता चला कि सबसे अच्छा मॉडल भी केवल 71% कार्यों को हल करता है, और दृश्य श्रेणियों में परिणाम 30% से नीचे गिर जाता है।

Telco-GAIA: वास्तविक दूरसंचार ऑपरेटर के डेटा पर AI एजेंट का परीक्षण कैसे करें
पढ़ें
समाचार10 सितम्बर 2026

GIM बेंचमार्क: विभिन्न संज्ञानात्मक कौशलों के संगम पर LLM का परीक्षण

शोधकर्ताओं ने एक ऐसा दृष्टिकोण प्रस्तावित किया है जो मॉडलों का मूल्यांकन ज्ञान की मात्रा या वास्तविकता से अलग करके नहीं, बल्कि ऐसे कार्यों के माध्यम से करता है जिनमें एक साथ तर्क, संदर्भ नियंत्रण और सीमाओं के साथ काम करने की आवश्यकता होती है। बेंचमार्क में 820 मौलिक कार्य शामिल हैं, और इसके लेखकों ने यह भी अध्ययन किया कि 'सोच' सेटिंग्स और मॉडलों के अन्य पैरामीटर परिणामों को कैसे प्रभावित करते हैं।

GIM बेंचमार्क: विभिन्न संज्ञानात्मक कौशलों के संगम पर LLM का परीक्षण
पढ़ें
समाचार9 सितम्बर 2026

LLM सुरक्षा फ़िल्टर अंग्रेज़ी के बाहर विफल हो जाते हैं: कैसे मॉडल अन्य भाषाओं में रूढ़िवादिता को बढ़ावा देते हैं

शोधकर्ताओं ने बड़े भाषा मॉडलों की सुरक्षा में एक गंभीर अंतर-भाषाई असंतुलन की पहचान की है: उनका संरेखण मुख्य रूप से अंग्रेजी के लिए ट्यून किया गया है, इसलिए अन्य भाषाओं में मॉडल आसानी से प्रतिबंधों को दरकिनार कर देते हैं और हानिकारक पूर्वाग्रहों को दोहराते हैं। दस मॉडलों और छह भारतीय भाषाओं पर परीक्षण किया गया नया बेंचमार्क INCLUDE, यह दर्शाता है कि पूर्वाग्रह का स्तर भाषा और मॉडल के प्रकार के आधार पर काफी भिन्न होता है।

LLM सुरक्षा फ़िल्टर अंग्रेज़ी के बाहर विफल हो जाते हैं: कैसे मॉडल अन्य भाषाओं में रूढ़िवादिता को बढ़ावा देते हैं
पढ़ें
समाचार9 सितम्बर 2026

ड्रोन प्रोपेलर नियंत्रण में: रूपांतरित 'कृत्रिम आयु' उड़ान लॉग पढ़ने में मदद करती है

लेखकों ने एक निर्णय समर्थन प्रणाली का प्रोटोटाइप प्रस्तावित किया है जो उड़ान लॉग से छह संकेतकों का विश्लेषण करता है और उन्हें प्रोपेलर स्वास्थ्य के रूपांतरित सूचकांक में बदल देता है। DronePropA डेटा पर पूर्वव्यापी प्रयोग में, सिस्टम ने एक स्वस्थ मामले को विफलता के तीन स्तरों से सही ढंग से अलग किया और संकेत दिया कि निरीक्षण या रखरखाव कब आवश्यक है।

ड्रोन प्रोपेलर नियंत्रण में: रूपांतरित 'कृत्रिम आयु' उड़ान लॉग पढ़ने में मदद करती है
पढ़ें
समाचार8 सितम्बर 2026

सिंगुलैरिटी का इससे कोई लेना-देना नहीं: Stripe को OpenRouter के साथ वास्तव में क्या मिलेगा

Stripe का प्रमुख इस सौदे को सिंगुलैरिटी की ओर एक कदम बताता है, लेकिन असली मकसद कहीं अधिक व्यावहारिक है: मॉडल राउटर के माध्यम से कंपनी को डेवलपर्स के AI बजट और नकदी प्रवाह के एक नए केंद्र तक पहुंच मिलती है।

सिंगुलैरिटी का इससे कोई लेना-देना नहीं: Stripe को OpenRouter के साथ वास्तव में क्या मिलेगा
पढ़ें
समाचार8 सितम्बर 2026

दो-सिग्नल चेकपॉइंट जाँच: छिपी हुई अब्लिटरेशन और उसकी कमजोरियाँ खोजना

लेखक खुले वज़न मॉडलों का बिना-सीमा ऑडिट प्रस्तावित करता है, जो आर्टिफैक्ट के भीतर दो पूरक संकेतों की जोड़ी पर आधारित है। 273 चेकपॉइंट्स पर किए गए परीक्षणों में यह विधि AUROC 0.95 तक पहुँचती है, लेकिन यह जानबूझकर बायपास से सुरक्षा नहीं, बल्कि एक ट्रायेज है।

दो-सिग्नल चेकपॉइंट जाँच: छिपी हुई अब्लिटरेशन और उसकी कमजोरियाँ खोजना
पढ़ें
समाचार8 सितम्बर 2026

FVSpec: वास्तविक property-based परीक्षणों का Lean में अनुवाद और AI-सत्यापन के लिए नए मानदंड

शोधकर्ताओं ने वास्तविक Python परियोजनाओं से 11,000 से अधिक property-based परीक्षण एकत्र किए और उन्हें स्वचालित रूप से Lean 4 की हजारों औपचारिक विशिष्टताओं में बदल दिया। परिणामी खुला बेंचमार्क यह मूल्यांकन करने की अनुमति देता है कि मॉडल और एजेंट वास्तविक कोड के सत्यापन में कितना अच्छा प्रदर्शन करते हैं।

FVSpec: वास्तविक property-based परीक्षणों का Lean में अनुवाद और AI-सत्यापन के लिए नए मानदंड
पढ़ें
समाचार7 सितम्बर 2026

Google ने दिवालिया Spirit के कर्मचारी डेटा का आर्काइव खरीदा: फ्लाइट अटेंडेंट निजता की सुरक्षा की मांग कर रहे हैं

फ्लाइट अटेंडेंट्स यूनियन और मानवाधिकार कार्यकर्ता उस सौदे को लेकर चिंतित हैं, जिसके तहत Google ने नीलामी में Spirit Airlines के विशाल कार्य दस्तावेज़ों का सेट खरीदा — वेतन डेटा से लेकर कॉर्पोरेट पत्राचार तक। उन्हें आशंका है कि AI प्रशिक्षण के लिए डेटा का उपयोग करते समय डी-आइडेंटिफिकेशन कर्मचारियों को उनकी व्यक्तिगत जानकारी के पुनः खुलासे से सुरक्षित नहीं रखेगा।

Google ने दिवालिया Spirit के कर्मचारी डेटा का आर्काइव खरीदा: फ्लाइट अटेंडेंट निजता की सुरक्षा की मांग कर रहे हैं
पढ़ें
समाचार4 सितम्बर 2026

AdaLens: दृश्य कथा-रेखा जो लंबे एजेंट विश्लेषणों को नियंत्रित और पुनर्निर्देशित करने में मदद करती है

जैसे-जैसे डेटा साइंस में LLM एजेंटों की स्वायत्तता बढ़ती है, मानक इंटरफ़ेस सिस्टम की तर्क प्रक्रिया और समय पर हस्तक्षेप करने की क्षमता की स्पष्ट तस्वीर नहीं देते। AdaLens विश्लेषणात्मक प्रक्रिया को एक कहानी के रूप में विज़ुअलाइज़ करता है: योजनाएँ, प्रगति और मध्यवर्ती परिणाम दिखाई देते हैं, और विश्लेषक कार्य की दिशा बदल सकता है।

AdaLens: दृश्य कथा-रेखा जो लंबे एजेंट विश्लेषणों को नियंत्रित और पुनर्निर्देशित करने में मदद करती है
पढ़ें