फ़ीड

181 सामग्री

क्रमबद्धता
समाचार11 सितम्बर 2026

AI उद्योग में कल्याण अनुसंधान की कमी क्यों है और नया अनुदान कोष क्या बदलाव ला रहा है

Anthropic ने स्वतंत्र टीमों के लिए $5 मिलियन आवंटित किए हैं: वे अध्ययन करेंगी कि मॉडल उपयोगकर्ताओं की भावनात्मक स्थिति को कैसे प्रभावित करते हैं, और अपनी मूल्यांकन पद्धतियों को सार्वजनिक रूप से प्रकाशित करेंगी। यह कार्यक्रम मॉडलों तक पहुंच और तकनीकी सहायता भी प्रदान करता है, और शोधकर्ताओं से आवेदन 21 सितंबर तक स्वीकार किए जाते हैं।

AI उद्योग में कल्याण अनुसंधान की कमी क्यों है और नया अनुदान कोष क्या बदलाव ला रहा है
पढ़ें
समाचार11 सितम्बर 2026

ScienceFlow: कैसे एक LLM-एजेंट लंबे प्रयोगों में शोध को पूरा करना सीखता है

नया ScienceFlow फ्रेमवर्क AI-एजेंटों को बहु-घंटीय शोध कार्यों में लक्ष्य न खोने में मदद करता है: कार्य को पुनर्प्राप्त करने योग्य खंडों में विभाजित किया जाता है, और संसाधनों का आवंटन वास्तविक रूप से पुष्टि की गई प्रगति के आधार पर किया जाता है। MLE-bench पर इसने प्रकाशित दृष्टिकोणों में सर्वश्रेष्ठ परिणाम दिखाया।

ScienceFlow: कैसे एक LLM-एजेंट लंबे प्रयोगों में शोध को पूरा करना सीखता है
पढ़ें
समाचार11 सितम्बर 2026

बिना भ्रम के एजेंटिक SQL: स्वायत्तता का एकीकृत पैमाना और LLM बेंचमार्क की ईमानदार तुलना

शोधकर्ता Text-to-SQL क्षेत्र को एक समेकित लीडरबोर्ड के रूप में देखने का सुझाव देते हैं, जहाँ परिणाम SQL क्वेरी उत्पन्न करने में मॉडल की स्वायत्तता की डिग्री के अनुसार वितरित किए जाते हैं। वे Spider पर माप करते हैं और दिखाते हैं कि सफलताएँ हमेशा अन्य बेंचमार्क पर स्थानांतरित नहीं होती हैं, और स्वायत्तता स्थिरता प्रदान करती है, लेकिन इसके लिए काफी कम्प्यूटेशनल संसाधनों की आवश्यकता होती है।

बिना भ्रम के एजेंटिक SQL: स्वायत्तता का एकीकृत पैमाना और LLM बेंचमार्क की ईमानदार तुलना
पढ़ें
समाचार11 सितम्बर 2026

इतिहास पर निर्भर किए बिना: MIT का एल्गोरिदम भविष्य की मौसम आपदाओं का चित्रण करता है

मैसाचुसेट्स इंस्टीट्यूट ऑफ टेक्नोलॉजी के इंजीनियरों ने एक AI उपकरण बनाया है जो अवलोकन अभिलेखों में अनुपस्थित चरम मौसम परिदृश्य उत्पन्न करता है। मॉडल पिछली आपदाओं के डेटा पर प्रशिक्षण के बिना उनकी संभावित तीव्रता, अवधि और क्षेत्र का आकलन करता है।

इतिहास पर निर्भर किए बिना: MIT का एल्गोरिदम भविष्य की मौसम आपदाओं का चित्रण करता है
पढ़ें
समाचार11 सितम्बर 2026

बड़ी वैज्ञानिक सफलताओं की योजना नहीं बनाई जाती: एजेंट-आधारित ऑटो-शोधकर्ताओं में फ़ज़िंग-परीक्षण से बहुत कुछ समान है

नए शोध के लेखकों का तर्क है कि स्वायत्त वैज्ञानिक प्रणालियों को केवल दुर्लभ अंतिम परिणाम पर निर्भर रहने के बजाय, फ़ज़र्स की तरह, मध्यवर्ती प्रगति के सघन संकेतों पर आधारित होना चाहिए। यह दृष्टिकोण एजेंट को अपरंपरागत परिकल्पनाओं का पता लगाने और बेंचमार्क के अनुरूप अति-अनुकूलन से बचने में सक्षम बनाता है।

बड़ी वैज्ञानिक सफलताओं की योजना नहीं बनाई जाती: एजेंट-आधारित ऑटो-शोधकर्ताओं में फ़ज़िंग-परीक्षण से बहुत कुछ समान है
पढ़ें
समाचार11 सितम्बर 2026

NL2SHACL-Bench: पाठ्य आवश्यकताओं से SHACL शेप निर्माण के मूल्यांकन के लिए नया बेंचमार्क

ISWC 2026 के लेख में लेखकों ने एक उपकरण प्रस्तुत किया जो LLM की सामान्य क्वेरी को मान्य SHACL-बाधाओं में बदलने की क्षमता को मापता है, यह ध्यान में रखते हुए कि समान नियम अलग-अलग दिख सकते हैं। चार मॉडलों पर किए गए परीक्षणों से पता चला: वे सिंटैक्स को आसानी से संभाल लेते हैं, लेकिन अक्सर जटिल बाधाओं के अर्थ को नहीं समझ पाते।

NL2SHACL-Bench: पाठ्य आवश्यकताओं से SHACL शेप निर्माण के मूल्यांकन के लिए नया बेंचमार्क
पढ़ें
समाचार11 सितम्बर 2026

मार्जिन कैलिब्रेशन बनाम पुनः प्रशिक्षण: भूली हुई चीज़ों को भूला कैसे रखें

शोधकर्ताओं ने पाया कि LLM को अनसीखाने (unlearning) के मानक तरीके कुछ ही भूले हुए उदाहरणों पर फिर से प्रशिक्षण देने पर आसानी से विफल हो जाते हैं। उनके द्वारा प्रस्तावित Margin Calibration तकनीक एक गैर-संतृप्त मार्जिन दंड जोड़ती है और विभिन्न मॉडलों और डेटासेटों पर ऐसे हमलों की सफलता को काफी हद तक कम कर देती है।

मार्जिन कैलिब्रेशन बनाम पुनः प्रशिक्षण: भूली हुई चीज़ों को भूला कैसे रखें
पढ़ें
समाचार10 सितम्बर 2026

Telco-GAIA: वास्तविक दूरसंचार ऑपरेटर के डेटा पर AI एजेंट का परीक्षण कैसे करें

एक नया बेंचमार्क अंग्रेजी और अरबी में 100 प्रश्न-उत्तर परिदृश्य पेश करता है, जो ऑपरेटर के वास्तविक डेटा—वेबसाइट, SQL डेटाबेस और वेब आर्काइव—के आसपास बनाए गए हैं। 12 मॉडलों पर परीक्षण से पता चला कि सबसे अच्छा मॉडल भी केवल 71% कार्यों को हल करता है, और दृश्य श्रेणियों में परिणाम 30% से नीचे गिर जाता है।

Telco-GAIA: वास्तविक दूरसंचार ऑपरेटर के डेटा पर AI एजेंट का परीक्षण कैसे करें
पढ़ें
समाचार10 सितम्बर 2026

Prometheus को छोड़कर भौतिक दुनिया के AI की ओर: आनंदकुमार और येनिक ने Accelerated Understanding की स्थापना की

कैलटेक की प्रोफेसर और उनके सहयोगी ने बेजोस-समर्थित परियोजना में हिस्सेदारी छोड़कर अपना खुद का स्टार्टअप शुरू किया। नई कंपनी का लक्ष्य ऐसे मॉडल बनाना है जो रोबोटिक्स, सेमीकंडक्टर और जलवायु के लिए भौतिक घटनाओं की भविष्यवाणी करते हैं।

Prometheus को छोड़कर भौतिक दुनिया के AI की ओर: आनंदकुमार और येनिक ने Accelerated Understanding की स्थापना की
पढ़ें