फ़ीड

253 सामग्री

क्रमबद्धता
समाचार11 सितम्बर 2026

ClinicalGPT-R1: नए LLM निदान के लिए चीनी नैदानिक कार्यों में GPT-4o को पीछे छोड़ता है

शोधकर्ताओं ने 20,000 वास्तविक नैदानिक रिकॉर्ड पर प्रशिक्षित एक सार्वभौमिक चिकित्सा भाषा मॉडल प्रस्तुत किया। MedBench-Hard बेंचमार्क में, इसने चीनी भाषा में GPT-4o से बेहतर और अंग्रेज़ी परिदृश्यों में GPT-4 के बराबर परिणाम दिखाए।

ClinicalGPT-R1: नए LLM निदान के लिए चीनी नैदानिक कार्यों में GPT-4o को पीछे छोड़ता है
पढ़ें
समाचार11 सितम्बर 2026

STReason: एक मल्टी-टास्क फ्रेमवर्क जो स्थानिक-अस्थायी विश्लेषण को बड़े भाषा मॉडल की व्याख्यात्मकता के साथ जोड़ता है

फ्रेमवर्क मॉडल को हर अलग कार्य के लिए प्रशिक्षित करने की आवश्यकता नहीं होती: जटिल प्रश्नों को व्याख्या योग्य मॉड्यूल में विभाजित किया जाता है, जिन्हें स्थानिक-अस्थायी मॉडल और LLM द्वारा निष्पादित किया जाता है। यह दृष्टिकोण सत्यापन योग्य संख्यात्मक परिणाम और उनके स्पष्टीकरण प्रदान करता है, जिससे भ्रम (गलत उत्तर) का जोखिम कम होता है, और परीक्षणों में यह सामान्य LLM बेसलाइन से काफी बेहतर प्रदर्शन करता है।

STReason: एक मल्टी-टास्क फ्रेमवर्क जो स्थानिक-अस्थायी विश्लेषण को बड़े भाषा मॉडल की व्याख्यात्मकता के साथ जोड़ता है
पढ़ें
समाचार11 सितम्बर 2026

AI उद्योग में कल्याण अनुसंधान की कमी क्यों है और नया अनुदान कोष क्या बदलाव ला रहा है

Anthropic ने स्वतंत्र टीमों के लिए $5 मिलियन आवंटित किए हैं: वे अध्ययन करेंगी कि मॉडल उपयोगकर्ताओं की भावनात्मक स्थिति को कैसे प्रभावित करते हैं, और अपनी मूल्यांकन पद्धतियों को सार्वजनिक रूप से प्रकाशित करेंगी। यह कार्यक्रम मॉडलों तक पहुंच और तकनीकी सहायता भी प्रदान करता है, और शोधकर्ताओं से आवेदन 21 सितंबर तक स्वीकार किए जाते हैं।

AI उद्योग में कल्याण अनुसंधान की कमी क्यों है और नया अनुदान कोष क्या बदलाव ला रहा है
पढ़ें
समाचार11 सितम्बर 2026

पहली Meta Quest को Meta से मुक्त किया गया: नया बूटलोडर पूर्ण root-एक्सेस खोलता है

उत्साही लोगों ने एक एक्सप्लॉइट जारी किया है जो वेब इंटरफेस के माध्यम से मूल Quest हेडसेट पर रूट अधिकार प्राप्त करता है। यह Meta सर्वरों पर निर्भरता समाप्त करता है और डेवलपर खाते के बिना ऐप्स इंस्टॉल करने की अनुमति देता है।

पहली Meta Quest को Meta से मुक्त किया गया: नया बूटलोडर पूर्ण root-एक्सेस खोलता है
पढ़ें
समाचार11 सितम्बर 2026

ScienceFlow: कैसे एक LLM-एजेंट लंबे प्रयोगों में शोध को पूरा करना सीखता है

नया ScienceFlow फ्रेमवर्क AI-एजेंटों को बहु-घंटीय शोध कार्यों में लक्ष्य न खोने में मदद करता है: कार्य को पुनर्प्राप्त करने योग्य खंडों में विभाजित किया जाता है, और संसाधनों का आवंटन वास्तविक रूप से पुष्टि की गई प्रगति के आधार पर किया जाता है। MLE-bench पर इसने प्रकाशित दृष्टिकोणों में सर्वश्रेष्ठ परिणाम दिखाया।

ScienceFlow: कैसे एक LLM-एजेंट लंबे प्रयोगों में शोध को पूरा करना सीखता है
पढ़ें
समाचार11 सितम्बर 2026

बिना भ्रम के एजेंटिक SQL: स्वायत्तता का एकीकृत पैमाना और LLM बेंचमार्क की ईमानदार तुलना

शोधकर्ता Text-to-SQL क्षेत्र को एक समेकित लीडरबोर्ड के रूप में देखने का सुझाव देते हैं, जहाँ परिणाम SQL क्वेरी उत्पन्न करने में मॉडल की स्वायत्तता की डिग्री के अनुसार वितरित किए जाते हैं। वे Spider पर माप करते हैं और दिखाते हैं कि सफलताएँ हमेशा अन्य बेंचमार्क पर स्थानांतरित नहीं होती हैं, और स्वायत्तता स्थिरता प्रदान करती है, लेकिन इसके लिए काफी कम्प्यूटेशनल संसाधनों की आवश्यकता होती है।

बिना भ्रम के एजेंटिक SQL: स्वायत्तता का एकीकृत पैमाना और LLM बेंचमार्क की ईमानदार तुलना
पढ़ें
समाचार11 सितम्बर 2026

इतिहास पर निर्भर किए बिना: MIT का एल्गोरिदम भविष्य की मौसम आपदाओं का चित्रण करता है

मैसाचुसेट्स इंस्टीट्यूट ऑफ टेक्नोलॉजी के इंजीनियरों ने एक AI उपकरण बनाया है जो अवलोकन अभिलेखों में अनुपस्थित चरम मौसम परिदृश्य उत्पन्न करता है। मॉडल पिछली आपदाओं के डेटा पर प्रशिक्षण के बिना उनकी संभावित तीव्रता, अवधि और क्षेत्र का आकलन करता है।

इतिहास पर निर्भर किए बिना: MIT का एल्गोरिदम भविष्य की मौसम आपदाओं का चित्रण करता है
पढ़ें
समाचार11 सितम्बर 2026

बड़ी वैज्ञानिक सफलताओं की योजना नहीं बनाई जाती: एजेंट-आधारित ऑटो-शोधकर्ताओं में फ़ज़िंग-परीक्षण से बहुत कुछ समान है

नए शोध के लेखकों का तर्क है कि स्वायत्त वैज्ञानिक प्रणालियों को केवल दुर्लभ अंतिम परिणाम पर निर्भर रहने के बजाय, फ़ज़र्स की तरह, मध्यवर्ती प्रगति के सघन संकेतों पर आधारित होना चाहिए। यह दृष्टिकोण एजेंट को अपरंपरागत परिकल्पनाओं का पता लगाने और बेंचमार्क के अनुरूप अति-अनुकूलन से बचने में सक्षम बनाता है।

बड़ी वैज्ञानिक सफलताओं की योजना नहीं बनाई जाती: एजेंट-आधारित ऑटो-शोधकर्ताओं में फ़ज़िंग-परीक्षण से बहुत कुछ समान है
पढ़ें
समाचार11 सितम्बर 2026

NL2SHACL-Bench: पाठ्य आवश्यकताओं से SHACL शेप निर्माण के मूल्यांकन के लिए नया बेंचमार्क

ISWC 2026 के लेख में लेखकों ने एक उपकरण प्रस्तुत किया जो LLM की सामान्य क्वेरी को मान्य SHACL-बाधाओं में बदलने की क्षमता को मापता है, यह ध्यान में रखते हुए कि समान नियम अलग-अलग दिख सकते हैं। चार मॉडलों पर किए गए परीक्षणों से पता चला: वे सिंटैक्स को आसानी से संभाल लेते हैं, लेकिन अक्सर जटिल बाधाओं के अर्थ को नहीं समझ पाते।

NL2SHACL-Bench: पाठ्य आवश्यकताओं से SHACL शेप निर्माण के मूल्यांकन के लिए नया बेंचमार्क
पढ़ें