फ़ीड

60 सामग्री

क्रमबद्धता
समाचार11 सितम्बर 2026

बिना भ्रम के एजेंटिक SQL: स्वायत्तता का एकीकृत पैमाना और LLM बेंचमार्क की ईमानदार तुलना

शोधकर्ता Text-to-SQL क्षेत्र को एक समेकित लीडरबोर्ड के रूप में देखने का सुझाव देते हैं, जहाँ परिणाम SQL क्वेरी उत्पन्न करने में मॉडल की स्वायत्तता की डिग्री के अनुसार वितरित किए जाते हैं। वे Spider पर माप करते हैं और दिखाते हैं कि सफलताएँ हमेशा अन्य बेंचमार्क पर स्थानांतरित नहीं होती हैं, और स्वायत्तता स्थिरता प्रदान करती है, लेकिन इसके लिए काफी कम्प्यूटेशनल संसाधनों की आवश्यकता होती है।

बिना भ्रम के एजेंटिक SQL: स्वायत्तता का एकीकृत पैमाना और LLM बेंचमार्क की ईमानदार तुलना
पढ़ें
समाचार10 सितम्बर 2026

OpenAI का वादा: इसका Jalapeño चिप प्रतिस्पर्धियों के समाधानों से तेज़ और अधिक किफायती होगा

कंपनी का दावा है कि Broadcom के साथ विकसित इन्फरेंस प्रोसेसर, कई AI मॉडलों पर परीक्षणों में ऊर्जा दक्षता और प्रतिक्रिया गति के मामले में Nvidia के एक्सेलेरेटर से बेहतर प्रदर्शन करता है। चिप्स को इस साल के अंत तक कम मात्रा में तैनात करने की योजना है, लेकिन Nvidia के बेड़े को पूरी तरह से बदलने का इरादा नहीं है।

OpenAI का वादा: इसका Jalapeño चिप प्रतिस्पर्धियों के समाधानों से तेज़ और अधिक किफायती होगा
पढ़ें
समाचार9 सितम्बर 2026

FinSkillBench: निवेश AI-एजेंटों में तैयार प्रक्रियात्मक कौशल कभी-कभी मॉडल चुनने से अधिक महत्वपूर्ण होते हैं

नया बेंचमार्क पोर्टफोलियो अनुकूलन, जोखिम प्रबंधन और मौलिक विश्लेषण में भाषा एजेंटों का परीक्षण करता है। नौ मॉडलों पर, पहले से एकत्रित कौशल पैकेज औसत परिणामों में उल्लेखनीय सुधार करते हैं, जबकि एजेंट द्वारा स्वतंत्र रूप से कौशल निर्माण से लगभग कोई लाभ नहीं मिलता है।

FinSkillBench: निवेश AI-एजेंटों में तैयार प्रक्रियात्मक कौशल कभी-कभी मॉडल चुनने से अधिक महत्वपूर्ण होते हैं
पढ़ें
समाचार8 सितम्बर 2026

OpenAI ने गोपनीयता के प्रति अपना रुख सख्त किया: Anthropic के 30-दिवसीय सत्र भंडारण के जवाब में नई डेटा सुरक्षा प्रणाली

OpenAI ने दुरुपयोग की निगरानी के लिए एक स्वचालित प्रणाली पेश की है जो ग्राहकों का डेटा संग्रहीत नहीं करती — यह Anthropic की हालिया नीति का सीधा जवाब है, जिसमें बातचीत को 30 दिनों तक रखा जाता है। इस तरह कंपनियाँ बढ़ती प्रतिस्पर्धा के बीच कॉर्पोरेट उपयोगकर्ताओं का विश्वास जीतने के लिए अपने प्रयास तेज़ कर रही हैं।

OpenAI ने गोपनीयता के प्रति अपना रुख सख्त किया: Anthropic के 30-दिवसीय सत्र भंडारण के जवाब में नई डेटा सुरक्षा प्रणाली
पढ़ें
समाचार8 सितम्बर 2026

मौसम AI मॉडल को जलवायु मॉडल के रूप में परखा गया: ArchesWeather और ArchesWeatherGen के बहु-वर्षीय सिमुलेशन ने क्या दिखाया

शोधकर्ताओं ने दो न्यूरल नेटवर्कों को दीर्घकालिक वायुमंडलीय प्रयोगों के लिए अनुकूलित किया, उनमें बाहरी सीमा स्थितियाँ जोड़ीं, और उन्हें AIMIP प्रोटोकॉल के अनुसार चलाया। यह पाया गया कि ये मॉडल, जो मूल रूप से दस दिनों तक के पूर्वानुमानों के लिए डिज़ाइन किए गए थे, एक स्थिर वार्षिक चक्र उत्पन्न करते हैं और बहु-दशकीय सिमुलेशन में जलवायु विज्ञान और परिवर्तनशीलता को विश्वसनीय रूप से दर्शाते हैं।

मौसम AI मॉडल को जलवायु मॉडल के रूप में परखा गया: ArchesWeather और ArchesWeatherGen के बहु-वर्षीय सिमुलेशन ने क्या दिखाया
पढ़ें
तुलना8 सितम्बर 2026

Wordware बनाम Replit: AI एजेंट्स और क्लासिकल डेवलपमेंट के लिए कौन सा टूल चुनें?

Wordware आपको प्रोग्रामिंग के बिना AI एजेंट बनाने की सुविधा देता है, जो एक परिचित टेक्स्ट एडिटर जैसे इंटरफ़ेस का उपयोग करता है। Replit डेवलपर्स के लिए एक क्लाउड वातावरण है जिसमें AI सहायक होता है जो कोड लिखने, समझाने और डिप्लॉय करने में मदद करता है। हम जानते हैं कि विभिन्न कार्यों के लिए कौन सी सेवा उपयुक्त है।

Wordware बनाम Replit: AI एजेंट्स और क्लासिकल डेवलपमेंट के लिए कौन सा टूल चुनें?
पढ़ें
समाचार7 सितम्बर 2026

BFI के बजाय: नया व्यक्तित्व प्रश्नावली CSI मॉडल मूल्यांकन को अधिक स्थिर और पूर्वानुमानित बनाता है

शोधकर्ताओं ने कोर सेंटिमेंट इन्वेंटरी (CSI) विकसित की है — यह LLM के व्यक्तित्व लक्षणों का आकलन करने वाला एक उपकरण है, जो उनकी कम्प्यूटेशनल प्रकृति को ध्यान में रखता है। यह शब्दों के बदलाव पर अधिक स्थिर प्रतिक्रिया देता है, अंग्रेज़ी और चीनी में काम करता है, और 0.85 से अधिक सहसंबंध के साथ मॉडलों के वास्तविक व्यवहार की भविष्यवाणी करता है।

BFI के बजाय: नया व्यक्तित्व प्रश्नावली CSI मॉडल मूल्यांकन को अधिक स्थिर और पूर्वानुमानित बनाता है
पढ़ें
समाचार3 सितम्बर 2026

ब्लैक-बॉक्स जेलब्रेक: समान संख्या में मॉडल कॉल पर हमलों की तुलना क्यों करें

शोधकर्ताओं ने Fair-ASR प्रोटोकॉल प्रस्तावित किया है, जो लक्ष्य मॉडल को समान क्वेरी बजट पर LLM हमलों का मूल्यांकन करता है, जबकि हमलावर के खर्चों को अलग से ध्यान में रखता है। 11 ज्ञात तरीकों की समीक्षा से पता चला कि उनकी रैंकिंग बजट पर काफी निर्भर करती है, और सरल टेम्पलेट जटिल LLM-आधारित दृष्टिकोणों से कमतर नहीं हैं — इसने लेखकों को नया हमला ReCode बनाने के लिए प्रेरित किया।

ब्लैक-बॉक्स जेलब्रेक: समान संख्या में मॉडल कॉल पर हमलों की तुलना क्यों करें
पढ़ें
गाइड1 सितम्बर 2026

कौन सा AI इमेज जनरेटर चुनें: Stable Diffusion 3.5, Recraft V3, Flux 1.1 Pro या Midjourney 6.1

चार लोकप्रिय टूल्स की तुलना तस्वीर की गुणवत्ता, गति, कीमत और उपयोग में आसानी के आधार पर। हम यह समझने में मदद करते हैं कि फोटोरियलिज्म, रचनात्मक प्रयोगों या तेज़ जनरेशन के लिए कौन सा सर्विस उपयुक्त होगा।

कौन सा AI इमेज जनरेटर चुनें: Stable Diffusion 3.5, Recraft V3, Flux 1.1 Pro या Midjourney 6.1
पढ़ें