यह क्या है और क्यों
Perplexity कंपनी ने Portable Computer जारी किया है — यह अपने एजेंट प्लेटफ़ॉर्म Computer का एक लोकल बिल्ड है, जो अब कॉम्पैक्ट NVIDIA DGX Spark स्टेशन पर काम करता है। यह कोई प्रीव्यू या प्रायोगिक बिल्ड नहीं है, बल्कि एक पूर्ण रिलीज़ सॉफ़्टवेयर है: ऑर्केस्ट्रेटर, प्लानर, टूल राउटर और फ़ाइन-ट्यून किए गए मॉडल सीधे डिवाइस पर इंस्टॉल किए गए हैं।

यह प्रोडक्ट मास मार्केट के लिए नहीं है। मुख्य खरीदार बड़ी कंपनियाँ और मिड-साइज़ बिज़नेस हैं, जिनके पास पहले से NVIDIA स्टेशन हैं, साथ ही अच्छी तरह से फ़ंडेड AI-नेटिव स्टार्टअप भी। आम छोटी फ़र्मों के लिए ऐसी खरीदारी शायद ही लाभदायक हो। पोज़िशनिंग को देखते हुए, यह सिस्टम मुख्य रूप से फ़ाइनेंस, कानून, हेल्थकेयर, सरकारी क्षेत्र, रक्षा और इंजीनियरिंग टीमों के लिए दिलचस्प है जो संवेदनशील बौद्धिक संपदा के साथ काम करती हैं।
लोकल सिस्टम कैसे काम करता है
सब कुछ एक ही पैकेज में मिलता है: लोकल मॉडल, इंफ़रेंस इंजन, एजेंट हार्नेस, टूल्स के लिए सैंडबॉक्स और ऐप कनेक्टर। उपयोगकर्ता Qwen 3.8 27B और PPLX 27B के बीच चयन कर सकता है — दूसरा विकल्प Perplexity द्वारा फ़ाइन-ट्यून किया गया मॉडल है। जल्द ही NVIDIA Nemotron 3.5 Lightning ओपन मॉडल जोड़ने का वादा किया गया है, जिसमें 30 बिलियन पैरामीटर के साथ MoE आर्किटेक्चर होगा। अगर कोई अपना कुछ इस्तेमाल करना चाहता है, तो BYO-मॉडल और अपना खुद का इंफ़रेंस सर्वर समर्थित हैं।
कोड और टूल कॉल सैंडबॉक्स के अंदर निष्पादित होते हैं, जिसे ऑपरेटिंग सिस्टम नियंत्रित करता है। यह प्रोसेस, फ़ाइल सिस्टम पाथ तक पहुँच और नेटवर्क कनेक्शन को सख्ती से सीमित करता है। अगर सैंडबॉक्स अचानक अनुपलब्ध हो जाता है, तो टूल निष्पादन बस बंद कर दिया जाता है — बिना किसी असुरक्षित मोड में चुपचाप जाने के।
Gmail, Outlook, Slack और GitHub के साथ इंटीग्रेशन लोकल ऑर्केस्ट्रेटर के माध्यम से रूट किए जाते हैं। मॉडल को कॉन्टेक्स्ट में डूबने से बचाने के लिए, डेवलपर्स ने कई तरकीबें अपनाई हैं: सिस्टम प्रॉम्प्ट और टूल्स का सेट छोटा रखा जाता है, विशेष कौशल मांग पर लोड होते हैं, और कनेक्टर पूर्ण MCP परिभाषाओं के बजाय कॉम्पैक्ट CLI-उपयोगिताओं के रूप में बनाए गए हैं। लंबे रन के दौरान पुराना कॉन्टेक्स्ट संकुचित हो जाता है। यह महत्वपूर्ण है, क्योंकि Qwen के लिए 260K टोकन की विंडो बताई गई है, लेकिन व्यवहार में गिरावट लगभग 100K के बाद शुरू होती है।
जब कार्य क्लाउड में जाता है
लोकल चरणों के लिए टोकन शुल्क नहीं लिया जाता — भुगतान केवल क्लाउड ऑपरेशन के लिए होता है। हर कार्य डिवाइस पर शुरू होता है। अगर एजेंट को वेब तक सीधी पहुँच या वास्तव में जटिल तर्क की आवश्यकता होती है, तो ऑर्केस्ट्रेटर रुक जाता है और उपयोगकर्ता से पूछता है कि क्या इस एक चरण को बाहर भेजा जा सकता है। चुनने के लिए 15 से अधिक क्लाउड मॉडल उपलब्ध हैं।

भेजने से पहले हार्नेस केवल प्रासंगिक कॉन्टेक्स्ट का चयन करता है, उसे PII-क्लासिफायर से गुज़ारता है और दिखाता है कि वास्तव में कौन सा डेटा मशीन छोड़ेगा। क्लाउड सलाहकार को स्वीकृत चरण मिलता है और वह टेक्स्ट निर्देश लौटाता है। उसके पास लोकल फ़ाइलों, टूल्स या डायलॉग इतिहास तक सीधी पहुँच नहीं होती। परिणाम एक हाइब्रिड योजना है: निजी हिस्सा डिवाइस पर रहता है, जबकि भारी गणना बाहर चुनिंदा रूप से और मालिक के नियंत्रण में सौंपी जाती है।
बेंचमार्क में परिणाम
Perplexity ने Local Knowledge Work Bench सेट पर 53 कंप्यूटर एजेंट कार्यों के अपने माप प्रस्तुत किए हैं। NVIDIA DGX Spark पर Qwen 3.8 27B मॉडल के साथ, लोकल बिल्ड ने 82.6% स्कोर किया। तुलना के लिए: ओपन हार्नेस Pi ने 77.6% दिखाया, और उसी मॉडल पर Hermes ने 74.0%। मॉडल को PPLX 27B से बदलने पर परिणाम 85.4% तक बढ़ जाता है।
BrowseComp टेस्ट पर एजेंट प्लेटफ़ॉर्म को 66.7% मिला, जबकि Pi को 50.2% और Hermes को 43.9%। साथ ही, इसने Pi की तुलना में 51% कम समय और 70% कम टोकन खर्च किए। और भी अधिक ध्यान देने योग्य अंतर ParseBench-100 टेस्ट पर है जो दस्तावेज़ों की विज़ुअल समझ के लिए है: क्रमशः 65.1% बनाम 34.6% और 13.9%।
Terminal Bench 2.1 पर पूरी तरह से लोकल रन ने लगभग शून्य मार्जिनल लागत पर 59.6% दिया। अगर क्लाउड सलाहकार जोड़ा जाए, तो परिणाम 73.0% तक बढ़ जाता है, और एक rollout की लागत लगभग $0.415 होती है। संदर्भ के लिए: उसी टेस्ट पर अलग Claude Opus 5 मॉडल 82.4% प्राप्त करता है, लेकिन प्रति रन लगभग $0.65 खर्च होता है। एस्केलेशन सबसे मजबूत मॉडल के साथ अंतर को काफी कम कर देता है, लेकिन इसे पूरी तरह से बंद नहीं करता। हालाँकि, लोकल मोड लगभग मुफ़्त रहता है।

तकनीकी आवश्यकताएँ और उपलब्धता
NVIDIA DGX Spark पर इंस्टॉलेशन के लिए GB10 सुपरचिप, 128 GB मेमोरी और कम से कम 1 TB स्टोरेज आवश्यक है। Qwen 3.8 27B पर आधारित ऑर्केस्ट्रेटर 3-बिट क्वांटाइज़ेशन में आता है: डाउनलोड 17.4 GB, 32 GB RAM आवश्यक। NVIDIA Nemotron 3.5 Lightning वाला संस्करण 4-बिट है, 19 GB लेता है और 36 GB RAM की आवश्यकता होती है। अन्य सिस्टम पर ARM या x64 पर DGX OS या Ubuntu का उपयोग RTX ग्राफ़िक्स कार्ड और कम से कम 24 GB वीडियो मेमोरी के साथ किया जा सकता है। इंस्टॉलेशन मानक apt-रिपॉज़िटरी के माध्यम से किया जाता है।
शुरुआत में, सिस्टम Pro, Max, Enterprise Pro और Enterprise Max सब्सक्राइबर्स के लिए Linux-first उपलब्ध है। Windows संस्करण सितंबर में अपेक्षित है, और macOS अभी रोडमैप में नहीं है। एक महत्वपूर्ण बारीकियाँ: लॉन्च के समय केवल एक DGX Spark समर्थित है, कई डिवाइसों की क्लस्टरिंग भविष्य के लिए योजनाबद्ध है।
अनिवार्य रूप से, यह एक निजी एजेंट वातावरण बनाने का प्रयास है जिसे इंटरनेट से निरंतर कनेक्शन की आवश्यकता नहीं होती और जो हर लोकल कॉल के लिए भुगतान नहीं करता, लेकिन साथ ही शक्तिशाली क्लाउड मॉडल को तब कनेक्ट कर सकता है जब यह वास्तव में उचित हो।



