Apa ini dan untuk apa
Perusahaan Perplexity merilis Portable Computer — build lokal dari platform agen Computer mereka, yang kini berjalan di stasiun ringkas NVIDIA DGX Spark. Ini bukan pratinjau atau build eksperimental, melainkan perangkat lunak rilis yang lengkap: orkestrator, perencana, router alat, dan model yang telah dilatih ulang semuanya terpasang langsung di perangkat.

Produk ini tidak ditujukan untuk pasar massal. Pembeli utamanya adalah perusahaan besar dan bisnis menengah yang sudah memiliki stasiun NVIDIA, ditambah startup AI-native yang didanai dengan baik. Perusahaan kecil biasa kemungkinan besar tidak akan mendapatkan kembali investasinya dari pembelian ini. Dilihat dari posisinya, sistem ini paling menarik bagi sektor keuangan, hukum, kesehatan, pemerintahan, pertahanan, dan tim teknik yang menangani kekayaan intelektual yang sensitif.
Bagaimana sistem lokal bekerja
Semua yang diperlukan dikirimkan dalam satu paket: model lokal, mesin inferensi, harness agen, sandbox untuk alat, dan konektor aplikasi. Pengguna dapat memilih antara Qwen 3.8 27B dan PPLX 27B — opsi kedua adalah model yang dilatih ulang oleh Perplexity sendiri. Segera mereka berjanji akan menambahkan model terbuka NVIDIA Nemotron 3.5 Lightning dengan arsitektur MoE 30 miliar parameter. Jika ingin menggunakan model sendiri, model BYO dan server inferensi khusus juga didukung.
Kode dan pemanggilan alat dijalankan di dalam sandbox yang dikendalikan oleh sistem operasi. Sandbox ini membatasi secara ketat proses, akses ke jalur sistem file, dan koneksi jaringan. Jika sandbox tiba-tiba tidak tersedia, eksekusi alat akan dinonaktifkan — tanpa transisi diam-diam ke mode yang tidak aman.
Integrasi dengan Gmail, Outlook, Slack, dan GitHub dirutekan melalui orkestrator lokal. Agar model tidak tenggelam dalam konteks, para pengembang menerapkan beberapa trik: prompt sistem dan kumpulan alat dibuat kecil, keterampilan khusus dimuat sesuai permintaan, dan konektor dirancang sebagai utilitas CLI yang ringkas, bukan definisi MCP lengkap. Selama proses yang panjang, konteks yang sudah usang dipadatkan. Ini penting, karena Qwen mengklaim jendela 260K token, tetapi dalam praktiknya degradasi dimulai setelah sekitar 100K.
Saat tugas dikirim ke cloud
Langkah-langkah lokal tidak dikenakan biaya per token — biaya hanya muncul untuk operasi cloud. Setiap tugas dimulai di perangkat. Jika agen memerlukan akses langsung ke web atau penalaran yang sangat kompleks, orkestrator berhenti dan bertanya kepada pengguna apakah langkah tunggal ini boleh dikirim ke luar. Tersedia lebih dari 15 model cloud untuk dipilih.

Sebelum pengiriman, harness hanya memilih konteks yang relevan, menjalankannya melalui pengklasifikasi PII, dan menunjukkan data apa saja yang akan meninggalkan mesin. Penasihat cloud menerima langkah yang telah disetujui dan mengembalikan instruksi tekstual. Ia tidak memiliki akses langsung ke file lokal, alat, atau riwayat percakapan. Hasilnya adalah skema hibrida: bagian privat tetap di perangkat, sementara komputasi berat didelegasikan ke luar secara selektif dan di bawah kendali pemilik.
Hasil dalam tolok ukur
Perplexity menyajikan pengukuran mereka sendiri pada set Local Knowledge Work Bench yang terdiri dari 53 tugas agen komputer. Dengan model Qwen 3.8 27B di NVIDIA DGX Spark, build lokal mencapai 82,6%. Sebagai perbandingan: harness terbuka Pi menunjukkan 77,6%, dan Hermes pada model yang sama — 74,0%. Mengganti model dengan PPLX 27B meningkatkan hasil menjadi 85,4%.
Pada tes BrowseComp, platform agen memperoleh 66,7% dibandingkan 50,2% untuk Pi dan 43,9% untuk Hermes. Selain itu, platform ini menghabiskan waktu 51% lebih sedikit dan token 70% lebih sedikit daripada Pi. Kesenjangan yang lebih mencolok lagi terlihat pada tes ParseBench-100 untuk pemahaman visual dokumen: 65,1% berbanding 34,6% dan 13,9%.
Pada Terminal Bench 2.1, proses yang sepenuhnya lokal menghasilkan 59,6% dengan biaya marjinal yang hampir nol. Jika penasihat cloud dihubungkan, hasilnya meningkat menjadi 73,0%, dan biaya satu rollout sekitar $0,415. Sebagai gambaran: model Claude Opus 5 yang terpisah pada tes yang sama mencapai 82,4%, tetapi biayanya sekitar $0,65 per proses. Eskalasi secara signifikan mengurangi kesenjangan dengan model terkuat, tetapi tidak sepenuhnya menutupnya. Namun, mode lokal tetap hampir gratis.

Persyaratan teknis dan ketersediaan
Untuk instalasi di NVIDIA DGX Spark, diperlukan superchip GB10, memori 128 GB, dan penyimpanan minimal 1 TB. Orkestrator berbasis Qwen 3.8 27B dikirimkan dalam kuantisasi 3-bit: unduhan 17,4 GB, membutuhkan RAM 32 GB. Versi dengan NVIDIA Nemotron 3.5 Lightning adalah 4-bit, memakan 19 GB, dan membutuhkan RAM 36 GB. Pada sistem lain, DGX OS atau Ubuntu di ARM atau x64 dengan kartu grafis RTX dan minimal 24 GB VRAM dapat digunakan. Instalasi dilakukan melalui repositori apt standar.
Pada peluncuran awal, sistem tersedia Linux-first untuk pelanggan Pro, Max, Enterprise Pro, dan Enterprise Max. Versi Windows diharapkan hadir pada bulan September, sementara macOS belum ada di peta jalan. Catatan penting: hanya satu DGX Spark yang didukung saat peluncuran; pengelompokan beberapa perangkat direncanakan untuk masa depan.
Pada dasarnya, ini adalah upaya untuk menciptakan lingkungan agen privat yang tidak memerlukan koneksi internet terus-menerus dan tidak membayar untuk setiap panggilan lokal, tetapi tetap mampu menghubungkan model cloud yang kuat ketika hal itu benar-benar dibenarkan.



