Perplexity запустила «портативный компьютер» на NVIDIA DGX Spark: локальные агенты, OS-песочница и оплата только за облачные шаги

13 сентября 20260 просмотров

Новинка объединяет агентскую обвязку, планировщик, инструменты и коннекторы в единую систему на собственном GPU. Локальные задачи не тарифицируются за токен, а перед отправкой шага в облако система показывает пользователю, какие данные покинут устройство.

Perplexity запустила «портативный компьютер» на NVIDIA DGX Spark: локальные агенты, OS-песочница и оплата только за облачные шаги

Что это и зачем

Компания Perplexity выпустила Portable Computer — локальную сборку своей агентной платформы Computer, которая теперь работает на компактной станции NVIDIA DGX Spark. Это не превью и не экспериментальный билд, а полноценное релизное ПО: оркестратор, планировщик, роутер инструментов и дообученные модели установлены прямо на устройство.

Продукт ориентирован не на массовый рынок. Основные покупатели — крупные компании и средний бизнес, у которых уже есть NVIDIA-станции, плюс хорошо финансируемые AI-native стартапы. Обычным небольшим фирмам такая покупка вряд ли окупится. Судя по позиционированию, система интересна в первую очередь финансам, юриспруденции, здравоохранению, госсектору, обороне и инженерным командам, работающим с чувствительной интеллектуальной собственностью.

Как устроена локальная система

Всё необходимое поставляется одним пакетом: локальная модель, инференс-движок, агентский харнесс, песочница для инструментов и коннекторы приложений. Пользователь выбирает между Qwen 3.8 27B и PPLX 27B — второй вариант представляет собой дообученную модель от самой Perplexity. Скоро обещают добавить открытую модель NVIDIA Nemotron 3.5 Lightning с архитектурой MoE на 30 млрд параметров. Если хочется использовать что-то своё, поддерживаются BYO-модель и собственный инференс-сервер.

Код и вызовы инструментов выполняются внутри песочницы, которую контролирует операционная система. Она жёстко ограничивает процессы, доступ к путям файловой системы и сетевые соединения. Если песочница вдруг недоступна, исполнение инструментов просто отключается — без тихого перехода в небезопасный режим.

Интеграции с Gmail, Outlook, Slack и GitHub маршрутизируются через локальный оркестратор. Чтобы модель не тонула в контексте, разработчики применили несколько трюков: системный промпт и набор инструментов держат небольшими, специализированные навыки подгружаются по требованию, а коннекторы оформлены как компактные CLI-утилиты, а не полные MCP-определения. По ходу длинного запуска устаревший контекст уплотняется. Это важно, ведь у Qwen заявлено окно 260K токенов, но на практике деградация начинается примерно после 100K.

Когда задача уходит в облако

Локальные шаги не тарифицируются за токены — плата возникает только за облачные операции. Каждая задача стартует на устройстве. Если агенту нужен прямой доступ к вебу или по-настоящему сложные рассуждения, оркестратор останавливается и спрашивает пользователя, можно ли отправить этот единственный шаг наружу. На выбор доступно более 15 облачных моделей.

Перед отправкой харнесс отбирает только релевантный контекст, прогоняет его через PII-классификатор и показывает, какие именно данные покинут машину. Облачный советник получает одобренный шаг и возвращает текстовые указания. Прямого доступа к локальным файлам, инструментам или истории диалога у него нет. Получается гибридная схема: приватная часть остаётся на устройстве, а тяжёлые вычисления делегируются наружу точечно и под контролем владельца.

Результаты в бенчмарках

Perplexity приводит собственные замеры на наборе Local Knowledge Work Bench из 53 задач компьютерного агента. С моделью Qwen 3.8 27B на NVIDIA DGX Spark локальная сборка набрала 82,6%. Для сравнения: открытый харнесс Pi показал 77,6%, а Hermes на той же модели — 74,0%. Замена модели на PPLX 27B поднимает результат до 85,4%.

На тесте BrowseComp агентная платформа получила 66,7% против 50,2% у Pi и 43,9% у Hermes. При этом она потратила на 51% меньше времени и на 70% меньше токенов, чем Pi. Ещё более заметный разрыв — на тесте ParseBench-100 для визуального понимания документов: 65,1% против 34,6% и 13,9% соответственно.

На Terminal Bench 2.1 полностью локальный прогон дал 59,6% при практически нулевых маржинальных затратах. Если подключать облачного советника, результат вырастает до 73,0%, а стоимость одного rollout составляет около $0,415. Для ориентира: отдельная модель Claude Opus 5 на том же тесте получает 82,4%, но стоит примерно $0,65 за прогон. Эскалация заметно сокращает разрыв с сильнейшими моделями, но полностью его не закрывает. Зато локальный режим остаётся почти бесплатным.

Технические требования и доступность

Для установки на NVIDIA DGX Spark нужен суперчип GB10, 128 ГБ памяти и минимум 1 ТБ хранилища. Оркестратор на базе Qwen 3.8 27B поставляется в 3-битной квантизации: загрузка 17,4 ГБ, требуется 32 ГБ RAM. Версия с NVIDIA Nemotron 3.5 Lightning — 4-битная, занимает 19 ГБ и требует 36 ГБ RAM. На других системах можно использовать DGX OS или Ubuntu на ARM или x64 с видеокартой RTX и минимум 24 ГБ видеопамяти. Установка выполняется через стандартный apt-репозиторий.

На старте система доступна Linux-first для подписчиков Pro, Max, Enterprise Pro и Enterprise Max. Windows-версия ожидается в сентябре, а macOS в дорожной карте пока нет. Важный нюанс: при запуске поддерживается только один DGX Spark, кластеризация нескольких устройств запланирована на будущее.

По сути, это попытка создать приватную агентную среду, которая не требует постоянного подключения к интернету и не платит за каждый локальный вызов, но при этом умеет подключать мощные облачные модели тогда, когда это действительно оправдано.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Perplexity Portable Computer на NVIDIA DGX Spark — обзор