Свежесть против пользы: CausalCache пересматривает правила отбора скриншотов в памяти GUI-агентов

14 сентября 202611 просмотров

Вместо того чтобы раздавать все визуальные слоты последним действиям, метод оценивает всю историю и возвращает архивные кадры тем событиям, где они дадут больше отдачи. На OSWorld-Verified включение старых скриншотов добавляет около 13 п.п. к успешности относительно памяти из одних суммаризаций, а zero-shot перенос на MobileWorld поднимает результат с 30,2% до 36,8%.

Свежесть против пользы: CausalCache пересматривает правила отбора скриншотов в памяти GUI-агентов

Бюджет, который всегда уходит на свежие кадры

Долгоживущий GUI-агент устроен как существо с плохой памятью на картинки. Текстовую историю действий он может тащить за собой почти бесконечно — суммаризация весит мало. А вот скриншоты дороги: в активное окно модели помещается лишь горстка изображений. Отсюда задача, которую авторы называют budgeted fidelity restoration. Каждое событие остаётся в виде сжатого описания, но фиксированный бюджет B решает, какие именно события снова получат обратно свои архивные пиксели.

Базовый вариант Recent-B отвечает на этот вопрос простейшим способом: все визуальные слоты отдаются последним событиям. Логика «чем свежее, тем полезнее» выглядит естественной, но у неё есть слепое пятно — она вообще не проверяет, правда ли недавний экран важнее того, что был двадцать шагов назад. Иногда пользователь ушёл в другое окно, что-то там настроил, вернулся — и самое нужное для следующего действия осталось далеко в истории.

Другой принцип отбора

CausalCache — метод, описанный в работе arXiv:2608.22577 (Jiaxuan Luo, Zhanfeng Liao, Jiayao Teng, Yuan Wang; v1 от 23 августа 2026 года, обновление v2 от 25 августа, девять страниц и четыре рисунка). Вместо правила «последним — всё» он оценивает историю целиком и подставляет более старое событие ровно тогда, когда его предсказанная полезность перевешивает полезность недавнего кандидата. Вопрос ставится не как «что произошло только что», а как «что пригодится на следующем шаге».

Адаптер, который знает своё место

Вторая половина конструкции — history-gated key/value адаптер. Он трогает только токены восстановленных исторических изображений и полностью выключается, когда ни одного такого изображения в контексте нет. Это важная деталь: обработка текущего экрана не деградирует из-за того, что система в принципе умеет доставать старые кадры.

Селектор и адаптер обучают с вмешательствами при согласованном бюджете — matched-budget interventions — на десктопных траекториях, а затем проверяют zero-shot на мобильных, то есть без какой-либо донастройки под новую платформу.

Что показали замеры

Десктоп: выигрыш есть, но не сразу

На OSWorld-Verified включение исторических скриншотов поднимает успешность примерно на 13 процентных пунктов по сравнению с памятью, где есть только текстовые суммаризации. Звучит внушительно, но дальше начинаются нюансы.

При официальном лимите в 15 шагов CausalCache и простой Recent-4 статистически неразличимы. То есть на коротких эпизодах вся затея не окупается: там история просто не успевает накопить что-то ценное, и жадный до новизны отбор работает не хуже. Зато в диагностике на 30 шагов разрыв появляется — 46,7% против 42,4%, прирост 4,3 пункта.

Мобильные: перенос без переобучения

Zero-shot на 117 задачах MobileWorld даёт 36,8% против 30,2% у Recent-4. Метод, тренированный на десктопных траекториях, выигрывает и на телефоне — это как раз тот результат, который говорит, что дело не в подгонке под конкретный интерфейс.

Интереснее, где именно оседает прирост. Он сконцентрирован на заранее определённом сплите cross-app memory-candidate: 30,6% против 19,4%, то есть +11,2 пункта. В контролях single-app разницы не нашлось вовсе — 43,6% против 42,4%. Картина сходится: преимущество проявляется там, где задача требует вспомнить состояние одного приложения, действуя в другом.

Что из этого следует

Формулировка авторов звучит так: выбирать, каким прошлым событиям вернуть пиксели, эффективнее, чем целиком тратить фиксированный визуальный бюджет на недавность. С этим трудно спорить после того, как прирост оказался сосредоточен именно в задачах с переключением между приложениями.

Но честная интерпретация требует двух оговорок. Первая: на коротких горизонтах разницы нет, а значит метод — не бесплатное улучшение, а ставка на длинные эпизоды, где накопленная история вообще имеет смысл. Вторая: из нулевой разницы в single-app контролях следует, что отбор по полезности не универсален — он решает конкретный класс проблем, где агенту нужно вернуть в контекст давно ушедший экран.

Практический вывод для тех, кто строит агентов: свежесть — удобный, но не единственный критерий. Как только бюджет изображений становится узким местом, имеет смысл спросить, что именно вы в него кладёте — последние кадры по инерции или те, которые действительно пригодятся на следующем шаге.

Часто задаваемые вопросы

Похожие материалы

Все материалы
CausalCache — обзор метода памяти GUI-агентов