Почему экран обманывает
Представьте, что агент работает с настольным приложением. Он видит окно с несколькими полями и кнопкой «Сохранить». С точки зрения скриншота это один и тот же экран, но на самом деле форма может быть пустой, частично заполненной или уже отправленной — и только скрытая логика операционной системы знает, какой сценарий выполняется сейчас. Такая ситуация называется частичной наблюдаемостью: агенту доступны лишь внешние проявления, а не истинное состояние системы.
Опасность в том, что локально правдоподобное действие — например, клик по кнопке — в одном случае завершит сценарий, в другом вызовет ошибку валидации, а в третьем просто проигнорируется. Визуально похожие экраны могут принадлежать разным веткам рабочего процесса, и это приводит к существенно разным исходам. Поэтому эффективное поведение требует не только распознавания объектов интерфейса, но и активного исследования: нужно определить, какие состояния вообще достижимы, и снять неоднозначность, прежде чем принимать решение.

Именно этой задаче посвящена работа «ScreenSearch: Uncertainty-Aware OS Exploration» (arXiv:2605.16024), авторы которой — Майкл Солодко и Джастин Вейгл. Они формулируют проблему как исследование состояний компьютера: агент должен балансировать между расширением достижимого фронта и уменьшением неопределённости.
Подход: граф состояний и бандит
Вместо того чтобы полагаться на одиночные скриншоты, предложенная система ScreenSearch строит общий граф дедуплицированных состояний. Для этого она использует структурный поиск: UIA-деревья превращаются в признаки с учётом расположения элементов, а связанные экраны индексируются через разреженный токенный поиск и фильтры метаданных. Граф состояний поддерживается между несколькими виртуальными машинами, что позволяет масштабировать исследование.
Стратегию выбора следующего действия задаёт PUCT-графовый бандит, который учитывает неоднозначность состояний. Это означает, что агент отдаёт предпочтение не только перспективным с точки зрения новизны переходам, но и тем, которые уменьшают неопределённость. По сути, система одновременно исследует пространство состояний и уточняет свои знания о нём.
Как измерить неоднозначность
Ключевой вклад работы — масштабируемый сигнал неоднозначности. Он основан на простом наблюдении: если визуально похожие экраны при одинаковой сигнатуре действия приводят к разным следующим состояниям, значит, текущее состояние недостаточно изучено. Дисперсия исходов становится индикатором того, что агент ещё не понял, как устроен этот участок рабочего процесса.
Этот сигнал соединяется с наградами за расширение фронта исследования. В результате появляется возможность оценивать политики на общем графе через replay-start: политику прогоняют с фиксированного набора стартовых состояний и смотрят, как она справляется с задачами. Важно, что одни политики могут быстро снижать неоднозначность, но почти не открывать новых состояний, а другие — исследовать активно, но не успевать «дожимать» непонятные ситуации. Поэтому авторы подчёркивают: простое уменьшение неоднозначности не является достаточной целью.
Эксперименты: разнообразие и компромиссы
Для проверки подхода были задействованы 11 десктопных приложений. В ходе экспериментов собрано более миллиона скриншотов и более 30 тысяч уникальных состояний. Полученные корпусы отличаются значительным разнообразием как между приложениями, так и внутри каждого из них — это позволяет тестировать агентов в реалистичных условиях.
На фиксированном replay-start срезе чётко виден компромисс между новизной и неоднозначностью. Некоторые стратегии почти сразу снижают уровень неопределённости, но при этом редко находят новые состояния. Другие, наоборот, быстро расширяют границы известного, но оставляют множество «серых зон». Авторы делают вывод, что цель исследования должна быть комплексной.

Дополнительные абляции показали интересный эффект: усиление предложений (proposal priors) заметно улучшает обнаружение уникальных состояний при построении корпуса. Иными словами, от того, насколько хорошие варианты действий предлагаются агенту, напрямую зависит полнота собранного графа состояний.
Итоги
Исследование ScreenSearch подтверждает, что для надёжной работы агента в операционной системе недостаточно хорошо распознавать элементы интерфейса. Важнее понимать идентичность состояния, генерировать качественные предложения действий и уметь искать с учётом неоднозначности. Именно эти три фактора определяют, когда стоит продолжать исследование, а когда можно зафиксировать результат.
Авторы представили 22-страничную статью с 8 рисунками и 21 таблицей, где подробно описан как сам метод, так и эксперименты. Это хорошая основа для дальнейших работ в области надёжных GUI-агентов.



