Cuando la pantalla engaña: ScreenSearch enseña a los agentes a manejar estados ambiguos del sistema operativo

6 septiembre 202619 vistas

El nuevo sistema ayuda a los agentes GUI de escritorio a distinguir pantallas similares, explorar nuevos estados y no tomar decisiones precipitadas. En experimentos con 11 aplicaciones, los autores recopilaron más de un millón de capturas de pantalla y más de 30 mil estados únicos.

Cuando la pantalla engaña: ScreenSearch enseña a los agentes a manejar estados ambiguos del sistema operativo

Por qué la pantalla engaña

Imagina que un agente trabaja con una aplicación de escritorio. Ve una ventana con varios campos y un botón «Guardar». Desde el punto de vista de una captura de pantalla, es la misma pantalla, pero en realidad el formulario puede estar vacío, parcialmente completado o ya enviado — y solo la lógica oculta del sistema operativo sabe qué escenario se está ejecutando en ese momento. Esta situación se denomina observabilidad parcial: el agente solo tiene acceso a las manifestaciones externas, no al verdadero estado del sistema.

El peligro es que una acción localmente plausible — por ejemplo, hacer clic en un botón — en un caso completará el escenario, en otro provocará un error de validación, y en un tercero simplemente se ignorará. Pantallas visualmente similares pueden pertenecer a distintas ramas del flujo de trabajo, y esto conduce a resultados sustancialmente diferentes. Por lo tanto, un comportamiento eficaz requiere no solo el reconocimiento de objetos de la interfaz, sino también una exploración activa: es necesario determinar qué estados son alcanzables en absoluto y resolver la ambigüedad antes de tomar una decisión.

Precisamente a esta tarea está dedicado el trabajo «ScreenSearch: Uncertainty-Aware OS Exploration» (arXiv:2605.16024), cuyos autores son Michael Solodko y Justin Weigle. Formulan el problema como la exploración de estados de una computadora: el agente debe equilibrar entre expandir el frente alcanzable y reducir la incertidumbre.

Enfoque: grafo de estados y bandido

En lugar de depender de capturas de pantalla individuales, el sistema propuesto ScreenSearch construye un grafo general de estados deduplicados. Para ello utiliza una búsqueda estructural: los árboles UIA se convierten en características teniendo en cuenta la disposición de los elementos, y las pantallas relacionadas se indexan mediante búsqueda dispersa por tokens y filtros de metadatos. El grafo de estados se mantiene entre varias máquinas virtuales, lo que permite escalar la exploración.

La estrategia para elegir la siguiente acción la define un bandido de grafo PUCT, que tiene en cuenta la ambigüedad de los estados. Esto significa que el agente prefiere no solo las transiciones prometedoras en términos de novedad, sino también aquellas que reducen la incertidumbre. En esencia, el sistema explora simultáneamente el espacio de estados y refina su conocimiento sobre él.

Cómo medir la ambigüedad

La contribución clave del trabajo es una señal de ambigüedad escalable. Se basa en una observación simple: si pantallas visualmente similares con la misma firma de acción conducen a diferentes estados siguientes, entonces el estado actual no está suficientemente estudiado. La varianza de los resultados se convierte en un indicador de que el agente aún no ha comprendido cómo está organizada esta parte del flujo de trabajo.

Esta señal se combina con recompensas por expandir el frente de exploración. Como resultado, surge la posibilidad de evaluar políticas en el grafo general mediante replay-start: se ejecuta la política desde un conjunto fijo de estados iniciales y se observa cómo maneja las tareas. Es importante que unas políticas puedan reducir rápidamente la ambigüedad, pero casi no descubrir nuevos estados, mientras que otras exploren activamente, pero no logren «rematar» situaciones poco claras. Por ello, los autores subrayan: la simple reducción de la ambigüedad no es un objetivo suficiente.

Experimentos: diversidad y compromisos

Para probar el enfoque se utilizaron 11 aplicaciones de escritorio. Durante los experimentos se recopilaron más de un millón de capturas de pantalla y más de 30 mil estados únicos. Los corpus obtenidos se distinguen por una diversidad significativa tanto entre aplicaciones como dentro de cada una de ellas — esto permite probar a los agentes en condiciones realistas.

En el corte fijo de replay-start se ve claramente el compromiso entre novedad y ambigüedad. Algunas estrategias reducen casi de inmediato el nivel de incertidumbre, pero rara vez encuentran nuevos estados. Otras, por el contrario, expanden rápidamente las fronteras de lo conocido, pero dejan muchas «zonas grises». Los autores concluyen que el objetivo de la exploración debe ser integral.

Ablaciones adicionales mostraron un efecto interesante: el refuerzo de las propuestas (proposal priors) mejora notablemente la detección de estados únicos al construir el corpus. En otras palabras, la completitud del grafo de estados recopilado depende directamente de la calidad de las opciones de acción que se ofrecen al agente.

Conclusiones

La investigación ScreenSearch confirma que para un funcionamiento fiable de un agente en un sistema operativo no basta con reconocer bien los elementos de la interfaz. Es más importante comprender la identidad del estado, generar propuestas de acción de calidad y saber buscar teniendo en cuenta la ambigüedad. Son precisamente estos tres factores los que determinan cuándo conviene continuar la exploración y cuándo se puede fijar el resultado.

Los autores presentaron un artículo de 22 páginas con 8 figuras y 21 tablas, donde se describen en detalle tanto el método en sí como los experimentos. Es una buena base para futuros trabajos en el ámbito de los agentes GUI fiables.

Preguntas frecuentes

Cuando la pantalla engaña: ScreenSearch enseña a los agentes a manejar estados ambiguos del sistema operativo