El presupuesto que siempre se destina a los fotogramas recientes
Un agente GUI de larga vida está diseñado como una criatura con mala memoria para las imágenes. La historia textual de acciones puede arrastrarla consigo casi indefinidamente: la sumarización pesa poco. Pero las capturas de pantalla son caras: en la ventana activa del modelo solo cabe un puñado de imágenes. De ahí surge la tarea que los autores llaman budgeted fidelity restoration. Cada evento permanece como una descripción comprimida, pero un presupuesto fijo B decide qué eventos concretos recuperarán sus píxeles archivados.
La variante básica Recent-B responde a esta cuestión de la forma más simple: todos los espacios visuales se asignan a los eventos más recientes. La lógica de «cuanto más reciente, más útil» parece natural, pero tiene un punto ciego: no comprueba en absoluto si la pantalla reciente es realmente más importante que la de veinte pasos atrás. A veces el usuario se marcha a otra ventana, configura algo allí, vuelve, y lo más necesario para la siguiente acción se ha quedado muy atrás en la historia.

Otro principio de selección
CausalCache es el método descrito en el trabajo arXiv:2608.22577 (Jiaxuan Luo, Zhanfeng Liao, Jiayao Teng, Yuan Wang; v1 del 23 de agosto de 2026, actualización v2 del 25 de agosto, nueve páginas y cuatro figuras). En lugar de la regla «a los últimos, todo», evalúa la historia en su conjunto y sustituye un evento más antiguo justo cuando su utilidad prevista supera la utilidad del candidato reciente. La pregunta no se plantea como «qué acaba de ocurrir», sino como «qué resultará útil en el siguiente paso».
Un adaptador que sabe cuál es su lugar
La segunda mitad de la construcción es un adaptador key/value con compuerta de historial (history-gated). Solo toca los tokens de las imágenes históricas restauradas y se desactiva por completo cuando no hay ninguna de esas imágenes en el contexto. Este es un detalle importante: el procesamiento de la pantalla actual no se degrada porque el sistema, en principio, sepa recuperar fotogramas antiguos.
El selector y el adaptador se entrenan con intervenciones de presupuesto emparejado —matched-budget interventions— sobre trayectorias de escritorio, y luego se prueban zero-shot en móviles, es decir, sin ningún ajuste adicional para la nueva plataforma.

Qué mostraron las mediciones
Escritorio: hay ganancia, pero no de inmediato
En OSWorld-Verified, la inclusión de capturas históricas eleva la tasa de éxito en unos 13 puntos porcentuales en comparación con una memoria que solo contiene sumarizaciones textuales. Suena impresionante, pero luego empiezan los matices.
Con el límite oficial de 15 pasos, CausalCache y el simple Recent-4 son estadísticamente indistinguibles. Es decir, en episodios cortos todo el esfuerzo no compensa: allí la historia simplemente no llega a acumular nada valioso, y la selección ávida de novedad funciona igual de bien. En cambio, en el diagnóstico de 30 pasos aparece la diferencia: 46,7% frente a 42,4%, un incremento de 4,3 puntos.
Móviles: transferencia sin reentrenamiento
El zero-shot en 117 tareas de MobileWorld da 36,8% frente a 30,2% de Recent-4. El método, entrenado con trayectorias de escritorio, también gana en el teléfono: este es precisamente el resultado que indica que no se trata de un ajuste a una interfaz concreta.
Más interesante es dónde se concentra exactamente la ganancia. Está concentrada en el split predefinido cross-app memory-candidate: 30,6% frente a 19,4%, es decir, +11,2 puntos. En los controles single-app no se encontró diferencia alguna: 43,6% frente a 42,4%. El panorama encaja: la ventaja se manifiesta allí donde la tarea exige recordar el estado de una aplicación mientras se actúa en otra.

Qué se deduce de esto
La formulación de los autores es la siguiente: elegir a qué eventos pasados devolver los píxeles es más eficaz que gastar por completo un presupuesto visual fijo en la recencia. Es difícil discutirlo después de que la ganancia se concentrara precisamente en las tareas con cambio entre aplicaciones.
Pero una interpretación honesta exige dos matices. Primero: en horizontes cortos no hay diferencia, lo que significa que el método no es una mejora gratuita, sino una apuesta por episodios largos, donde la historia acumulada tiene sentido en general. Segundo: de la diferencia nula en los controles single-app se deduce que la selección por utilidad no es universal: resuelve una clase concreta de problemas, en los que el agente necesita devolver al contexto una pantalla que se fue hace mucho tiempo.
La conclusión práctica para quienes construyen agentes: la recencia es un criterio cómodo, pero no el único. En cuanto el presupuesto de imágenes se convierte en un cuello de botella, tiene sentido preguntarse qué es exactamente lo que se pone en él: los últimos fotogramas por inercia o los que realmente resultarán útiles en el siguiente paso.



