Orçamento que sempre vai para capturas recentes
Um agente GUI de longa duração é como uma criatura com má memória para imagens. O histórico textual de ações ele consegue carregar quase indefinidamente — a sumarização pesa pouco. Já as capturas de tela são caras: na janela ativa do modelo cabem apenas algumas imagens. Daí surge o problema que os autores chamam de budgeted fidelity restoration. Cada evento permanece como uma descrição comprimida, mas um orçamento fixo B decide quais eventos receberão de volta seus pixels arquivados.
A variante básica Recent-B responde a essa questão da forma mais simples: todos os slots visuais são entregues aos eventos mais recentes. A lógica de "quanto mais recente, mais útil" parece natural, mas tem um ponto cego — ela não verifica se a tela recente é de fato mais importante do que aquela de vinte passos atrás. Às vezes o usuário foi para outra janela, configurou algo por lá, voltou — e o que era mais necessário para a próxima ação ficou lá longe no histórico.

Outro princípio de seleção
CausalCache — método descrito no trabalho arXiv:2608.22577 (Jiaxuan Luo, Zhanfeng Liao, Jiayao Teng, Yuan Wang; v1 de 23 de agosto de 2026, atualização v2 de 25 de agosto, nove páginas e quatro figuras). Em vez da regra "aos últimos, tudo", ele avalia o histórico por inteiro e substitui por um evento mais antigo exatamente quando sua utilidade prevista supera a utilidade do candidato recente. A questão não é colocada como "o que aconteceu agora há pouco", mas como "o que será útil no próximo passo".
Um adaptador que sabe seu lugar
A segunda metade da construção é o adaptador history-gated key/value. Ele mexe apenas nos tokens das imagens históricas restauradas e se desliga completamente quando não há nenhuma dessas imagens no contexto. Esse é um detalhe importante: o processamento da tela atual não se degrada pelo fato de o sistema, em princípio, saber recuperar capturas antigas.
O seletor e o adaptador são treinados com intervenções sob orçamento consistente — matched-budget interventions — em trajetórias de desktop, e depois testados zero-shot em dispositivos móveis, ou seja, sem qualquer ajuste fino para a nova plataforma.

O que as medições mostraram
Desktop: há ganho, mas não de imediato
No OSWorld-Verified, a inclusão de capturas históricas eleva a taxa de sucesso em cerca de 13 pontos percentuais em comparação com uma memória que contém apenas sumarizações textuais. Parece impressionante, mas aí começam os nuances.
Com o limite oficial de 15 passos, CausalCache e o simples Recent-4 são estatisticamente indistinguíveis. Ou seja, em episódios curtos todo o esforço não compensa: ali o histórico simplesmente não chega a acumular algo valioso, e a seleção ávida por novidade funciona igualmente bem. Já no diagnóstico com 30 passos surge a diferença — 46,7% contra 42,4%, um ganho de 4,3 pontos.
Móveis: transferência sem retreinamento
O zero-shot em 117 tarefas do MobileWorld dá 36,8% contra 30,2% do Recent-4. O método, treinado em trajetórias de desktop, também vence no celular — e é justamente esse o resultado que mostra que não se trata de ajuste a uma interface específica.
Mais interessante é onde exatamente se concentra o ganho. Ele está no split previamente definido cross-app memory-candidate: 30,6% contra 19,4%, ou seja, +11,2 pontos. Nos controles single-app não houve diferença alguma — 43,6% contra 42,4%. O quadro fecha: a vantagem se manifesta onde a tarefa exige lembrar o estado de um aplicativo enquanto se age em outro.

O que se conclui disso
A formulação dos autores é a seguinte: escolher a quais eventos passados devolver os pixels é mais eficaz do que gastar todo o orçamento visual fixo na recência. É difícil discordar disso depois que o ganho se concentrou justamente nas tarefas com alternância entre aplicativos.
Mas uma interpretação honesta exige duas ressalvas. A primeira: em horizontes curtos não há diferença, o que significa que o método não é uma melhoria gratuita, mas uma aposta em episódios longos, onde o histórico acumulado faz sentido. A segunda: da diferença nula nos controles single-app segue que a seleção por utilidade não é universal — ela resolve uma classe específica de problemas, em que o agente precisa trazer de volta ao contexto uma tela há muito deixada para trás.
Uma conclusão prática para quem constrói agentes: a recência é um critério conveniente, mas não o único. Assim que o orçamento de imagens se torna um gargalo, vale a pena perguntar o que exatamente você coloca nele — as últimas capturas por inércia ou aquelas que realmente serão úteis no próximo passo.



