Frescor versus utilidade: CausalCache revisa as regras de seleção de capturas de tela na memória de agentes GUI

14 setembro 202611 visualizações

Em vez de distribuir todos os espaços visuais para as últimas ações, o método avalia todo o histórico e devolve quadros arquivados aos eventos em que eles renderão mais. No OSWorld-Verified, a inclusão de capturas de tela antigas acrescenta cerca de 13 p.p. à taxa de sucesso em relação à memória baseada apenas em sumarizações, e a transferência zero-shot para o MobileWorld eleva o resultado de 30,2% para 36,8%.

Frescor versus utilidade: CausalCache revisa as regras de seleção de capturas de tela na memória de agentes GUI

Orçamento que sempre vai para capturas recentes

Um agente GUI de longa duração é como uma criatura com má memória para imagens. O histórico textual de ações ele consegue carregar quase indefinidamente — a sumarização pesa pouco. Já as capturas de tela são caras: na janela ativa do modelo cabem apenas algumas imagens. Daí surge o problema que os autores chamam de budgeted fidelity restoration. Cada evento permanece como uma descrição comprimida, mas um orçamento fixo B decide quais eventos receberão de volta seus pixels arquivados.

A variante básica Recent-B responde a essa questão da forma mais simples: todos os slots visuais são entregues aos eventos mais recentes. A lógica de "quanto mais recente, mais útil" parece natural, mas tem um ponto cego — ela não verifica se a tela recente é de fato mais importante do que aquela de vinte passos atrás. Às vezes o usuário foi para outra janela, configurou algo por lá, voltou — e o que era mais necessário para a próxima ação ficou lá longe no histórico.

Outro princípio de seleção

CausalCache — método descrito no trabalho arXiv:2608.22577 (Jiaxuan Luo, Zhanfeng Liao, Jiayao Teng, Yuan Wang; v1 de 23 de agosto de 2026, atualização v2 de 25 de agosto, nove páginas e quatro figuras). Em vez da regra "aos últimos, tudo", ele avalia o histórico por inteiro e substitui por um evento mais antigo exatamente quando sua utilidade prevista supera a utilidade do candidato recente. A questão não é colocada como "o que aconteceu agora há pouco", mas como "o que será útil no próximo passo".

Um adaptador que sabe seu lugar

A segunda metade da construção é o adaptador history-gated key/value. Ele mexe apenas nos tokens das imagens históricas restauradas e se desliga completamente quando não há nenhuma dessas imagens no contexto. Esse é um detalhe importante: o processamento da tela atual não se degrada pelo fato de o sistema, em princípio, saber recuperar capturas antigas.

O seletor e o adaptador são treinados com intervenções sob orçamento consistente — matched-budget interventions — em trajetórias de desktop, e depois testados zero-shot em dispositivos móveis, ou seja, sem qualquer ajuste fino para a nova plataforma.

O que as medições mostraram

Desktop: há ganho, mas não de imediato

No OSWorld-Verified, a inclusão de capturas históricas eleva a taxa de sucesso em cerca de 13 pontos percentuais em comparação com uma memória que contém apenas sumarizações textuais. Parece impressionante, mas aí começam os nuances.

Com o limite oficial de 15 passos, CausalCache e o simples Recent-4 são estatisticamente indistinguíveis. Ou seja, em episódios curtos todo o esforço não compensa: ali o histórico simplesmente não chega a acumular algo valioso, e a seleção ávida por novidade funciona igualmente bem. Já no diagnóstico com 30 passos surge a diferença — 46,7% contra 42,4%, um ganho de 4,3 pontos.

Móveis: transferência sem retreinamento

O zero-shot em 117 tarefas do MobileWorld dá 36,8% contra 30,2% do Recent-4. O método, treinado em trajetórias de desktop, também vence no celular — e é justamente esse o resultado que mostra que não se trata de ajuste a uma interface específica.

Mais interessante é onde exatamente se concentra o ganho. Ele está no split previamente definido cross-app memory-candidate: 30,6% contra 19,4%, ou seja, +11,2 pontos. Nos controles single-app não houve diferença alguma — 43,6% contra 42,4%. O quadro fecha: a vantagem se manifesta onde a tarefa exige lembrar o estado de um aplicativo enquanto se age em outro.

O que se conclui disso

A formulação dos autores é a seguinte: escolher a quais eventos passados devolver os pixels é mais eficaz do que gastar todo o orçamento visual fixo na recência. É difícil discordar disso depois que o ganho se concentrou justamente nas tarefas com alternância entre aplicativos.

Mas uma interpretação honesta exige duas ressalvas. A primeira: em horizontes curtos não há diferença, o que significa que o método não é uma melhoria gratuita, mas uma aposta em episódios longos, onde o histórico acumulado faz sentido. A segunda: da diferença nula nos controles single-app segue que a seleção por utilidade não é universal — ela resolve uma classe específica de problemas, em que o agente precisa trazer de volta ao contexto uma tela há muito deixada para trás.

Uma conclusão prática para quem constrói agentes: a recência é um critério conveniente, mas não o único. Assim que o orçamento de imagens se torna um gargalo, vale a pena perguntar o que exatamente você coloca nele — as últimas capturas por inércia ou aquelas que realmente serão úteis no próximo passo.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Frescor versus utilidade: CausalCache revisa as regras de seleção de capturas de tela na memória de agentes GUI