Simulação para testar inferências causais sobre falhas na publicidade

29 setembro 202612 visualizações

No TRACE, as intervenções ocultas no simulador de publicidade digital permitem avaliar automaticamente se o agente identificou corretamente a origem da falha e o segmento afetado, embora para isso tenha de analisar dados ruidosos com Python e SQL. Após o treino por reforço com sinais sintéticos, o modelo Qwen3.5-35B-A3B obteve 0,757 no FullAttr@1 em 235 episódios de teste — acima de todas as variantes testadas com prompts e com menos chamadas de ferramentas do que o modelo de base.

Simulação para testar inferências causais sobre falhas na publicidade

O que a simulação avalia

TRACE é um ambiente de diagnóstico para publicidade digital. Abrange 12 causas-raiz e atribuição detalhada de segmentos. Em cada episódio, o agente explora os dados com Python e SQL. Em seguida, identifica a causa-raiz e, quando aplicável, o segmento afetado.

TRACE é descrita num trabalho de Rui Sun, Zhan Shi e Bing He, submetido ao arXiv em 9 de setembro de 2026. O identificador do trabalho é arXiv:2609.10315.

Como a avaliação é estruturada

A avaliação é estruturada em torno de uma intervenção e das observações que ela provoca:

  • Seleciona-se uma intervenção e introduz-se num simulador controlado.
  • O simulador gera as observações correspondentes.
  • O agente explora os dados e procura a causa da falha.
  • A intervenção oculta serve de rótulo de referência e permite calcular uma recompensa objetiva.

O agente não recebe uma explicação pronta. Tem de relacionar evidências ruidosas, combinadas e distribuídas pelos dados. Assim, a simulação avalia a inferência causal, e não apenas o reconhecimento de uma resposta predefinida.

Como interpretar os resultados

Os autores avaliaram os modelos num conjunto de teste reservado com 235 episódios. O melhor baseline de prompting foi o Claude Opus 5, com um resultado de 0.686 FullAttr@1.

Modelo ou etapaResultado
Qwen3.5-35B-A3B após fine-tuning supervisionado0.159 → 0.637
O mesmo modelo após RL com recompensas sintetizadas0.757
Qwen3.5-122B-A10B no baseline de promptingAbaixo do resultado de 0.757

O resultado de 0.757 superou todos os baselines de prompting avaliados, incluindo modelos de fronteira de código fechado. Os autores também relatam que a policy resultante utilizou substancialmente menos chamadas de ferramentas do que a versão de prompting do modelo base de 35B.

O que os resultados mostram sobre o treino de agentes

Os autores consideram que o acesso a um sinal de treino objetivo e escalável pode ser uma limitação mais importante do que apenas a dimensão do modelo. Esta conclusão diz respeito aos resultados da tarefa descrita, não é uma regra universal para todos os sistemas de IA.

Uma avaliação por simulação pode tornar tarefas ambíguas de raciocínio diagnóstico adequadas ao treino por reforço escalável. A condição fundamental é ser possível comparar a conclusão do agente com a intervenção oculta e calcular uma recompensa objetiva.

Quando esta abordagem é adequada

A simulação é adequada para avaliar inferências causais se o problema permitir:

  • definir uma intervenção e introduzi-la num ambiente controlado;
  • gerar observações relacionadas com ela;
  • manter a intervenção como um rótulo de referência oculto;
  • avaliar tanto a causa-raiz como o segmento afetado, quando aplicável.

Se a tarefa não permitir este tipo de comparação com um rótulo de referência, o mecanismo de recompensa objetiva descrito não fica assegurado. O critério prático de escolha é saber se é possível verificar a conclusão do agente com base na causa oculta, sem a revelar durante a análise.

Perguntas mais frequentes

Simulação para testar inferências causais sobre falhas na publicidade