Uma tarefa longa de um agente de código não é um único pedido, mas dezenas: chamadas ao modelo, acessos a ferramentas, edições de ficheiros, execuções repetidas de testes. E quase em cada uma dessas execuções surge o pensamento: e se eu trocasse de modelo agora mesmo?
Porque é que a troca a meio parece vantajosa
A economia aqui é simples. Um modelo forte é mais caro por token, mas raciocina melhor. Um modelo fraco é mais barato, mas atola-se no que é complexo. Daí decorrem duas manobras naturais:
- Escalada — quando o modelo barato fica preso, ligamos o caro e potente.
- Despromoção de nível — quando a parte difícil já passou, voltamos ao barato para não pagar a mais pela rotina.
No papel, o percurso híbrido parece ideal: o modelo caro só é pago onde é realmente necessário. Mas o agente transmite ao modelo seguinte não apenas os ficheiros e o estado do repositório. Transmite o histórico: a cadeia de raciocínio, o resultado das ferramentas, as tentativas falhadas, as decisões intermédias. A parte recetora continua a trajetória que outra modelo construiu — com outro estilo, outro grau de detalhe, outros hábitos. É precisamente este momento que os autores do preprint «The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents» (arXiv:2608.24358, 25 de agosto de 2026) analisam.

Como está estruturada a experiência
O trabalho baseia-se em pares de modelos: baratos e menos capazes (no texto do artigo — LC, low cost) contra caros e mais fortes (HC, high cost). Os pares foram retirados de duas famílias — Claude e GPT, ou seja, a verificação foi feita não num único fornecedor, mas em dois ao mesmo tempo, o que aumenta consideravelmente o valor das conclusões.
Foram alteradas três coisas:
- A direção da transferência — para cima, para um modelo mais forte, e para baixo, para um mais fraco.
- O momento da troca dentro de uma tarefa longa.
- O formato de transferência do contexto — aquilo a que os autores chamam interface.
O último ponto é o mais interessante. Foram comparadas três variantes: transferência completa de toda a trajetória, compactação (um resumo condensado do histórico) e remoção da trajetória mantendo apenas o estado do repositório. Por outras palavras, a questão era esta: quanto do «pensamento» alheio vale a pena mostrar ao novo modelo?

Resultado principal: o imposto sobre a transferência
A conclusão revelou-se sóbria. Na escalada, a transferência completa do histórico fecha menos de metade da diferença de qualidade entre o modelo fraco e o forte — e é acompanhada por um acréscimo sensível ao custo. Ou seja, paga-se pela tarifa do modelo caro, mas obtém-se apenas parte da sua vantagem. A diferença foi o que os autores chamaram handoff tax — o imposto pela passagem de testemunho.
E não é um artefacto de um único fornecedor: o quadro repetiu-se em ambas as famílias. A explicação lógica é que o modelo forte gasta contexto a decifrar o labirinto alheio, adota parcialmente pressupostos errados do antecessor e arranca não de uma folha em branco, mas com um fardo. Parte das suas capacidades é gasta a «ler o diário alheio» em vez de resolver a tarefa.
Assimetria: para baixo — sim, para cima — com reservas
A observação mais útil é que o imposto não é simétrico. A despromoção de nível, pelo contrário, deu um ponto vantajoso na relação preço-qualidade: a troca para o modelo barato depois de concluído o raciocínio complexo funciona.
Ainda mais interessante é que o formato preferível de transferência de contexto se inverte consoante a direção:
- Na escalada, ajuda mais a redução da informação sobre a trajetória do modelo fraco. Menos lixo — arranque mais limpo.
- Na despromoção, a remoção da trajetória do modelo forte reduz a qualidade. Aqui o histórico funciona como apoio e vale a pena conservá-lo.
A explicação impõe-se: atrás do modelo fraco fica um rasto de becos sem saída, e ao forte isso só o atrapalha. Já atrás do forte fica um plano bem definido e decisões corretas, pelas quais o fraco pode seguir como sobre carris. Isto já é a minha interpretação, e não uma conclusão literal do artigo, mas alinha-se bem com os números.
O que fazer na prática
As conclusões práticas são as seguintes:
- Troque menos vezes do que lhe apetece. Cada troca não é uma operação gratuita, mas um negócio com preço desconhecido.
- Escale na fronteira, não «quando ficou preso». Um bom ponto é um ciclo concluído com uma falha clara (por exemplo, testes que falham de forma consistente), e não o meio de um raciocínio.
- Para cima — comprima, para baixo — conserve. Antes de transferir para o modelo forte, prepare um resumo compacto: o que já foi feito, o que não funcionou, que restrições existem. Não vale a pena deixar a transcrição completa das tentativas.
- Para baixo pode dar com generosidade. Ao modelo fraco é útil ver o plano e as edições deixadas pelo forte.
- Calcule o seu imposto. A diferença entre «histórico completo» e «compactação» na escalada é um teste A/B pronto a usar, que vale a pena correr nas suas próprias tarefas: é barato e mostra rapidamente se está a pagar o imposto ou não.
Uma ideia à parte: por vezes é mais barato não mudar de modelo a meio. Se o forte só é necessário para o planeamento, é mais lógico separar os papéis desde o início — plano do forte, execução do fraco — do que organizar uma passagem de testemunho dentro de uma mesma trajetória.

Conclusão
Mudar de modelo a meio de uma tarefa não é uma alavanca gratuita de otimização do orçamento, mas uma operação com um custo próprio. A transferência de uma trajetória alheia consome parte da vantagem pela qual se paga. A escalada, nesse sentido, é mais arriscada do que parece; a despromoção de nível, pelo contrário, funciona de forma previsível. E o principal truque prático não está na escolha do modelo, mas na escolha daquilo que exatamente se mostra a esse modelo. Os resultados foram obtidos em agentes de código e em pares concretos de modelos, pelo que não vale a pena transponi-los tal e qual para todos os cenários — mas como hipótese de trabalho para as suas próprias medições, servem perfeitamente.



