Escala e limites da avaliação
O sistema de apoio de um grande marketplace de alojamento processa milhões de diálogos por mês. Funciona em 11 idiomas e o P90 indicado é de 10 segundos. Estes indicadores descrevem a escala do sistema, mas não mostram o efeito de uma decisão arquitetural específica.
| Parâmetro | Valor |
|---|---|
| Volume | Milhões de diálogos por mês |
| Idiomas | 11 |
| P90 | 10 segundos |
Durante a migração, também foram alterados os prompts, o alinhamento e o serving. Por isso, os autores atribuem à arquitetura apenas os efeitos medidos em diálogos reproduzidos nas mesmas condições.
Critério de avaliação: comparar as arquiteturas com diálogos de entrada idênticos, em vez de lhes atribuir todas as alterações feitas após a migração.
Como são separados a pesquisa, as ações e a geração
O Dynamic Response (DR) substitui o respondedor misto Qwen3-235B-A22B por um orquestrador ReAct limitado, com ferramentas tipadas e um gerador mais pequeno. O gerador constrói a resposta com base num contrato de contexto validado pelo sistema backend.

| Parte do sistema | Função |
|---|---|
| Pesquisa | Seleção tipada de entidades, incluindo a seleção de reservas |
| Ações | IDs de ação tipados e validação da propriedade |
| Geração | Resposta baseada num contrato de contexto validado pelo sistema backend |
| Orquestração | Orquestrador ReAct limitado sobre ferramentas tipadas |
Esta separação distingue a seleção de entidades e ações da formulação da resposta. Critério de escolha: esta arquitetura é adequada quando o sistema precisa de operações verificáveis, e não apenas de um único gerador de respostas.
O que mudou na seleção de entidades e ações
A seleção tipada de entidades orientou o seletor de reservas para privilegiar a precisão. A precisão aumentou, enquanto a revocação diminuiu. A validação da propriedade dos IDs tipados eliminou os erros observados nas ações estruturadas.
| Métrica | Antes | Depois |
|---|---|---|
| Precisão da seleção de reservas | 8,3% | 89,1% |
| Revocação da seleção de reservas | 75,2% | 67,3% |
| Alucinações observadas em ações estruturadas | 2,14% | 0,0% |
Os resultados mostram uma compensação entre a precisão e a revocação da seleção. Critério de escolha: este modo é adequado quando é mais importante evitar uma seleção incorreta do que manter o nível de revocação anterior.
Como avaliar as escaladas e a resolução autónoma
Um teste A/B de baixo nível reproduziu na reprodução a redução das escaladas. Ainda assim, o volume de transferências para operadores em produção manteve-se aproximadamente estável.
| Indicador | Antes | Depois |
|---|---|---|
| Respostas com escalada obrigatória | 5,60% | 3,08% |
| Respostas com escalada opcional | 9,56% | 2,49% |
| Resolução autónoma | — | Tendência direcional: +5,1 p. p.; IC de 95%: de −2 a +12 |
A redução das escaladas não foi acompanhada por uma diminuição comparável do volume de transferências para operadores. Os autores caracterizam a resolução autónoma como um resultado direcional, e não como um aumento inequivocamente demonstrado.
Critério de avaliação: acompanhar separadamente as respostas com escalada, as transferências efetivas para operadores e a resolução autónoma.
O que a otimização do serving proporcionou
As otimizações do serving reduziram o P90 da latência do orquestrador de 3,87 para 2,24 segundos. Ao mesmo tempo, a pegada de GPU diminuiu cerca de um terço.
| Indicador | Alteração |
|---|---|
| P90 da latência do orquestrador | 3,87 → 2,24 segundos |
| Pegada de GPU | Redução de cerca de um terço |
| Custo anual estimado do serving dos modelos em self-hosting | Redução superior a uma ordem de grandeza |
Estes indicadores dizem respeito ao serving, não à qualidade da seleção de entidades ou ações. Critério de avaliação: considerar a latência, a pegada computacional e o custo do serving separadamente das métricas das respostas.



