Arquitetura de suporte com milhões de diálogos: separação entre pesquisa, ações e geração

26 setembro 202611 visualizações

Usando um serviço de reserva de alojamento como exemplo, os autores analisam a transição de um modelo único para um orquestrador limitado de operações tipadas e um gerador baseado em contexto verificado; os efeitos da arquitetura são avaliados separadamente das alterações concomitantes. Em diálogos reproduzidos, aumentou a precisão na escolha das reservas, desapareceram os erros nas ações estruturadas e diminuíram as escaladas; a otimização também reduziu a latência e os custos de manutenção do modelo, enquanto o volume de transferências de diálogos para operadores em produção não se alterou significativamente.

Arquitetura de suporte com milhões de diálogos: separação entre pesquisa, ações e geração

Escala e limites da avaliação

O sistema de apoio de um grande marketplace de alojamento processa milhões de diálogos por mês. Funciona em 11 idiomas e o P90 indicado é de 10 segundos. Estes indicadores descrevem a escala do sistema, mas não mostram o efeito de uma decisão arquitetural específica.

ParâmetroValor
VolumeMilhões de diálogos por mês
Idiomas11
P9010 segundos

Durante a migração, também foram alterados os prompts, o alinhamento e o serving. Por isso, os autores atribuem à arquitetura apenas os efeitos medidos em diálogos reproduzidos nas mesmas condições.

Critério de avaliação: comparar as arquiteturas com diálogos de entrada idênticos, em vez de lhes atribuir todas as alterações feitas após a migração.

Como são separados a pesquisa, as ações e a geração

O Dynamic Response (DR) substitui o respondedor misto Qwen3-235B-A22B por um orquestrador ReAct limitado, com ferramentas tipadas e um gerador mais pequeno. O gerador constrói a resposta com base num contrato de contexto validado pelo sistema backend.

Parte do sistemaFunção
PesquisaSeleção tipada de entidades, incluindo a seleção de reservas
AçõesIDs de ação tipados e validação da propriedade
GeraçãoResposta baseada num contrato de contexto validado pelo sistema backend
OrquestraçãoOrquestrador ReAct limitado sobre ferramentas tipadas

Esta separação distingue a seleção de entidades e ações da formulação da resposta. Critério de escolha: esta arquitetura é adequada quando o sistema precisa de operações verificáveis, e não apenas de um único gerador de respostas.

O que mudou na seleção de entidades e ações

A seleção tipada de entidades orientou o seletor de reservas para privilegiar a precisão. A precisão aumentou, enquanto a revocação diminuiu. A validação da propriedade dos IDs tipados eliminou os erros observados nas ações estruturadas.

MétricaAntesDepois
Precisão da seleção de reservas8,3%89,1%
Revocação da seleção de reservas75,2%67,3%
Alucinações observadas em ações estruturadas2,14%0,0%

Os resultados mostram uma compensação entre a precisão e a revocação da seleção. Critério de escolha: este modo é adequado quando é mais importante evitar uma seleção incorreta do que manter o nível de revocação anterior.

Como avaliar as escaladas e a resolução autónoma

Um teste A/B de baixo nível reproduziu na reprodução a redução das escaladas. Ainda assim, o volume de transferências para operadores em produção manteve-se aproximadamente estável.

IndicadorAntesDepois
Respostas com escalada obrigatória5,60%3,08%
Respostas com escalada opcional9,56%2,49%
Resolução autónoma—Tendência direcional: +5,1 p. p.; IC de 95%: de −2 a +12

A redução das escaladas não foi acompanhada por uma diminuição comparável do volume de transferências para operadores. Os autores caracterizam a resolução autónoma como um resultado direcional, e não como um aumento inequivocamente demonstrado.

Critério de avaliação: acompanhar separadamente as respostas com escalada, as transferências efetivas para operadores e a resolução autónoma.

O que a otimização do serving proporcionou

As otimizações do serving reduziram o P90 da latência do orquestrador de 3,87 para 2,24 segundos. Ao mesmo tempo, a pegada de GPU diminuiu cerca de um terço.

IndicadorAlteração
P90 da latência do orquestrador3,87 → 2,24 segundos
Pegada de GPURedução de cerca de um terço
Custo anual estimado do serving dos modelos em self-hostingRedução superior a uma ordem de grandeza

Estes indicadores dizem respeito ao serving, não à qualidade da seleção de entidades ou ações. Critério de avaliação: considerar a latência, a pegada computacional e o custo do serving separadamente das métricas das respostas.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Arquitetura de suporte com milhões de diálogos: separação entre pesquisa, ações e geração