Avaliação de agentes de IA sem acesso aos seus mecanismos internos

28 setembro 202611 visualizações

O artigo descreve um método de avaliação de sistemas autónomos em sete categorias de ameaças: o gerador SAGE-RT cria 120 cenários de ataque para cada uma delas. Os testes do CrewAI e do AutoGen revelaram elevados níveis de vulnerabilidade no comportamento dos agentes, bem como riscos para a governação e a privacidade, especialmente em configurações multiagente.

Avaliação de agentes de IA sem acesso aos seus mecanismos internos

O que significa uma avaliação black-box

A abordagem black-box avalia o comportamento observável de um sistema agêntico. Para realizar a verificação, bastam descrições básicas do sistema; não é necessário ter acesso privilegiado.

Essa abordagem associa o comportamento observável a categorias de risco. Ela permite realizar avaliações sem acesso aos mecanismos internos.

Critério prático: escolha uma verificação black-box se o acesso privilegiado não estiver disponível, mas for possível fornecer uma descrição básica do sistema.

Em que consiste a verificação

O framework combina uma taxonomia de riscos e red teaming automatizado. Os autores identificam sete domínios que associam o comportamento dos agentes a categorias de risco.

O SAGE-RT cria 120 cenários adversariais para cada domínio. A avaliação também inclui validação humana e avaliadores LLM.

  • Taxonomia: sete domínios de risco.
  • Cenários: red teaming automatizado para cada domínio.
  • Verificação dos resultados: validação humana e avaliadores LLM.

Critério de escolha: o método é adequado à tarefa se forem necessárias a geração automatizada de cenários e a verificação posterior por pessoas e avaliadores LLM.

O que a avaliação revelou

Os autores testaram duas arquiteturas de agentes — CrewAI e AutoGen — e quatro modelos de base.

IndicadorResultado
Risco médio de governança56,25%
Risco de privacidade em configurações multiagente65%
Vulnerabilidades no comportamento dos agentesaté 85%

Esses valores descrevem indicadores diferentes. Não devem ser reduzidos a uma única avaliação geral de risco.

Critério prático: ao comparar resultados, é importante preservar as categorias originais dos indicadores e o contexto da configuração.

Por que uma avaliação de etapa única não é suficiente

Os autores observam que as avaliações padrão continuam sendo de etapa única. Elas não identificam vulnerabilidades que surgem ao longo de uma sequência de ações.

Os riscos estão relacionados à forma como os agentes trabalham:

  • leem dados de entrada não confiáveis;
  • chamam ferramentas com permissões reais;
  • atuam de forma autónoma.

A combinação desses fatores amplia a superfície de segurança. O critério de avaliação é verificar não apenas uma resposta isolada, mas também o comportamento do agente ao longo de várias etapas.

Quando escolher a abordagem black-box

Essa abordagem é adequada para avaliar riscos quando não há acesso interno ao agente. Basta fornecer uma descrição básica do sistema.

Também é útil quando a avaliação precisa associar o comportamento observável a categorias de risco. Uma avaliação de etapa única não é suficiente para identificar vulnerabilidades em várias etapas.

Critério prático: escolha a abordagem se a tarefa exigir verificar o comportamento sem acesso privilegiado e considerar os riscos que surgem ao longo de várias etapas.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Avaliação de agentes de IA sem acesso aos seus mecanismos internos