Filtros de proteção de LLMs falham fora do inglês: como os modelos reforçam estereótipos em outros idiomas

9 setembro 20264 visualizações

Pesquisadores identificaram um grave desequilíbrio interlinguístico na segurança de grandes modelos de linguagem: seu alinhamento é configurado principalmente para o inglês, portanto, em outros idiomas, os modelos contornam mais facilmente as restrições e reproduzem preconceitos prejudiciais. O novo benchmark INCLUDE, testado em dez modelos e seis idiomas indianos, mostrou que o nível de viés varia consideravelmente dependendo do idioma e do tipo de modelo.

Filtros de proteção de LLMs falham fora do inglês: como os modelos reforçam estereótipos em outros idiomas

A educação anglocêntrica — a raiz do problema

Um modelo de linguagem moderno de grande porte pode se comunicar com confiança em dezenas de idiomas, mas foi ensinado a pensar sobre segurança principalmente em inglês. A fase de alinhamento, na qual o modelo recebe restrições — contra conteúdo prejudicial, declarações tóxicas, conselhos perigosos — é quase inteiramente construída sobre dados e testes em inglês. Os conjuntos para "red team", as instruções para os anotadores, os exemplos de referência de recusas — tudo isso é, em primeiro lugar, sobre o inglês.

O pesquisador Namya Bhatnagar descreveu esse problema de forma sistemática no trabalho "Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs" (arXiv:2608.18131, seção Computer Science > Artificial Intelligence). O artigo foi submetido em 26 de julho de 2026 e foi aceito para o IEEE SLT 2026 — a conferência sobre tecnologias de fala. Nele, é documentado um efeito que merece ser chamado de ilusão de segurança: o modelo parece estar confiavelmente protegido enquanto o interlocutor fala inglês, e deixa de sê-lo fora desse idioma.

A lacuna é explicável: o modelo reconhece a nocividade de uma formulação através dos exemplos com os quais foi treinado. Uma frase em bengali, tâmil ou marata com a mesma mensagem pode simplesmente não cair na zona de atenção do filtro — tal exemplo "prejudicial" não estava nos dados. Como resultado, uma resposta estereotipada passa por onde o equivalente em inglês teria sido bloqueado já na entrada.

Voz: quando a falha é visível imediatamente

É nos interfaces de voz que essa lacuna se manifesta de forma mais perigosa. Assistentes conversacionais não têm o direito a uma verificação demorada: precisam responder aqui e agora, e a fala do usuário é viva, com entonações, abreviações e mistura de idiomas. Nessas condições, o filtro anglocêntrico não funciona para entradas não inglesas, e o sistema pode emitir uma resposta que reforça estereótipos sociais — por casta, região, religião ou profissão.

Para tecnologias de voz implantadas entre a população linguisticamente diversa da Índia, isso é, na avaliação do autor, um modo de falha crítico. O usuário recebe uma resposta prejudicial imediatamente, na forma oral, sem a possibilidade de verificar ou contestar. E são justamente as comunidades não anglófonas que se tornam a principal zona de impacto: declarações tendenciosas que o modelo não deixaria passar em inglês soam sem quaisquer proteções nos idiomas regionais. Isso não é mais um risco hipotético para as futuras gerações de sistemas, mas uma falha perceptível já hoje.

INCLUDE: uma ótica indiana para medir o viés

Para avaliar a escala do problema, apenas constatar não basta — é necessário um instrumento de medição. O autor apresenta o INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases): um benchmark de avaliação multilíngue criado para quantificar preconceitos socioculturais no contexto indiano.

O benchmark é construído sobre 2604 prompts em seis idiomas:

  • inglês;
  • hindi;
  • bengali;
  • marata;
  • tâmil;
  • hinglish — um híbrido de hindi e inglês, usado por muitos indianos na vida cotidiana.

A ideia-chave não é traduzir testes de inglês literalmente, mas buscar preconceitos através das realidades culturais indianas. Com esse conjunto, dez modelos — de código aberto e fechado — foram testados, totalizando 14.988 indicadores de viés. Esse volume permite enxergar não "erros" isolados, mas padrões sistêmicos.

Os resultados de medição mais inesperados

A análise estatística revelou duas observações-chave, e cada uma merece atenção especial.

Nos modelos abertos, o bengali teve o pior desempenho. O nível médio de viés nesse idioma foi o mais alto entre os modelos de código aberto. Esse é um sinal particularmente preocupante: LLMs abertos são frequentemente ajustados e implantados localmente, o que significa que são eles que mais "derrapam" em um dos maiores idiomas da Índia e de Bangladesh.

O inglês surpreendeu pela reviravolta. Se nos modelos abertos ele apresentou o menor nível médio de viés, nos fechados — ao contrário — foi o mais alto. A imagem habitual de que "modelos proprietários são mais seguros que os abertos" não se aplica aqui: em inglês, os LLMs fechados inesperadamente perdem para os abertos. Em outras palavras, a distribuição do viés entre os idiomas depende fortemente da classe de modelo com a qual você está lidando.

Conclusão: a segurança não pode ser traduzida literalmente

A principal lição da pesquisa é que preconceitos culturais não são capturados por um filtro universal em inglês. A simples tradução de regras anglófonas para outros idiomas não resolve: os estereótipos estão enraizados no contexto local, e o modelo precisa aprender a reconhecê-los no idioma e na cultura em que surgem.

A indústria deveria repensar a própria prática de alinhamento: incluir cenários não ingleses no treinamento, envolver anotadores das comunidades linguísticas-alvo e testar regularmente os modelos com benchmarks multilíngues como o INCLUDE. Caso contrário, surge um paradoxo: quanto mais idiomas o modelo conhece, maior é o público que sua proteção não cobre.

Se a segurança continuar a ser anglocêntrica, a "ilusão de alinhamento" se reproduzirá em cada nova geração de LLMs. Os pontos mais vulneráveis continuarão sendo os sistemas de voz em idiomas não ingleses amplamente falados — e quem pagará por isso serão usuários bem reais.

Perguntas mais frequentes

Filtros de proteção de LLMs falham fora do inglês: como os modelos reforçam estereótipos em outros idiomas