Fita

37 materiais

Ordenação
Notícias10 setembro 2026

Novo benchmark GIM: testando LLMs na interseção de diferentes habilidades cognitivas

Pesquisadores propuseram uma abordagem que avalia modelos não pelo volume de conhecimento nem isoladamente da realidade, mas por meio de tarefas que exigem simultaneamente raciocínio, controle de contexto e trabalho com restrições. O benchmark incluiu 820 tarefas autorais, e seus autores também estudaram como as configurações de "reflexão" e outros parâmetros dos modelos influenciam o resultado.

Novo benchmark GIM: testando LLMs na interseção de diferentes habilidades cognitivas
Ler
Notícias9 setembro 2026

Filtros de proteção de LLMs falham fora do inglês: como os modelos reforçam estereótipos em outros idiomas

Pesquisadores identificaram um grave desequilíbrio interlinguístico na segurança de grandes modelos de linguagem: seu alinhamento é configurado principalmente para o inglês, portanto, em outros idiomas, os modelos contornam mais facilmente as restrições e reproduzem preconceitos prejudiciais. O novo benchmark INCLUDE, testado em dez modelos e seis idiomas indianos, mostrou que o nível de viés varia consideravelmente dependendo do idioma e do tipo de modelo.

Filtros de proteção de LLMs falham fora do inglês: como os modelos reforçam estereótipos em outros idiomas
Ler
Notícias7 setembro 2026

Google compra arquivo de dados de funcionários da falida Spirit: comissários de bordo exigem proteção de sua privacidade

Sindicato de comissários de bordo e defensores de direitos humanos estão preocupados com o acordo pelo qual o Google adquiriu em leilão um gigantesco conjunto de documentos de trabalho da Spirit Airlines — de dados salariais a correspondências corporativas. Eles temem que a desidentificação não proteja os funcionários da reexposição de suas informações pessoais quando os dados forem usados para treinar IA.

Google compra arquivo de dados de funcionários da falida Spirit: comissários de bordo exigem proteção de sua privacidade
Ler
Notícias4 setembro 2026

AdaLens: linha narrativa visual para controlar e redirecionar análises longas de agentes

Com o aumento da autonomia dos agentes de LLM na ciência de dados, as interfaces padrão não oferecem uma visão clara do raciocínio do sistema nem a possibilidade de intervenção em tempo hábil. O AdaLens visualiza o processo analítico como uma linha narrativa: planos, progresso e resultados intermediários ficam visíveis, e o analista pode redirecionar o andamento do trabalho.

AdaLens: linha narrativa visual para controlar e redirecionar análises longas de agentes
Ler