Fita

245 materiais

Ordenação
Notícias10 setembro 2026

Novo benchmark GIM: testando LLMs na interseção de diferentes habilidades cognitivas

Pesquisadores propuseram uma abordagem que avalia modelos não pelo volume de conhecimento nem isoladamente da realidade, mas por meio de tarefas que exigem simultaneamente raciocínio, controle de contexto e trabalho com restrições. O benchmark incluiu 820 tarefas autorais, e seus autores também estudaram como as configurações de "reflexão" e outros parâmetros dos modelos influenciam o resultado.

Novo benchmark GIM: testando LLMs na interseção de diferentes habilidades cognitivas
Ler