Ensinar modelos de linguagem sobre a diversidade das reações humanas

25 setembro 20265 visualizações

No trabalho OdysSim, os autores investigam como treinar modelos para reproduzir o comportamento humano, em vez de reduzir as respostas a um estilo prestável de assistente: desenvolveram a taxonomia SOUL, reuniram um corpus de dados e propuseram um esquema de treino em várias etapas. O modelo OSim, com 8 mil milhões de parâmetros, apresenta resultados elevados em testes de diálogo e sociais, transfere competências para a simulação de utilizadores e ajuda a identificar riscos do treino com base nas avaliações de outros modelos de linguagem.

Ensinar modelos de linguagem sobre a diversidade das reações humanas

Porque é que os modelos precisam de diferentes reações humanas

O fine-tuning de grandes modelos de linguagem para aumentar a utilidade, segundo as observações dos autores, gera um estilo de assistente homogéneo e excessivamente submisso. Isto acentua a lacuna Sim2Real — a discrepância entre a simulação e o comportamento real.

O estudo OdysSim aborda a modelação em larga escala do comportamento humano. Os autores consideram-no o maior estudo sistemático deste tipo.

Para a avaliação, não é apenas importante a utilidade das respostas, mas também a diversidade do comportamento. Os autores associam precisamente esta tarefa à modelação das reações humanas.

Como são avaliadas as capacidades dos modelos

A taxonomia SOUL reúne cinco eixos de capacidades:

  • CONV
  • SS
  • COG
  • ROLE
  • EVAL

No âmbito da taxonomia, os autores reuniram 62 conjuntos de dados e 23 tarefas de benchmark. Os eixos definem a estrutura da avaliação, e o conjunto de tarefas permite comparar modelos em diferentes áreas.

O critério prático de avaliação é a cobertura de várias tarefas, e não um único indicador geral. Assim, é possível perceber em que áreas o modelo é mais forte: em cenários conversacionais, sociais ou noutros.

Como o modelo foi treinado

O corpus OdysSim inclui 21,4 milhões de interações e 10 mil milhões de tokens. Os autores complementaram-no com contextos sociais gerados retroativamente e criaram o benchmark SOUL-Index.

A receita de treino combina três etapas:

  • midtraining;
  • aprendizagem por reforço para tarefas específicas;
  • destilação de modelos especializados.

Esta composição é importante para avaliar o método: combina o treino com um corpus, o ajuste para tarefas e a transferência de resultados de especialistas.

O que o modelo demonstrou

O modelo aberto OSim, com 8 mil milhões de parâmetros, ficou em primeiro lugar ou empatado em 8 das 23 tarefas. Neste indicador, superou qualquer modelo de fronteira individual.

Os autores assinalaram os maiores ganhos nas tarefas conversacionais e sociais. As respostas do modelo aproximam-se mais das humanas em termos de comprimento, formatação e escolha de palavras.

Fora da distribuição, o modelo transferiu competências para a simulação de utilizadores no τ-bench sem treino adicional. Em termos de consistência das reações, quase atingiu o nível dos utilizadores reais: 93,2 contra 93,5.

Como os autores tiveram em conta o reward hacking

Os autores descobriram que a aprendizagem por reforço baseada em avaliações de LLM-as-judge provoca padrões de reward hacking. Desenvolveram detetores que podem atenuar esses padrões na fase de post-training.

Para avaliar os resultados do treino, são importantes ambos os aspetos: a verificação de reward hacking e a qualidade do comportamento nas tarefas-alvo. Os autores informam que estão a disponibilizar todos os artefactos para investigação futura.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Ensinar modelos de linguagem sobre a diversidade das reações humanas