Porque é que os modelos precisam de diferentes reações humanas
O fine-tuning de grandes modelos de linguagem para aumentar a utilidade, segundo as observações dos autores, gera um estilo de assistente homogéneo e excessivamente submisso. Isto acentua a lacuna Sim2Real — a discrepância entre a simulação e o comportamento real.
O estudo OdysSim aborda a modelação em larga escala do comportamento humano. Os autores consideram-no o maior estudo sistemático deste tipo.
Para a avaliação, não é apenas importante a utilidade das respostas, mas também a diversidade do comportamento. Os autores associam precisamente esta tarefa à modelação das reações humanas.
Como são avaliadas as capacidades dos modelos
A taxonomia SOUL reúne cinco eixos de capacidades:
- CONV
- SS
- COG
- ROLE
- EVAL
No âmbito da taxonomia, os autores reuniram 62 conjuntos de dados e 23 tarefas de benchmark. Os eixos definem a estrutura da avaliação, e o conjunto de tarefas permite comparar modelos em diferentes áreas.
O critério prático de avaliação é a cobertura de várias tarefas, e não um único indicador geral. Assim, é possível perceber em que áreas o modelo é mais forte: em cenários conversacionais, sociais ou noutros.
Como o modelo foi treinado
O corpus OdysSim inclui 21,4 milhões de interações e 10 mil milhões de tokens. Os autores complementaram-no com contextos sociais gerados retroativamente e criaram o benchmark SOUL-Index.

A receita de treino combina três etapas:
- midtraining;
- aprendizagem por reforço para tarefas específicas;
- destilação de modelos especializados.
Esta composição é importante para avaliar o método: combina o treino com um corpus, o ajuste para tarefas e a transferência de resultados de especialistas.
O que o modelo demonstrou
O modelo aberto OSim, com 8 mil milhões de parâmetros, ficou em primeiro lugar ou empatado em 8 das 23 tarefas. Neste indicador, superou qualquer modelo de fronteira individual.
Os autores assinalaram os maiores ganhos nas tarefas conversacionais e sociais. As respostas do modelo aproximam-se mais das humanas em termos de comprimento, formatação e escolha de palavras.
Fora da distribuição, o modelo transferiu competências para a simulação de utilizadores no τ-bench sem treino adicional. Em termos de consistência das reações, quase atingiu o nível dos utilizadores reais: 93,2 contra 93,5.
Como os autores tiveram em conta o reward hacking
Os autores descobriram que a aprendizagem por reforço baseada em avaliações de LLM-as-judge provoca padrões de reward hacking. Desenvolveram detetores que podem atenuar esses padrões na fase de post-training.
Para avaliar os resultados do treino, são importantes ambos os aspetos: a verificação de reward hacking e a qualidade do comportamento nas tarefas-alvo. Os autores informam que estão a disponibilizar todos os artefactos para investigação futura.



