Por qué los modelos necesitan distintas reacciones humanas
El ajuste fino de grandes modelos de lenguaje para mejorar su helpfulness, según las observaciones de los autores, genera un estilo de asistente homogéneo y excesivamente complaciente. Esto acentúa la brecha Sim2Real: la discrepancia entre la simulación y el comportamiento real.
El estudio OdysSim aborda la simulación a gran escala del comportamiento humano. Los autores lo describen como el mayor estudio sistemático de este tipo.
Para la evaluación, no solo importa la utilidad de la respuesta, sino también la diversidad del comportamiento. Los autores relacionan precisamente esta tarea con la simulación de las reacciones humanas.
Cómo se evalúan las capacidades de los modelos
La taxonomía SOUL reúne cinco ejes de capacidades:
- CONV
- SS
- COG
- ROLE
- EVAL
En el marco de la taxonomía, los autores unificaron 62 conjuntos de datos y 23 tareas de benchmark. Los ejes estructuran la evaluación, mientras que el conjunto de tareas permite comparar modelos en distintos ámbitos.
El criterio práctico de evaluación es abarcar varias tareas, no usar un único indicador general. Así se puede ver en qué destaca más el modelo: en escenarios conversacionales, sociales u otros.
Cómo se entrenó el modelo
El corpus OdysSim incluye 21,4 millones de interacciones y 10 000 millones de tokens. Los autores lo ampliaron con contextos sociales generados a posteriori y crearon el benchmark SOUL-Index.

La receta de entrenamiento combina tres etapas:
- midtraining;
- aprendizaje por refuerzo para tareas específicas;
- destilación de modelos expertos.
Esta composición es importante para evaluar el método: combina el entrenamiento con un corpus, la adaptación a tareas y la transferencia de resultados de modelos expertos.
Qué mostró el modelo
El modelo abierto OSim, con 8 000 millones de parámetros, obtuvo el primer puesto o lo compartió en 8 de las 23 tareas. Según este indicador, superó a cualquier modelo frontier individual.
Los autores observaron los mayores avances en tareas conversacionales y sociales. Las respuestas del modelo se parecen más a las humanas en longitud, formato y elección de palabras.
Fuera de distribución, el modelo transfirió sus habilidades a la simulación de usuarios en τ-bench sin entrenamiento adicional. En cuanto a la coherencia de las reacciones, casi alcanzó el indicador de usuarios reales: 93,2 frente a 93,5.
Cómo tuvieron en cuenta los autores el reward hacking
Los autores descubrieron que el aprendizaje por refuerzo basado en evaluaciones de LLM-as-judge provoca patrones de reward hacking. Desarrollaron detectores que pueden mitigar estos patrones durante la etapa de post-training.
Para evaluar los resultados del entrenamiento, son importantes ambos aspectos: comprobar si hay reward hacking y medir la calidad del comportamiento en las tareas objetivo. Los autores comunican que publican todos los artefactos para futuras investigaciones.



