Entrenamiento de modelos lingüísticos en la diversidad de las reacciones humanas

25 septiembre 20265 vistas

OdysSim investiga cómo entrenar modelos para reproducir el comportamiento humano, en lugar de reducir las respuestas a un estilo servicial de asistente: sus autores desarrollaron la taxonomía SOUL, recopilaron un corpus de datos y propusieron un esquema de entrenamiento por etapas. El modelo OSim, con 8.000 millones de parámetros, obtiene resultados destacados en pruebas de diálogo y sociales, transfiere sus habilidades a la simulación de usuarios y ayuda a detectar riesgos del entrenamiento mediante evaluaciones de otros modelos de lenguaje.

Entrenamiento de modelos lingüísticos en la diversidad de las reacciones humanas

Por qué los modelos necesitan distintas reacciones humanas

El ajuste fino de grandes modelos de lenguaje para mejorar su helpfulness, según las observaciones de los autores, genera un estilo de asistente homogéneo y excesivamente complaciente. Esto acentúa la brecha Sim2Real: la discrepancia entre la simulación y el comportamiento real.

El estudio OdysSim aborda la simulación a gran escala del comportamiento humano. Los autores lo describen como el mayor estudio sistemático de este tipo.

Para la evaluación, no solo importa la utilidad de la respuesta, sino también la diversidad del comportamiento. Los autores relacionan precisamente esta tarea con la simulación de las reacciones humanas.

Cómo se evalúan las capacidades de los modelos

La taxonomía SOUL reúne cinco ejes de capacidades:

  • CONV
  • SS
  • COG
  • ROLE
  • EVAL

En el marco de la taxonomía, los autores unificaron 62 conjuntos de datos y 23 tareas de benchmark. Los ejes estructuran la evaluación, mientras que el conjunto de tareas permite comparar modelos en distintos ámbitos.

El criterio práctico de evaluación es abarcar varias tareas, no usar un único indicador general. Así se puede ver en qué destaca más el modelo: en escenarios conversacionales, sociales u otros.

Cómo se entrenó el modelo

El corpus OdysSim incluye 21,4 millones de interacciones y 10 000 millones de tokens. Los autores lo ampliaron con contextos sociales generados a posteriori y crearon el benchmark SOUL-Index.

La receta de entrenamiento combina tres etapas:

  • midtraining;
  • aprendizaje por refuerzo para tareas específicas;
  • destilación de modelos expertos.

Esta composición es importante para evaluar el método: combina el entrenamiento con un corpus, la adaptación a tareas y la transferencia de resultados de modelos expertos.

Qué mostró el modelo

El modelo abierto OSim, con 8 000 millones de parámetros, obtuvo el primer puesto o lo compartió en 8 de las 23 tareas. Según este indicador, superó a cualquier modelo frontier individual.

Los autores observaron los mayores avances en tareas conversacionales y sociales. Las respuestas del modelo se parecen más a las humanas en longitud, formato y elección de palabras.

Fuera de distribución, el modelo transfirió sus habilidades a la simulación de usuarios en τ-bench sin entrenamiento adicional. En cuanto a la coherencia de las reacciones, casi alcanzó el indicador de usuarios reales: 93,2 frente a 93,5.

Cómo tuvieron en cuenta los autores el reward hacking

Los autores descubrieron que el aprendizaje por refuerzo basado en evaluaciones de LLM-as-judge provoca patrones de reward hacking. Desarrollaron detectores que pueden mitigar estos patrones durante la etapa de post-training.

Para evaluar los resultados del entrenamiento, son importantes ambos aspectos: comprobar si hay reward hacking y medir la calidad del comportamiento en las tareas objetivo. Los autores comunican que publican todos los artefactos para futuras investigaciones.

Preguntas frecuentes

Material similar

Todos los materiales
Entrenamiento de modelos lingüísticos en la diversidad de las reacciones humanas