Mengapa model membutuhkan beragam reaksi manusia
Menurut pengamatan para penulis, penyempurnaan model bahasa besar berdasarkan helpfulness membentuk gaya asisten yang seragam dan terlalu penurut. Hal ini memperlebar kesenjangan Sim2Real — ketidaksesuaian antara simulasi dan perilaku nyata.
Penelitian OdysSim membahas pemodelan perilaku manusia dalam skala besar. Para penulis menyebutnya sebagai penelitian sistematis terbesar dari jenisnya.
Untuk evaluasi, yang penting bukan hanya kegunaan jawaban, tetapi juga keragaman perilaku. Para penulis mengaitkan pemodelan reaksi manusia dengan upaya mencapai tujuan ini.
Cara mengevaluasi kemampuan model
Taksonomi SOUL menggabungkan lima dimensi kemampuan:
- CONV
- SS
- COG
- ROLE
- EVAL
Dalam taksonomi ini, para penulis menggabungkan 62 kumpulan data dan 23 tugas benchmark. Dimensi-dimensi tersebut membentuk kerangka evaluasi, sementara kumpulan tugas memungkinkan perbandingan model dalam berbagai aspek.
Kriteria evaluasi praktisnya adalah cakupan beberapa tugas, bukan satu indikator umum. Dengan begitu, kita dapat melihat keunggulan model, baik dalam skenario percakapan, sosial, maupun lainnya.
Cara model dilatih
Korpus OdysSim mencakup 21,4 juta interaksi dan 10 miliar token. Para penulis melengkapinya dengan konteks sosial yang dihasilkan secara retrospektif, lalu membuat benchmark SOUL-Index.

Resep pelatihannya menggabungkan tiga tahap:
- midtraining;
- pembelajaran penguatan untuk tugas tertentu;
- distilasi model ahli.
Kombinasi ini penting untuk mengevaluasi metode tersebut: metode ini menggabungkan pelatihan pada korpus, penyesuaian untuk tugas, dan transfer hasil dari model ahli.
Hasil yang ditunjukkan model
Model terbuka OSim dengan 8 miliar parameter meraih atau berbagi posisi pertama dalam 8 dari 23 tugas. Berdasarkan indikator ini, performanya melampaui setiap model frontier individual.
Para penulis mencatat peningkatan terbesar dalam tugas percakapan dan sosial. Kesimpulan model lebih menyerupai kesimpulan manusia dalam hal panjang, pemformatan, dan pilihan kata.
Dalam kondisi di luar distribusi, model mentransfer keterampilannya ke simulasi pengguna di τ-bench tanpa pelatihan tambahan. Dalam hal konsistensi reaksi, performanya hampir menyamai pengguna nyata: 93,2 dibandingkan dengan 93,5.
Cara penulis memperhitungkan reward hacking
Para penulis menemukan bahwa pembelajaran penguatan berdasarkan penilaian LLM-as-judge memunculkan pola reward hacking. Mereka mengembangkan detektor yang dapat mengurangi pola-pola tersebut pada tahap post-training.
Dalam mengevaluasi hasil pelatihan, kedua hal ini penting: pemeriksaan terhadap reward hacking dan kualitas perilaku dalam tugas yang ditargetkan. Para penulis menyatakan bahwa mereka merilis semua artefak untuk penelitian lebih lanjut.



