Melatih model bahasa untuk memahami beragam respons manusia

25 September 20264 tampilan

Dalam penelitian OdysSim, para penulis mengkaji cara melatih model agar mereproduksi perilaku manusia, alih-alih membatasi jawaban pada gaya asisten yang selalu menyenangkan: mereka mengembangkan taksonomi SOUL, menyusun korpus data, dan mengusulkan skema pelatihan bertahap. Model OSim dengan 8 miliar parameter menunjukkan hasil yang tinggi dalam pengujian dialog dan sosial, mentransfer keterampilannya ke simulasi pengguna, serta membantu mengidentifikasi risiko pelatihan berdasarkan penilaian model bahasa lain.

Melatih model bahasa untuk memahami beragam respons manusia

Mengapa model membutuhkan beragam reaksi manusia

Menurut pengamatan para penulis, penyempurnaan model bahasa besar berdasarkan helpfulness membentuk gaya asisten yang seragam dan terlalu penurut. Hal ini memperlebar kesenjangan Sim2Real — ketidaksesuaian antara simulasi dan perilaku nyata.

Penelitian OdysSim membahas pemodelan perilaku manusia dalam skala besar. Para penulis menyebutnya sebagai penelitian sistematis terbesar dari jenisnya.

Untuk evaluasi, yang penting bukan hanya kegunaan jawaban, tetapi juga keragaman perilaku. Para penulis mengaitkan pemodelan reaksi manusia dengan upaya mencapai tujuan ini.

Cara mengevaluasi kemampuan model

Taksonomi SOUL menggabungkan lima dimensi kemampuan:

  • CONV
  • SS
  • COG
  • ROLE
  • EVAL

Dalam taksonomi ini, para penulis menggabungkan 62 kumpulan data dan 23 tugas benchmark. Dimensi-dimensi tersebut membentuk kerangka evaluasi, sementara kumpulan tugas memungkinkan perbandingan model dalam berbagai aspek.

Kriteria evaluasi praktisnya adalah cakupan beberapa tugas, bukan satu indikator umum. Dengan begitu, kita dapat melihat keunggulan model, baik dalam skenario percakapan, sosial, maupun lainnya.

Cara model dilatih

Korpus OdysSim mencakup 21,4 juta interaksi dan 10 miliar token. Para penulis melengkapinya dengan konteks sosial yang dihasilkan secara retrospektif, lalu membuat benchmark SOUL-Index.

Resep pelatihannya menggabungkan tiga tahap:

  • midtraining;
  • pembelajaran penguatan untuk tugas tertentu;
  • distilasi model ahli.

Kombinasi ini penting untuk mengevaluasi metode tersebut: metode ini menggabungkan pelatihan pada korpus, penyesuaian untuk tugas, dan transfer hasil dari model ahli.

Hasil yang ditunjukkan model

Model terbuka OSim dengan 8 miliar parameter meraih atau berbagi posisi pertama dalam 8 dari 23 tugas. Berdasarkan indikator ini, performanya melampaui setiap model frontier individual.

Para penulis mencatat peningkatan terbesar dalam tugas percakapan dan sosial. Kesimpulan model lebih menyerupai kesimpulan manusia dalam hal panjang, pemformatan, dan pilihan kata.

Dalam kondisi di luar distribusi, model mentransfer keterampilannya ke simulasi pengguna di τ-bench tanpa pelatihan tambahan. Dalam hal konsistensi reaksi, performanya hampir menyamai pengguna nyata: 93,2 dibandingkan dengan 93,5.

Cara penulis memperhitungkan reward hacking

Para penulis menemukan bahwa pembelajaran penguatan berdasarkan penilaian LLM-as-judge memunculkan pola reward hacking. Mereka mengembangkan detektor yang dapat mengurangi pola-pola tersebut pada tahap post-training.

Dalam mengevaluasi hasil pelatihan, kedua hal ini penting: pemeriksaan terhadap reward hacking dan kualitas perilaku dalam tugas yang ditargetkan. Para penulis menyatakan bahwa mereka merilis semua artefak untuk penelitian lebih lanjut.

Pertanyaan yang sering ditanyakan

Melatih model bahasa untuk memahami beragam respons manusia