Skala dan batas evaluasi
Sistem dukungan untuk marketplace perumahan besar memproses jutaan percakapan per bulan. Sistem ini beroperasi dalam 11 bahasa, dengan P90 yang dilaporkan sebesar 10 detik. Angka-angka ini menggambarkan skala sistem, tetapi tidak menunjukkan dampak dari keputusan arsitektur tertentu.
| Parameter | Nilai |
|---|---|
| Volume | Jutaan percakapan per bulan |
| Bahasa | 11 |
| P90 | 10 detik |
Migrasi ini juga mencakup perubahan pada prompts, alignment, dan serving. Karena itu, penulis mengaitkan dengan arsitektur hanya dampak yang diukur pada percakapan yang direproduksi secara identik.
Kriteria evaluasi: bandingkan arsitektur dengan percakapan masukan yang identik, bukan mengaitkan semua perubahan setelah migrasi dengannya.
Bagaimana pencarian, tindakan, dan generasi dipisahkan
Dynamic Response (DR) menggantikan Qwen3-235B-A22B yang menangani berbagai jenis respons dengan orkestrator ReAct terbatas yang menggunakan alat bertipe dan generator yang lebih kecil. Generator menyusun jawaban berdasarkan kontrak konteks yang telah diverifikasi oleh sistem backend.

| Bagian sistem | Peran |
|---|---|
| Pencarian | Pemilihan entitas bertipe, termasuk pemilihan pemesanan |
| Tindakan | ID tindakan bertipe dan pemeriksaan kepemilikan |
| Generasi | Jawaban berdasarkan kontrak konteks yang telah diverifikasi oleh sistem backend |
| Orkestrasi | Orkestrator ReAct terbatas yang menggunakan alat bertipe |
Pemisahan ini membedakan pemilihan entitas dan tindakan dari perumusan jawaban. Kriteria pemilihan: arsitektur ini cocok ketika sistem memerlukan operasi yang dapat diverifikasi, bukan hanya satu generator jawaban.
Apa yang berubah dalam pemilihan entitas dan tindakan
Pemilihan entitas bertipe mengarahkan selector pemesanan untuk memprioritaskan presisi. Presisi meningkat, sementara kelengkapan menurun. Pemeriksaan kepemilikan ID bertipe menghilangkan kesalahan yang teramati dalam tindakan terstruktur.
| Metrik | Sebelum | Sesudah |
|---|---|---|
| Presisi pemilihan pemesanan | 8,3% | 89,1% |
| Kelengkapan pemilihan pemesanan | 75,2% | 67,3% |
| Halusinasi tindakan terstruktur yang teramati | 2,14% | 0,0% |
Hasilnya menunjukkan kompromi antara presisi dan kelengkapan pemilihan. Kriteria pemilihan: pendekatan ini sesuai ketika menghindari pemilihan yang keliru lebih penting daripada mempertahankan tingkat kelengkapan sebelumnya.
Cara mengevaluasi eskalasi dan penyelesaian mandiri
Uji A/B tingkat rendah mereproduksi penurunan eskalasi dalam replay. Namun, volume pengalihan ke operator dalam produksi tetap relatif stabil.
| Indikator | Sebelum | Sesudah |
|---|---|---|
| Jawaban dengan eskalasi langsung | 5,60% | 3,08% |
| Jawaban dengan eskalasi lunak | 9,56% | 2,49% |
| Penyelesaian mandiri | — | Tren terarah: +5,1 poin persentase; CI 95%: dari −2 hingga +12 |
Penurunan eskalasi tidak disertai penurunan volume pengalihan ke operator yang sebanding. Penulis menggambarkan penyelesaian mandiri sebagai hasil yang menunjukkan tren, bukan peningkatan yang telah dipastikan secara meyakinkan.
Kriteria evaluasi: pantau secara terpisah jawaban yang melibatkan eskalasi, pengalihan aktual ke operator, dan penyelesaian mandiri.
Hasil optimasi serving
Optimasi serving mengurangi P90 latensi orkestrator dari 3,87 menjadi 2,24 detik. Sementara itu, jejak penggunaan GPU berkurang sekitar sepertiga.
| Indikator | Perubahan |
|---|---|
| P90 latensi orkestrator | 3,87 → 2,24 detik |
| Jejak penggunaan GPU | Turun sekitar sepertiga |
| Estimasi biaya tahunan serving model dengan self-hosting | Turun lebih dari satu orde magnitudo |
Angka-angka ini berkaitan dengan serving, bukan dengan kualitas pemilihan entitas atau tindakan. Kriteria evaluasi: tinjau latensi, jejak komputasi, dan biaya serving secara terpisah dari metrik jawaban.



