Arsitektur dukungan untuk jutaan percakapan: pemisahan pencarian, tindakan, dan generasi

26 September 202611 tampilan

Dengan menggunakan layanan pemesanan akomodasi sebagai contoh, para penulis mengulas peralihan dari satu model terpadu ke orkestrator terbatas untuk operasi bertipe dan generator yang mengandalkan konteks terverifikasi; dampak arsitektur dinilai terpisah dari perubahan-perubahan terkait. Dalam dialog yang diputar ulang, ketepatan pemilihan pemesanan meningkat, kesalahan dalam tindakan terstruktur menghilang, dan eskalasi berkurang; optimasi juga menurunkan latensi dan biaya penyajian model, sementara volume pengalihan dialog kepada operator di lingkungan produksi tidak banyak berubah.

Arsitektur dukungan untuk jutaan percakapan: pemisahan pencarian, tindakan, dan generasi

Skala dan batas evaluasi

Sistem dukungan untuk marketplace perumahan besar memproses jutaan percakapan per bulan. Sistem ini beroperasi dalam 11 bahasa, dengan P90 yang dilaporkan sebesar 10 detik. Angka-angka ini menggambarkan skala sistem, tetapi tidak menunjukkan dampak dari keputusan arsitektur tertentu.

ParameterNilai
VolumeJutaan percakapan per bulan
Bahasa11
P9010 detik

Migrasi ini juga mencakup perubahan pada prompts, alignment, dan serving. Karena itu, penulis mengaitkan dengan arsitektur hanya dampak yang diukur pada percakapan yang direproduksi secara identik.

Kriteria evaluasi: bandingkan arsitektur dengan percakapan masukan yang identik, bukan mengaitkan semua perubahan setelah migrasi dengannya.

Bagaimana pencarian, tindakan, dan generasi dipisahkan

Dynamic Response (DR) menggantikan Qwen3-235B-A22B yang menangani berbagai jenis respons dengan orkestrator ReAct terbatas yang menggunakan alat bertipe dan generator yang lebih kecil. Generator menyusun jawaban berdasarkan kontrak konteks yang telah diverifikasi oleh sistem backend.

Bagian sistemPeran
PencarianPemilihan entitas bertipe, termasuk pemilihan pemesanan
TindakanID tindakan bertipe dan pemeriksaan kepemilikan
GenerasiJawaban berdasarkan kontrak konteks yang telah diverifikasi oleh sistem backend
OrkestrasiOrkestrator ReAct terbatas yang menggunakan alat bertipe

Pemisahan ini membedakan pemilihan entitas dan tindakan dari perumusan jawaban. Kriteria pemilihan: arsitektur ini cocok ketika sistem memerlukan operasi yang dapat diverifikasi, bukan hanya satu generator jawaban.

Apa yang berubah dalam pemilihan entitas dan tindakan

Pemilihan entitas bertipe mengarahkan selector pemesanan untuk memprioritaskan presisi. Presisi meningkat, sementara kelengkapan menurun. Pemeriksaan kepemilikan ID bertipe menghilangkan kesalahan yang teramati dalam tindakan terstruktur.

MetrikSebelumSesudah
Presisi pemilihan pemesanan8,3%89,1%
Kelengkapan pemilihan pemesanan75,2%67,3%
Halusinasi tindakan terstruktur yang teramati2,14%0,0%

Hasilnya menunjukkan kompromi antara presisi dan kelengkapan pemilihan. Kriteria pemilihan: pendekatan ini sesuai ketika menghindari pemilihan yang keliru lebih penting daripada mempertahankan tingkat kelengkapan sebelumnya.

Cara mengevaluasi eskalasi dan penyelesaian mandiri

Uji A/B tingkat rendah mereproduksi penurunan eskalasi dalam replay. Namun, volume pengalihan ke operator dalam produksi tetap relatif stabil.

IndikatorSebelumSesudah
Jawaban dengan eskalasi langsung5,60%3,08%
Jawaban dengan eskalasi lunak9,56%2,49%
Penyelesaian mandiri—Tren terarah: +5,1 poin persentase; CI 95%: dari −2 hingga +12

Penurunan eskalasi tidak disertai penurunan volume pengalihan ke operator yang sebanding. Penulis menggambarkan penyelesaian mandiri sebagai hasil yang menunjukkan tren, bukan peningkatan yang telah dipastikan secara meyakinkan.

Kriteria evaluasi: pantau secara terpisah jawaban yang melibatkan eskalasi, pengalihan aktual ke operator, dan penyelesaian mandiri.

Hasil optimasi serving

Optimasi serving mengurangi P90 latensi orkestrator dari 3,87 menjadi 2,24 detik. Sementara itu, jejak penggunaan GPU berkurang sekitar sepertiga.

IndikatorPerubahan
P90 latensi orkestrator3,87 → 2,24 detik
Jejak penggunaan GPUTurun sekitar sepertiga
Estimasi biaya tahunan serving model dengan self-hostingTurun lebih dari satu orde magnitudo

Angka-angka ini berkaitan dengan serving, bukan dengan kualitas pemilihan entitas atau tindakan. Kriteria evaluasi: tinjau latensi, jejak komputasi, dan biaya serving secara terpisah dari metrik jawaban.

Pertanyaan yang sering ditanyakan

Bahan terkait

Semua bahan
Arsitektur dukungan untuk jutaan percakapan: pemisahan pencarian, tindakan, dan generasi