मूल्यांकन का पैमाना और सीमाएँ
एक बड़े हाउसिंग मार्केटप्लेस की सहायता प्रणाली हर महीने लाखों संवादों को प्रोसेस करती है। यह 11 भाषाओं में काम करती है, और बताया गया P90 10 सेकंड है। ये आँकड़े प्रणाली का पैमाना बताते हैं, लेकिन किसी एक आर्किटेक्चरल निर्णय के प्रभाव को नहीं दिखाते।
| पैरामीटर | मान |
|---|---|
| मात्रा | हर महीने लाखों संवाद |
| भाषाएँ | 11 |
| P90 | 10 सेकंड |
माइग्रेशन के दौरान prompts, alignment और serving भी बदले। इसलिए लेखक आर्किटेक्चर से केवल उन्हीं प्रभावों को जोड़ते हैं जिन्हें एक जैसे दोबारा चलाए गए संवादों पर मापा गया था।
मूल्यांकन मानदंड: आर्किटेक्चर की तुलना समान इनपुट संवादों पर करें, न कि माइग्रेशन के बाद हुए सभी बदलावों का श्रेय उन्हें दें।
खोज, कार्रवाइयों और जनरेशन को कैसे अलग किया गया है
Dynamic Response (DR), मिश्रित उत्तरदाता Qwen3-235B-A22B की जगह टाइप किए गए टूल और छोटे जनरेटर वाले सीमित ReAct ऑर्केस्ट्रेटर का उपयोग करता है। जनरेटर एक ऐसे संदर्भ अनुबंध के आधार पर उत्तर तैयार करता है जिसे backend प्रणाली ने सत्यापित किया हो।

| सिस्टम का हिस्सा | भूमिका |
|---|---|
| खोज | टाइप की गई इकाई का चयन, जिसमें बुकिंग का चयन भी शामिल है |
| कार्रवाइयाँ | टाइप की गई कार्रवाई ID और स्वामित्व की जाँच |
| जनरेशन | backend प्रणाली द्वारा सत्यापित संदर्भ अनुबंध के आधार पर उत्तर |
| ऑर्केस्ट्रेशन | टाइप किए गए टूल पर आधारित सीमित ReAct ऑर्केस्ट्रेटर |
यह विभाजन इकाई और कार्रवाई के चयन को उत्तर की भाषा तैयार करने से अलग करता है। चयन मानदंड: यह आर्किटेक्चर तब उपयुक्त है जब सिस्टम को केवल एक उत्तर जनरेटर नहीं, बल्कि सत्यापित किए जा सकने वाले ऑपरेशन चाहिए।
इकाइयों और कार्रवाइयों के चयन में क्या बदला
टाइप की गई इकाई के चयन ने बुकिंग सिलेक्टर को सटीकता को प्राथमिकता देने की ओर मोड़ा। सटीकता बढ़ी, जबकि रिकॉल घटा। टाइप की गई ID के स्वामित्व की जाँच ने संरचित कार्रवाइयों में देखी गई त्रुटियों को समाप्त कर दिया।
| मेट्रिक | पहले | बाद में |
|---|---|---|
| बुकिंग चयन की सटीकता | 8,3% | 89,1% |
| बुकिंग चयन का रिकॉल | 75,2% | 67,3% |
| संरचित कार्रवाइयों में देखे गए हैलुसिनेशन | 2,14% | 0,0% |
नतीजे चयन की सटीकता और रिकॉल के बीच समझौता दिखाते हैं। चयन मानदंड: यह तरीका तब उपयुक्त है जब चयन में गलती से बचना, रिकॉल के पुराने स्तर को बनाए रखने से अधिक महत्वपूर्ण हो।
एस्केलेशन और स्वयं-सेवा का मूल्यांकन कैसे करें
निम्न-स्तरीय A/B टेस्ट ने replay में एस्केलेशन में कमी को दोहराकर दिखाया। वहीं, production में ऑपरेटर को ट्रांसफ़र किए जाने वाले मामलों की मात्रा लगभग स्थिर रही।
| मापदंड | पहले | बाद में |
|---|---|---|
| हार्ड एस्केलेशन वाले उत्तर | 5,60% | 3,08% |
| सॉफ्ट एस्केलेशन वाले उत्तर | 9,56% | 2,49% |
| स्वयं-समाधान | — | दिशात्मक बदलाव: +5,1 प्रतिशत अंक; 95% CI: −2 से +12 |
एस्केलेशन में कमी के साथ ऑपरेटर को ट्रांसफ़र किए जाने वाले मामलों में तुलनीय कमी नहीं आई। लेखक स्वयं-समाधान को दिशात्मक नतीजा बताते हैं, न कि स्पष्ट रूप से स्थापित वृद्धि।
मूल्यांकन मानदंड: एस्केलेशन वाले उत्तरों, ऑपरेटर को किए गए वास्तविक ट्रांसफ़र और स्वयं-समाधान को अलग-अलग ट्रैक करें।
Serving ऑप्टिमाइज़ेशन से क्या हासिल हुआ
Serving ऑप्टिमाइज़ेशन से ऑर्केस्ट्रेटर की P90 लेटेंसी 3,87 से घटकर 2,24 सेकंड हो गई। साथ ही, GPU footprint लगभग एक-तिहाई कम हुआ।
| मापदंड | बदलाव |
|---|---|
| ऑर्केस्ट्रेटर की P90 लेटेंसी | 3,87 → 2,24 सेकंड |
| GPU footprint | लगभग एक-तिहाई की कमी |
| self-hosting पर मॉडल serving की अनुमानित वार्षिक लागत | एक क्रम से अधिक की कमी |
ये आँकड़े serving से संबंधित हैं, इकाइयों या कार्रवाइयों के चयन की गुणवत्ता से नहीं। मूल्यांकन मानदंड: लेटेंसी, कंप्यूटिंग footprint और serving की लागत को उत्तरों के मेट्रिक्स से अलग-अलग देखें।



