সার্চ এজেন্টদের মূল্যায়ন সাধারণত সুনির্দিষ্টভাবে লেখা দৃশ্যপটের উপর দাঁড়িয়ে থাকে: আগে থেকে জানা সংলাপ, পূর্বানুমেয় কোয়েরি, একজন "গড়পড়তা" ব্যবহারকারী। এই ধরনের পদ্ধতি মাপা সুবিধাজনক, কিন্তু বাস্তবতা ভালোভাবে প্রতিফলিত করে না, যেখানে একই ইন্টারফেসের সামনে বসে থাকেন সম্পূর্ণ ভিন্ন গতি, ভঙ্গি ও ধৈর্যসম্পন্ন মানুষ। AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval (arXiv:2608.24076, Agent4IR @ KDD 2026 ওয়ার্কশপে গৃহীত) কাজটি এজেন্টের নির্ভরযোগ্যতার দিকে ভিন্নভাবে তাকানোর প্রস্তাব দেয় — собеседникের চরিত্রের মধ্য দিয়ে এবং সেই চরিত্র ভাঙার প্রচেষ্টার মধ্য দিয়ে।
স্ক্রিপ্ট থেকে ব্যক্তিত্বে: ফাঁকটি কোথায়
এজেন্টিক সার্চের ক্লাসিক বেঞ্চমার্ক প্রশ্নের উত্তর দেয় "এজেন্ট কি কাজটি সমাধান করেছে"। কিন্তু ধাপগুলোর মাঝে কী ঘটে সে বিষয়ে এটি নীরব, এবং ফলাফলের বিস্তার সম্পর্কে প্রায় কিছুই বলে না। যদি পরীক্ষায় সব ব্যবহারকারী একইভাবে আচরণ করেন, সিস্টেমের উপর আক্রমণ আদৌ মডেল করা না হয়, তাহলে সিদ্ধান্তও আসে নিরস: এমন পরিমাপ থেকে বোঝা অসম্ভব কোথায় ঠিক এজেন্ট হোঁচট খেতে শুরু করে।
লেখকরা — Gunja Agarwal, Arup Kumar Das, Arun Menon, Jitesh Chandra Mishra এবং Vignesh Divakaran — ঠিক এই ফাঁকটিই ভরাট করার চেষ্টা করছেন। তাঁদের মূল ভাবনা সহজ: ব্যবহারকারীদের আচরণের বিস্তারকে মসৃণ করা উচিত নয়, বরং এটিকে আলাদা একটি পরিমাপক যন্ত্রে পরিণত করা উচিত।

AgentWorld কী
AgentWorld হলো একটি সিমুলেটর, আলাদা কোনো সার্চ ইঞ্জিন নয়। এটি এজেন্টের বদলে কাজ সমাধান করে না, বরং এমন একটি পরিবেশ তৈরি করে যেখানে এজেন্টকে বিভিন্ন দৃশ্যপট ও বিভিন্ন ধরনের собеседникের মধ্য দিয়ে চালানো যায়, শুধু চূড়ান্ত উত্তরই নয়, তা পাওয়ার গতিপথও লিপিবদ্ধ করা হয়।
চারটি মূল ব্লক
- Big Five অনুযায়ী ব্যবহারকারী মডেল। পার্সোনাগুলো পাঁচ-ফ্যাক্টর মডেল (যাকে OCEAN-ও বলা হয়) অনুযায়ী নির্ধারিত হয়, আর তারা শূন্যে কাজ করে না: প্রতিটি ব্যবহারকারীর নিজস্ব অবস্থা ও নিজস্ব উপলব্ধ টুলের সেট থাকে, এবং সংলাপের ধারায় এই অবস্থাগুলো বদলায়।
- pass^k সামঞ্জস্যতার মেট্রিক। এটি শুধু "কতবার সফল হয়েছে" নয়। পাশাপাশি আছে ব্যর্থতার কাঠামোগত শ্রেণীবিভাগ, অসম্পূর্ণ কিন্তু অর্থবহ অগ্রগতির জন্য আংশিক স্কোর প্রদান এবং নিয়ন্ত্রণ হস্তান্তরের দ্বৈত যাচাই — অর্থাৎ আলাদাভাবে যাচাই করা হয়, এজেন্ট সঠিকভাবে মানুষের বা অন্য সিস্টেমের কাছে পালা হস্তান্তর করেছে কি না।
- ফাইন-টিউনিংয়ের জন্য ডেটা এক্সপোর্ট। সিমুলেটর সঞ্চিত রানগুলো, দুর্বল স্কোরেরগুলো বাদ দিয়ে, সরাসরি ছয়টি ফরম্যাটে রপ্তানি করতে পারে, যা ফাইন-টিউনিংয়ের উপযোগী।
- প্রতিদ্বন্দ্বিতামূলক Risk Analyser। এই মডিউল এজেন্টের অবশ্যই পার হতে হওয়া মধ্যবর্তী অবস্থাগুলোর "মেরুদণ্ড" থেকে স্ন্যাপশট নেয়, তারপর নির্দিষ্ট কাজের সঙ্গে যুক্ত চার ধরনের বিশৃঙ্খলার জন্য মন্টে-কার্লো পদ্ধতিতে রানগুলো শাখা-প্রশাখায় ভাগ করে। চূড়ান্ত ঝুঁকি হিসাব করা হয় ΔP / ΔT অনুপাত, ডেম্পস্টার—শেফার প্রমাণ-সংযোজন এবং শেপলি অনুযায়ী আক্রমণ-শ্রেণির অ্যাট্রিবিউশনের মাধ্যমে।
যুক্তিটির দিকে খেয়াল করুন: প্রথম তিনটি ব্লক পরিমাপ ও প্রশিক্ষণ নিয়ে, চতুর্থটি ভাঙন পূর্বাভাস নিয়ে। ফ্রেমওয়ার্কটি শুরু থেকেই শুধু রোগনির্ণয়ের নয়, স্ট্রেস-টেস্টিংয়েরও হাতিয়ার হিসেবে গড়ে উঠেছে।

তিনটি রান: বিশ্লেষণ থেকে প্রতিদ্বন্দ্বিতামূলক আক্রমণ
পরীক্ষামূলক অংশটি ভিন্ন মাত্রার "লোড" নিয়ে তিনটি ভাগে বিভক্ত।
- কথোপকথনমূলক বিশ্লেষণী এজেন্ট দশটি OCEAN পার্সোনার বিরুদ্ধে চালানো হয়েছিল। গুণমান চিহ্নিত করার জন্য 240টি বিচারক-মূল্যায়ন সংগ্রহ করা হয়েছে।
- কাস্টমার সাপোর্ট এজেন্ট পাঁচটি কাজে পরীক্ষা করা হয়েছিল, প্রতিটি পার্সোনার চারটি ভিন্নতায়।
- প্রতিদ্বন্দ্বিতামূলক স্ট্রেস-টেস্ট একই পাঁচটি কাজে: এখানে বিশৃঙ্খলা যোগ করা হয়েছিল, যাতে দেখা যায় গতিপথ কত দ্রুত ভেঙে পড়ে।
তৃতীয় রানটি সবচেয়ে তাৎপর্যপূর্ণ প্রমাণিত হয়েছে। বিশৃঙ্খলা ছাড়াই গতিপথের ন্যূনতম স্থিতিশীলতা ছিল V_min = 0.375 — অর্থাৎ "পরিষ্কার" পরিস্থিতিতেও কোনো নিরাপত্তা-মার্জিন নেই। আর যখন আক্রমণ চালু হলো, দেখা গেল সবচেয়ে বিপজ্জনক আঘাতগুলো কোয়েরির বিষয়বস্তুতে নয়, বরং টুল ও পরিকাঠামোতে: শেপলি অ্যাট্রিবিউশন সিস্টেম-স্তরকে প্রায় 46%, অ্যাকশন-স্তরকে প্রায় 38% দেয়।
এটি গুরুত্বের একটি তাৎপর্যপূর্ণ স্থানান্তর। এজেন্ট নিরাপত্তার আলোচনা প্রায়ই টেক্সটে প্রম্পট-ইনজেকশনে সীমাবদ্ধ থাকে, অথচ সংখ্যাগুলো বলে মূল ঝুঁকি বাস করে সেই স্তরে, যা টুল কল ও তাদের অবস্থার জন্য দায়ী।
চরিত্র বৈষম্যের উৎস হিসেবে
নিবন্ধে সবচেয়ে আকর্ষণীয় বিষয়টি পরম স্কোর নয়, বরং পার্সোনাগুলোর মধ্যে বিস্তার। একই কাজে সফলতার হার আমূল ভিন্ন ছিল: 50% বনাম 100%। এটি পরিমাপের শব্দ নয়, বরং সংকেত যে এজেন্ট ভিন্ন ভিন্ন যোগাযোগ-ভঙ্গি ভিন্নভাবে সামলায়।
আলাদাভাবে সেই ব্যর্থতার মোডগুলো তালিকাভুক্ত করা হয়েছে, যা একক-রকম পরীক্ষা আদৌ দেখায় না:
- ক্রস-ডোমেইন লিক — যখন এক কাজের প্রসঙ্গ অন্য কাজে গড়িয়ে পড়ে;
- প্রসঙ্গ-প্রবাহ — দীর্ঘ সংলাপের ধারায় বিষয় ও লক্ষ্যের ক্রমিক সরে যাওয়া;
- গুণমানে ফারাক পার্সোনাগুলোর মধ্যে 0.27 পয়েন্ট।
লেখকরা জোর দেন, Risk Analyser গতিপথ-স্তরে ভঙ্গুরতা মাপতে পারে — যেখানে একক pass^k মেট্রিক অসহায়, কারণ এটি কেবল সফলতা বা ব্যর্থতার সত্যতা লিপিবদ্ধ করে এবং "প্রথম ধাপেই ভেঙে পড়েছে" ও "প্রায় শেষ পর্যন্ত পৌঁছেছিল কিন্তু অবস্থা ধরে রাখতে পারেনি"-র মধ্যে পার্থক্য করে না।
বাস্তবে এটি কী কাজে লাগে
যদি সিদ্ধান্তগুলোকে রেসিপি হিসেবে ধরা হয়, তবে তা এমন: এজেন্টকে একজন "গড়" ব্যবহারকারীর উপর নয়, বরং একগুচ্ছ চরিত্রের উপর পরীক্ষা করুন, এবং তাদের গড় নয়, তাদের মধ্যকার বিস্তারের দিকে তাকান। গড় স্কোর বেশ ভালোই হতে পারে, অথচ অর্ধেক পার্সোনা ধারাবাহিকভাবে দৃশ্যপটে ব্যর্থ হচ্ছে।
দ্বিতীয় ব্যবহারিক স্তর — ডেটা। যেহেতু সিমুলেটর সফল ও অসফল রান চিহ্নিত করতে এবং সেগুলো প্রস্তুত ফরম্যাটে রপ্তানি করতে পারে, ব্যক্তিত্ব শুধু পরীক্ষাই নয়, প্রশিক্ষণ উপকরণের উৎসও হয়ে ওঠে। এখানে দুর্বল দিকটি স্পষ্ট: এমন ডেটাসেটের গুণমান সম্পূর্ণভাবে চিহ্নিতকরণের গুণমানের উপর নির্ভরশীল, আর বিচারক-মূল্যায়ন প্রক্রিয়ার সবচেয়ে ব্যয়বহুল ও বিষয়ভিত্তিক অংশ।
সবশেষে, তৃতীয় স্তর — সুরক্ষায় অগ্রাধিকার। যেহেতু ঝুঁকির মূল অংশ সিস্টেম-স্তর ও অ্যাকশনে পড়ে, শব্দবিন্যাসে নয়, তাই সবার আগে শক্তিশালী করতে হবে অ্যাক্সেস-অধিকার, কল-যাচাই এবং নিয়ন্ত্রণ হস্তান্তরের সঠিকতা, কেবল ইনপুট টেক্সটে ফিল্টার নয়।

মনে রাখা উচিত
মাত্রা সম্পর্কে মনে রাখা উচিত: এখানে তিনটি পরীক্ষা-সেটের কথা, যার একটিতে দশটি পার্সোনা এবং অন্য দুটিতে পাঁচটি কাজ। 50% বনাম 100%-এর মতো সংখ্যা নাটকীয় দেখায়, কিন্তু তা ছোট নমুনার উপর দাঁড়ানো — এটি চূড়ান্ত রায়ের চেয়ে দিকনির্দেশনার ইঙ্গিত বেশি। এছাড়া, Big Five অনুযায়ী ব্যবহারকারী-সিমুলেশন অনিবার্যভাবে বাস্তব চরিত্রকে মোটা করে ফেলে: জীবন্ত মানুষ অসঙ্গতিপূর্ণ, অথচ সিমুলেটরের পার্সোনা তবু নির্ধারিত প্রোফাইল অনুসরণ করে।
তবুও পদ্ধতিগত ধারণাটি দৃঢ় ও স্থানান্তরযোগ্য মনে হয়। এজেন্টের নির্ভরযোগ্যতা একটি সংখ্যা নয়, বরং собеседникের ধরন ও ব্যর্থতার ধরন অনুযায়ী একটি বিন্যাস। সিমুলেটর AgentWorld এই বিন্যাস মাপা যায় — অনুমান করা নয় — তার দিকে প্রথম গুরুতর পদক্ষেপ নেয়।
নিবন্ধের v1 সংস্করণ প্রকাশিত হয় 2026 সালের 25 আগস্ট, বর্তমান v2 2026 সালের 26 আগস্ট (আয়তন 1,710 KB); DOI — 10.48550/arXiv.2608.24076, বিষয়শ্রেণি — cs.AI।



