আধুনিক AI-এজেন্টরা সাধারণ অফিসের কাজগুলো মোটামুটি ভালোভাবে সামলাতে পারে, কিন্তু তারা জটিল কর্পোরেট পরিবেশে—যেমন টেলিকম সেক্টরে—কাজ করার জন্য প্রস্তুত কিনা তা কীভাবে যাচাই করা যায়? এখানে সাধারণ পরীক্ষা যথেষ্ট নয়: বাস্তবসম্মত পরিস্থিতি দরকার, যেখানে থাকবে প্রকৃত নথি, ডেটাবেস এবং অস্বাভাবিক ব্যবহারকারীর প্রশ্ন। এই কারণেই তৈরি করা হয়েছে Telco-GAIA—একটি দ্বিভাষিক মাল্টিমোডাল বেঞ্চমার্ক, যা একটি প্রকৃত টেলিকম অপারেটরের ডেটার উপর ভিত্তি করে নির্মিত। এটি মূল্যায়ন করে যে একটি AI-এজেন্ট কতটা ভালোভাবে যুক্তি করতে পারে, টুল ব্যবহার করতে পারে এবং বিভিন্ন উৎস থেকে তথ্য আহরণ করতে পারে।
কেন এমন বেঞ্চমার্ক প্রয়োজন
AI-এজেন্টদের জন্য বেশিরভাগ ওপেন-সোর্স পরীক্ষা ধাঁধাঁর মতো: সেগুলো হয় খুব কৃত্রিম, অথবা কর্পোরেট ডেটার সাথে প্রকৃত কাজের প্রয়োজন হয় না। Telco-GAIA এই শূন্যতা পূরণ করে। এর প্রশ্নগুলো এমনভাবে সাজানো হয়েছে যাতে এজেন্ট টেলিকম অপারেটরদের কর্মীদের পরিচিত কাজগুলোর মুখোমুখি হয়: ওয়েবসাইটে তথ্য খুঁজে বের করা, ডেটাবেসের রেকর্ডের সাথে তা মিলিয়ে দেখা, আর্কাইভ নথিতে বিবরণ যাচাই করা। এটি মডেলের স্মৃতিশক্তি পরীক্ষা নয়, বরং একাধিক উৎস নিয়ে কাজ করার এবং সিদ্ধান্তে পৌঁছানোর ক্ষমতা পরীক্ষা।
বেঞ্চমার্কটি দ্বিভাষিক: সমস্ত কাজ ইংরেজি এবং আরবি ভাষায় তৈরি। এই পছন্দ আকস্মিক নয়—এটি এমন একটি অঞ্চলের অপারেটরদের প্রকৃত চাহিদা প্রতিফলিত করে যেখানে আরবি কাজের ভাষা, কিন্তু অভ্যন্তরীণ ডকুমেন্টেশনের একটি বড় অংশ ইংরেজিতে রয়ে গেছে।
Telco-GAIA-এর ভিতরে কী আছে
বেঞ্চমার্কটিতে ১০০টি প্রশ্ন-উত্তর ভিত্তিক কাজ অন্তর্ভুক্ত রয়েছে, যার প্রতিটি একজন মানুষ যাচাই করেছেন। গুরুত্বপূর্ণ বিষয় হল, কাজগুলোর জন্য এক-শব্দের উত্তর নয়, বরং যৌক্তিক ধাপের একটি সিরিজ প্রয়োজন—গড়ে ৪.২টি ধাপ। সমস্ত প্রশ্ন মোডালিটির ধরন অনুসারে ভাগ করা হয়েছে: টেক্সট, টেবিল এবং গ্রাফিক্স। এর অর্থ হল, মডেলটিকে PDF ডকুমেন্ট, ছবি বা SQL কোয়েরির কাঠামো—সবকিছুর সাথে সমানভাবে দক্ষতার সাথে কাজ করতে হবে।

কাজটি সমাধান করতে, এজেন্টকে তিনটি ভিন্নধর্মী উৎসের দিকে যেতে হবে:
- অপারেটরের ওয়েবসাইটের স্ট্যাটিক স্ন্যাপশট — HTML পেজ, ছবি এবং সম্পর্কিত PDF ফাইল।
- সিন্থেটিক রিলেশনাল ডেটাবেস — এর কাঠামো অপারেটরের অভ্যন্তরীণ সিস্টেমের অনুকরণ করে, তবে এতে থাকা ডেটা প্রকাশের জন্য নিরাপদ।
- বাহ্যিক ওয়েব আর্কাইভ — অতিরিক্ত উপকরণ যা তথ্য যাচাই বা প্রসঙ্গ স্পষ্ট করার জন্য প্রয়োজন হতে পারে।
পরীক্ষা কীভাবে কাজ করে
Telco-GAIA-এর অন্যতম প্রধান নীতি হলো বস্তুনিষ্ঠতা। লেখকরা আধুনিক LLM-জাজ ব্যবহার করতে অস্বীকার করেছেন, যেখানে একটি মডেল অন্য মডেলের উত্তর মূল্যায়ন করে। এর পরিবর্তে, নরমালাইজড সঠিক স্ট্রিং তুলনা ব্যবহার করা হয় এবং পুরো বেঞ্চমার্কটি একটি বিচ্ছিন্ন Docker পরিবেশে প্যাকেজ করা হয়েছে। এর অর্থ হল, ফলাফল নির্দিষ্ট মেশিন বা লাইব্রেরির সংস্করণের উপর নির্ভর করে না: কন্টেইনার চালু করলেই একই সংখ্যা পাওয়া যায়। এই পদ্ধতি মূল্যায়নকে নির্ধারক এবং পুনরুত্পাদনযোগ্য করে তোলে, যা গবেষণা এবং বিভিন্ন মডেলের তুলনার জন্য অত্যন্ত গুরুত্বপূর্ণ।

পরীক্ষাগুলো কী দেখিয়েছে
ডেভেলপাররা বেঞ্চমার্কের মাধ্যমে বারোটি ভিন্ন মডেল সহ একটি রেফারেন্স এজেন্ট চালিয়েছেন—বাণিজ্যিক এবং ওপেন-সোর্স উভয় ধরনের। ফলাফল সংযত ছিল: এমনকি সবচেয়ে শক্তিশালী মডেলটি মাত্র ৭১% কাজ সম্পন্ন করতে পেরেছে। যদি টুল-কলের বাজেট মাঝারি পর্যায়ে সীমিত করা হয়, ফলাফল প্রায় ৪০% এ নেমে আসে। অন্য কথায়, এজেন্ট লক্ষণীয়ভাবে "কোণা কাটতে" শুরু করে: অতিরিক্ত পদক্ষেপ নেয় না, বিবরণ যাচাই করে না এবং অস্বাভাবিক ক্ষেত্রে প্রায়শই ভুল করে।
মডেলগুলো বিশেষ করে সেই বিভাগগুলিতে দুর্বল যেখানে ভিজ্যুয়াল তথ্য—ছবি এবং গ্রাফিক্স—ব্যবহার করা প্রয়োজন। সেখানে গড় ফলাফল ৩০% এর নিচে। এটি দেখায় যে ছবিসহ নথি বোঝা এখনও AI-এজেন্টদের জন্য একটি গুরুতর উন্নতির ক্ষেত্র। সামগ্রিকভাবে, Telco-GAIA কর্পোরেট এজেন্টের প্রত্যাশা এবং আধুনিক LLM-এর প্রকৃত ক্ষমতার মধ্যে একটি উল্লেখযোগ্য ব্যবধান চিহ্নিত করে।
উপসংহার
Telco-GAIA শুধু গবেষণার জন্য আরেকটি বেঞ্চমার্ক নয়। এটি এমন কোম্পানিগুলির জন্য একটি ব্যবহারিক হাতিয়ার যারা নিজস্ব AI-এজেন্ট তৈরি করছে এবং তাদের সীমাবদ্ধতা আগে থেকেই বুঝতে চায়। পুনরুত্পাদনযোগ্য পরিবেশ এবং যাচাইকৃত কাজের কারণে এটি একটি অভ্যন্তরীণ মান নিয়ন্ত্রণ হিসাবে ব্যবহার করা যেতে পারে।
অধিকন্তু, Telco-GAIA-তে অন্তর্নিহিত পদ্ধতিটি ব্যাংক থেকে লজিস্টিকস পর্যন্ত অন্যান্য বদ্ধ ডোমেইনে সহজেই অভিযোজিত। ফরম্যাটটি একটি প্রস্তুত টেমপ্লেট দেয়: প্রকৃত ডেটা নেওয়া, সাবধানে সেগুলোকে ডি-আইডেন্টিফাই করা, স্বাধীন উৎসে ভাগ করা এবং এমন একটি পরিবেশ তৈরি করা যেখানে এজেন্ট তার যুক্তির দক্ষতা প্রদর্শন করতে পারে। বাজারের জন্য এটিই প্রয়োজনীয় পরিবর্তন: সাধারণ জ্ঞান পরীক্ষা থেকে বিশ্বাসযোগ্য কর্পোরেট ডেটার উপর ব্যবহারিক দক্ষতা যাচাইয়ের দিকে।



