আদর্শ ডেমো থেকে জীবন্ত ওয়েবসাইট
AI-ভিত্তিক ব্রাউজার অ্যাসিস্ট্যান্টরা ছোট এবং পরিষ্কার স্ক্রিপ্টে আত্মবিশ্বাসের সাথে কাজ করে: পণ্য খুঁজে বের করা, অর্ডার সম্পন্ন করা, ফর্ম পূরণ করা। কিন্তু যখনই এমন একটি এজেন্ট আসল ওয়েবসাইটে পৌঁছায় — ধীর লোডিং, অপ্রত্যাশিত পপ-আপ উইন্ডো, পরিবর্তনশীল লেআউট এবং ডজনখানেক মাঝামাঝি ক্লিক সহ — ছবিটা বদলে যায়। বাস্তবে, AI-কে দীর্ঘ কর্মপ্রবাহ জুড়ে লক্ষ্য ধরে রাখতে হয়, নিজের ভুল লক্ষ্য করে সেগুলো সংশোধন করতে হয় এবং জটিল ইন্টারফেস বুঝতে হয়।
অনুশীলনে "দীর্ঘ স্ক্রিপ্ট" বলতে কী বোঝায়? এটি একটি ক্লিক নয়, এমনকি দশটিও নয়: এজেন্টকে কাঙ্ক্ষিত ফলাফলে পৌঁছানোর আগে ৩০–৪০ বা তার বেশি ধাপ সম্পাদন করতে হতে পারে। প্রতিটি ধাপ আগের ধাপের উপর নির্ভরশীল, এবং একটি ভুল সমস্ত প্রচেষ্টা নষ্ট করে দিতে পারে। তাছাড়া, আসল ওয়েবপেজগুলো ক্রমাগত পরিবর্তিত হয়: লেআউট "ভেসে যায়", নতুন উপাদান দেখা দেয়, এবং ডেটা অ্যাসিঙ্ক্রোনাসভাবে লোড হয়। স্থির ডেমোতে প্রশিক্ষিত একটি মডেল এমন পরিস্থিতিতে হারিয়ে যায়।
সমস্যা হলো, বেশিরভাগ বিদ্যমান পদ্ধতি সরলীকৃত ডেমোতে প্রশিক্ষিত এবং এই স্তরের জটিলতার জন্য তৈরি নয়। এখানে মডেলের সহজ স্কেলিং সাহায্য করে না: ল্যাবের অবস্থা এবং আসল ওয়েবের মধ্যে ব্যবধান পুরো পাইপলাইন পুনর্বিবেচনার দাবি রাখে — কর্ম সম্পাদন থেকে চূড়ান্ত মূল্যায়ন পর্যন্ত।

দীর্ঘ হরাইজনগুলির জন্য একটি ইউনিফাইড ফ্রেমওয়ার্ক
AIMAE টিম নিজেদের ঠিক এই কাজটিই নির্ধারণ করেছে, Wuying-Browser-Agent উপস্থাপন করে — একটি ওপেন-সোর্স ফ্রেমওয়ার্ক যা ব্রাউজার এজেন্টের কাজের সমস্ত স্তর কভার করে। শুধুমাত্র একটি অংশে ফোকাস করার পরিবর্তে, লেখকরা এক্সিকিউশন, নিয়ন্ত্রণ, অপ্টিমাইজেশন এবং মূল্যায়নকে সারিবদ্ধ করেছেন।
আসুন প্রতিটি স্তর বিস্তারিতভাবে দেখি। এক্সিকিউশন — এটি হলো এজেন্ট পৃষ্ঠার সাথে যেভাবে ইন্টারঅ্যাক্ট করে: ক্লিক করা, টেক্সট প্রবেশ করানো, ট্যাব স্যুইচ করা। নিয়ন্ত্রণ — কর্ম পর্যবেক্ষণ করা এবং কিছু ভুল হলে সময়মতো হস্তক্ষেপ করা। অপ্টিমাইজেশন — শেখার প্রক্রিয়া যা মডেলকে সফল ট্র্যাজেক্টোরিতে টিউন করে। এবং অবশেষে, মূল্যায়ন — আসল ওয়েবে এজেন্ট কতটা ভালো কাজ করে তা পরিমাপ করার একটি উপায়। এই সমস্ত স্তরকে সমন্বিতভাবে কাজ করতে হবে, অন্যথায় দীর্ঘ দূরত্বে সিস্টেমটি ভেঙে পড়ে।
তিনটি মূল উপাদান সিস্টেমের কাজ নিশ্চিত করে:
- স্ট্রাকচার্ড ব্রাউজার হার্নেস — কর্ম সম্পাদনের জন্য স্থিতিশীল প্রিমিটিভের একটি সেট। এটি এজেন্টকে একটি অনুমানযোগ্য পরিবেশ দেয় এবং সিদ্ধান্ত গ্রহণের উপর দৃষ্টি রেখে প্রসঙ্গ পরিচালনা করতে সাহায্য করে। অবিশ্বস্ত সিলেক্টর বা এলোমেলো টাইমিংয়ের উপর নির্ভর না করে, এজেন্ট স্পষ্ট কমান্ড পায় যা অভিন্নভাবে সম্পাদিত হয়।
- RUIC-SFT — ত্রুটি পুনরুদ্ধারের ট্র্যাজেক্টোরি এবং জটিল ইন্টারফেস উপাদানগুলির সাথে মিথস্ক্রিয়ায় তত্ত্বাবধানে টিউনিংয়ের একটি পদ্ধতি। মডেলটি কেবল সফল চেইনেই নয়, কীভাবে মৃতপ্রায় অবস্থা থেকে বেরিয়ে আসতে হয় তাও শেখে।
- DAO-GRPO — একটি অপ্টিমাইজেশন অ্যালগরিদম যা সম্ভাব্য রিওয়ার্ড শেপিং এবং ডাইভারজেন্স অনুসারে ধাপগুলির ওজন নির্ধারণের মাধ্যমে দীর্ঘ হরাইজনগুলিতে "ক্রেডিট" বিতরণ উন্নত করে। প্রতিটি কর্মকে বিচ্ছিন্নভাবে নয়, বরং সামগ্রিক ফলাফলে তার অবদানের পরিপ্রেক্ষিতে মূল্যায়ন করা হয়।
এই পদ্ধতিটি মডেলকে কেবল নিখুঁত ধাপ সম্পাদন করতে দেয় না, বরং বাস্তব বাধাগুলির প্রতি সাড়া দিতে এবং বুঝতে দেয় কোন কর্মগুলি সত্যিই তাকে লক্ষ্যের দিকে এগিয়ে নিয়ে যায়। ফ্রেমওয়ার্কটি ইতিমধ্যেই দেখাচ্ছে যে পাইপলাইন সারিবদ্ধকরণ মডেলের আকার বাড়ানোর চেয়ে বেশি প্রভাব দেয়।

BrowserBench: বাস্তব দৈর্ঘ্যের পরীক্ষা
এজেন্ট সত্যিই আসল ওয়েবের জন্য প্রস্তুত কিনা তা কীভাবে যাচাই করা যায়? বিদ্যমান বেঞ্চমার্কগুলি প্রায়শই খুব ছোট এবং দীর্ঘ দূরত্বে বৈশিষ্ট্যগত ব্যর্থতা প্রকাশ করে না। একটি সাধারণ পরীক্ষায় ৫–১০টি ধাপ থাকতে পারে, যেখানে বাস্তব জীবনে এজেন্টকে অনেক বেশি সময় কাজ করতে হয়। তাই টিমটি নিজস্ব — BrowserBench তৈরি করেছে। এটি আসল ওয়েবসাইট থেকে নেওয়া ৩৫০টি কাজের একটি দ্বিভাষিক সেট, যার গড় স্ক্রিপ্ট দৈর্ঘ্য প্রায় ৩৮ ধাপ।
এই দৈর্ঘ্যই মূল পার্থক্য। ছোট কাজগুলিতে এজেন্ট প্রায় এলোমেলোভাবে কাজ করতে পারে এবং তবুও উচ্চ ফলাফল পেতে পারে। দীর্ঘ কাজগুলিতে, প্রতিটি ভুল জমা হয়, এবং সঠিক "ক্রেডিট" বিতরণ ছাড়া সিস্টেমটি দ্রুত পথ হারায়। BrowserBench এই ব্যর্থতাগুলি দেখতে এবং কোন প্রক্রিয়াগুলি উন্নত করা দরকার তা বুঝতে সাহায্য করে।
ফলাফল নিজেদের পক্ষে কথা বলে। ২৭ বিলিয়ন প্যারামিটার সহ Wuying-Browser-Agent WebVoyager-এ ৮০.৬%, Online-Mind2Web-এ ৬৬.৭% এবং BrowserBench-এ ৬৫.১% অর্জন করে — এটি ব্রাউজার ব্যবহারের বেঞ্চমার্কগুলিতে একটি নতুন ওপেন-সোর্স রেকর্ড। একই পাইপলাইন অন্যান্য ক্ষেত্রেও সফলভাবে স্থানান্তরিত হয়: Tau2-Bench, Claw-Eval এবং BFCL-v4 সেটগুলিতে গড় স্কোর ৭৩.৮।
উল্লেখযোগ্যভাবে, সাফল্য একটি নির্দিষ্ট কাজে নয়, বরং একাধিক স্বাধীন পরীক্ষায় একসাথে অর্জিত হয়। এর অর্থ হলো ফ্রেমওয়ার্কটি ওয়েব ইন্টারফেসের সাথে কাজ করার সাধারণ নীতিগুলি আয়ত্ত করে, একটি নির্দিষ্ট বেঞ্চমার্কের সাথে খাপ খাওয়ায় না। ভালো সাধারণীকরণযোগ্যতা একটি লক্ষণ যে এজেন্ট সত্যিই বুঝতে পারে সে কী করছে, কেবল প্যাটার্ন মুখস্থ করছে না।

AI-এজেন্টের বিকাশের জন্য এর অর্থ কী
প্রধান সিদ্ধান্তটি নির্দিষ্ট সংখ্যায় নয়, যদিও সেগুলি চিত্তাকর্ষক। পদ্ধতিটিই বেশি গুরুত্বপূর্ণ: এজেন্টকে বাস্তব জগতে কাজ করতে হলে, পরিষ্কার ডেমোতে পৃথক রেকর্ডের পেছনে ছুটে না গিয়ে পুরো সিস্টেমটিকে দীর্ঘ, জটিল স্ক্রিপ্টের জন্য তৈরি করতে হবে। Wuying-Browser-Agent দেখায় যে এটি অর্জনযোগ্য, তাও ওপেন-সোর্স আকারে — গবেষকরা এর ফলাফল পুনরুত্পাদন করতে এবং আরও বিকাশ করতে পারেন।
এই পদ্ধতির ব্যবহারিক মূল্যও রয়েছে। কল্পনা করুন আপনাকে দশটি সাইটের শর্ত তুলনা করতে হবে, টিকিট বুক করতে হবে বা একটি দীর্ঘ ফর্ম পূরণ করতে হবে। এখন এটি ম্যানুয়ালি করতে হয়, কারণ কোনো অ্যাসিস্ট্যান্ট এত দীর্ঘ সময় প্রসঙ্গ ধরে রাখতে পারে না। Wuying-Browser-Agent-এর মতো ফ্রেমওয়ার্কের সাথে, এই ধরনের কাজ অদূর ভবিষ্যতে স্বয়ংক্রিয় হতে পারে।
ব্রাউজার এজেন্টরা ল্যাব পরীক্ষা হতে থেমে ব্যবহারিক হাতিয়ারে পরিণত হচ্ছে। এখন শুধু অপেক্ষা করতে হবে যখন এই সিস্টেমগুলি সাধারণ ব্রাউজারে আসবে এবং রুটিন কাজের দায়িত্ব নেবে — কেনাকাটা থেকে ডকুমেন্ট পূরণ পর্যন্ত। এবং এই ফ্রেমওয়ার্কের বিচারে, অপেক্ষা বেশি দীর্ঘ নয়।



