উইং-ব্রাউজার-এজেন্ট: ব্রাউজার-ভিত্তিক AI যা বাস্তব ওয়েবে দীর্ঘ কাজের ধারা সামলাতে পারে

27 আগস্ট 2026১৫ প্রদর্শন

গবেষকরা একটি ওপেন-সোর্স ফ্রেমওয়ার্ক উপস্থাপন করেছেন যা একটি স্থিতিশীল ব্রাউজার হারনেস, ত্রুটি-পুনরুদ্ধার-ভিত্তিক প্রশিক্ষণ এবং বিশেষ রিইনফোর্সমেন্ট লার্নিংকে একত্রিত করে। মডেলটি WebVoyager, Online-Mind2Web এবং নতুন BrowserBench বেঞ্চমার্কে রেকর্ড-ব্রেকিং ফলাফল দেখায় এবং পদ্ধতিটি ব্রাউজারের বাইরের কাজেও প্রযোজ্য।

উইং-ব্রাউজার-এজেন্ট: ব্রাউজার-ভিত্তিক AI যা বাস্তব ওয়েবে দীর্ঘ কাজের ধারা সামলাতে পারে

আদর্শ ডেমো থেকে জীবন্ত ওয়েবসাইট

AI-ভিত্তিক ব্রাউজার অ্যাসিস্ট্যান্টরা ছোট এবং পরিষ্কার স্ক্রিপ্টে আত্মবিশ্বাসের সাথে কাজ করে: পণ্য খুঁজে বের করা, অর্ডার সম্পন্ন করা, ফর্ম পূরণ করা। কিন্তু যখনই এমন একটি এজেন্ট আসল ওয়েবসাইটে পৌঁছায় — ধীর লোডিং, অপ্রত্যাশিত পপ-আপ উইন্ডো, পরিবর্তনশীল লেআউট এবং ডজনখানেক মাঝামাঝি ক্লিক সহ — ছবিটা বদলে যায়। বাস্তবে, AI-কে দীর্ঘ কর্মপ্রবাহ জুড়ে লক্ষ্য ধরে রাখতে হয়, নিজের ভুল লক্ষ্য করে সেগুলো সংশোধন করতে হয় এবং জটিল ইন্টারফেস বুঝতে হয়।

অনুশীলনে "দীর্ঘ স্ক্রিপ্ট" বলতে কী বোঝায়? এটি একটি ক্লিক নয়, এমনকি দশটিও নয়: এজেন্টকে কাঙ্ক্ষিত ফলাফলে পৌঁছানোর আগে ৩০–৪০ বা তার বেশি ধাপ সম্পাদন করতে হতে পারে। প্রতিটি ধাপ আগের ধাপের উপর নির্ভরশীল, এবং একটি ভুল সমস্ত প্রচেষ্টা নষ্ট করে দিতে পারে। তাছাড়া, আসল ওয়েবপেজগুলো ক্রমাগত পরিবর্তিত হয়: লেআউট "ভেসে যায়", নতুন উপাদান দেখা দেয়, এবং ডেটা অ্যাসিঙ্ক্রোনাসভাবে লোড হয়। স্থির ডেমোতে প্রশিক্ষিত একটি মডেল এমন পরিস্থিতিতে হারিয়ে যায়।

সমস্যা হলো, বেশিরভাগ বিদ্যমান পদ্ধতি সরলীকৃত ডেমোতে প্রশিক্ষিত এবং এই স্তরের জটিলতার জন্য তৈরি নয়। এখানে মডেলের সহজ স্কেলিং সাহায্য করে না: ল্যাবের অবস্থা এবং আসল ওয়েবের মধ্যে ব্যবধান পুরো পাইপলাইন পুনর্বিবেচনার দাবি রাখে — কর্ম সম্পাদন থেকে চূড়ান্ত মূল্যায়ন পর্যন্ত।

দীর্ঘ হরাইজনগুলির জন্য একটি ইউনিফাইড ফ্রেমওয়ার্ক

AIMAE টিম নিজেদের ঠিক এই কাজটিই নির্ধারণ করেছে, Wuying-Browser-Agent উপস্থাপন করে — একটি ওপেন-সোর্স ফ্রেমওয়ার্ক যা ব্রাউজার এজেন্টের কাজের সমস্ত স্তর কভার করে। শুধুমাত্র একটি অংশে ফোকাস করার পরিবর্তে, লেখকরা এক্সিকিউশন, নিয়ন্ত্রণ, অপ্টিমাইজেশন এবং মূল্যায়নকে সারিবদ্ধ করেছেন।

আসুন প্রতিটি স্তর বিস্তারিতভাবে দেখি। এক্সিকিউশন — এটি হলো এজেন্ট পৃষ্ঠার সাথে যেভাবে ইন্টারঅ্যাক্ট করে: ক্লিক করা, টেক্সট প্রবেশ করানো, ট্যাব স্যুইচ করা। নিয়ন্ত্রণ — কর্ম পর্যবেক্ষণ করা এবং কিছু ভুল হলে সময়মতো হস্তক্ষেপ করা। অপ্টিমাইজেশন — শেখার প্রক্রিয়া যা মডেলকে সফল ট্র্যাজেক্টোরিতে টিউন করে। এবং অবশেষে, মূল্যায়ন — আসল ওয়েবে এজেন্ট কতটা ভালো কাজ করে তা পরিমাপ করার একটি উপায়। এই সমস্ত স্তরকে সমন্বিতভাবে কাজ করতে হবে, অন্যথায় দীর্ঘ দূরত্বে সিস্টেমটি ভেঙে পড়ে।

তিনটি মূল উপাদান সিস্টেমের কাজ নিশ্চিত করে:

  • স্ট্রাকচার্ড ব্রাউজার হার্নেস — কর্ম সম্পাদনের জন্য স্থিতিশীল প্রিমিটিভের একটি সেট। এটি এজেন্টকে একটি অনুমানযোগ্য পরিবেশ দেয় এবং সিদ্ধান্ত গ্রহণের উপর দৃষ্টি রেখে প্রসঙ্গ পরিচালনা করতে সাহায্য করে। অবিশ্বস্ত সিলেক্টর বা এলোমেলো টাইমিংয়ের উপর নির্ভর না করে, এজেন্ট স্পষ্ট কমান্ড পায় যা অভিন্নভাবে সম্পাদিত হয়।
  • RUIC-SFT — ত্রুটি পুনরুদ্ধারের ট্র্যাজেক্টোরি এবং জটিল ইন্টারফেস উপাদানগুলির সাথে মিথস্ক্রিয়ায় তত্ত্বাবধানে টিউনিংয়ের একটি পদ্ধতি। মডেলটি কেবল সফল চেইনেই নয়, কীভাবে মৃতপ্রায় অবস্থা থেকে বেরিয়ে আসতে হয় তাও শেখে।
  • DAO-GRPO — একটি অপ্টিমাইজেশন অ্যালগরিদম যা সম্ভাব্য রিওয়ার্ড শেপিং এবং ডাইভারজেন্স অনুসারে ধাপগুলির ওজন নির্ধারণের মাধ্যমে দীর্ঘ হরাইজনগুলিতে "ক্রেডিট" বিতরণ উন্নত করে। প্রতিটি কর্মকে বিচ্ছিন্নভাবে নয়, বরং সামগ্রিক ফলাফলে তার অবদানের পরিপ্রেক্ষিতে মূল্যায়ন করা হয়।

এই পদ্ধতিটি মডেলকে কেবল নিখুঁত ধাপ সম্পাদন করতে দেয় না, বরং বাস্তব বাধাগুলির প্রতি সাড়া দিতে এবং বুঝতে দেয় কোন কর্মগুলি সত্যিই তাকে লক্ষ্যের দিকে এগিয়ে নিয়ে যায়। ফ্রেমওয়ার্কটি ইতিমধ্যেই দেখাচ্ছে যে পাইপলাইন সারিবদ্ধকরণ মডেলের আকার বাড়ানোর চেয়ে বেশি প্রভাব দেয়।

BrowserBench: বাস্তব দৈর্ঘ্যের পরীক্ষা

এজেন্ট সত্যিই আসল ওয়েবের জন্য প্রস্তুত কিনা তা কীভাবে যাচাই করা যায়? বিদ্যমান বেঞ্চমার্কগুলি প্রায়শই খুব ছোট এবং দীর্ঘ দূরত্বে বৈশিষ্ট্যগত ব্যর্থতা প্রকাশ করে না। একটি সাধারণ পরীক্ষায় ৫–১০টি ধাপ থাকতে পারে, যেখানে বাস্তব জীবনে এজেন্টকে অনেক বেশি সময় কাজ করতে হয়। তাই টিমটি নিজস্ব — BrowserBench তৈরি করেছে। এটি আসল ওয়েবসাইট থেকে নেওয়া ৩৫০টি কাজের একটি দ্বিভাষিক সেট, যার গড় স্ক্রিপ্ট দৈর্ঘ্য প্রায় ৩৮ ধাপ।

এই দৈর্ঘ্যই মূল পার্থক্য। ছোট কাজগুলিতে এজেন্ট প্রায় এলোমেলোভাবে কাজ করতে পারে এবং তবুও উচ্চ ফলাফল পেতে পারে। দীর্ঘ কাজগুলিতে, প্রতিটি ভুল জমা হয়, এবং সঠিক "ক্রেডিট" বিতরণ ছাড়া সিস্টেমটি দ্রুত পথ হারায়। BrowserBench এই ব্যর্থতাগুলি দেখতে এবং কোন প্রক্রিয়াগুলি উন্নত করা দরকার তা বুঝতে সাহায্য করে।

ফলাফল নিজেদের পক্ষে কথা বলে। ২৭ বিলিয়ন প্যারামিটার সহ Wuying-Browser-Agent WebVoyager-এ ৮০.৬%, Online-Mind2Web-এ ৬৬.৭% এবং BrowserBench-এ ৬৫.১% অর্জন করে — এটি ব্রাউজার ব্যবহারের বেঞ্চমার্কগুলিতে একটি নতুন ওপেন-সোর্স রেকর্ড। একই পাইপলাইন অন্যান্য ক্ষেত্রেও সফলভাবে স্থানান্তরিত হয়: Tau2-Bench, Claw-Eval এবং BFCL-v4 সেটগুলিতে গড় স্কোর ৭৩.৮।

উল্লেখযোগ্যভাবে, সাফল্য একটি নির্দিষ্ট কাজে নয়, বরং একাধিক স্বাধীন পরীক্ষায় একসাথে অর্জিত হয়। এর অর্থ হলো ফ্রেমওয়ার্কটি ওয়েব ইন্টারফেসের সাথে কাজ করার সাধারণ নীতিগুলি আয়ত্ত করে, একটি নির্দিষ্ট বেঞ্চমার্কের সাথে খাপ খাওয়ায় না। ভালো সাধারণীকরণযোগ্যতা একটি লক্ষণ যে এজেন্ট সত্যিই বুঝতে পারে সে কী করছে, কেবল প্যাটার্ন মুখস্থ করছে না।

AI-এজেন্টের বিকাশের জন্য এর অর্থ কী

প্রধান সিদ্ধান্তটি নির্দিষ্ট সংখ্যায় নয়, যদিও সেগুলি চিত্তাকর্ষক। পদ্ধতিটিই বেশি গুরুত্বপূর্ণ: এজেন্টকে বাস্তব জগতে কাজ করতে হলে, পরিষ্কার ডেমোতে পৃথক রেকর্ডের পেছনে ছুটে না গিয়ে পুরো সিস্টেমটিকে দীর্ঘ, জটিল স্ক্রিপ্টের জন্য তৈরি করতে হবে। Wuying-Browser-Agent দেখায় যে এটি অর্জনযোগ্য, তাও ওপেন-সোর্স আকারে — গবেষকরা এর ফলাফল পুনরুত্পাদন করতে এবং আরও বিকাশ করতে পারেন।

এই পদ্ধতির ব্যবহারিক মূল্যও রয়েছে। কল্পনা করুন আপনাকে দশটি সাইটের শর্ত তুলনা করতে হবে, টিকিট বুক করতে হবে বা একটি দীর্ঘ ফর্ম পূরণ করতে হবে। এখন এটি ম্যানুয়ালি করতে হয়, কারণ কোনো অ্যাসিস্ট্যান্ট এত দীর্ঘ সময় প্রসঙ্গ ধরে রাখতে পারে না। Wuying-Browser-Agent-এর মতো ফ্রেমওয়ার্কের সাথে, এই ধরনের কাজ অদূর ভবিষ্যতে স্বয়ংক্রিয় হতে পারে।

ব্রাউজার এজেন্টরা ল্যাব পরীক্ষা হতে থেমে ব্যবহারিক হাতিয়ারে পরিণত হচ্ছে। এখন শুধু অপেক্ষা করতে হবে যখন এই সিস্টেমগুলি সাধারণ ব্রাউজারে আসবে এবং রুটিন কাজের দায়িত্ব নেবে — কেনাকাটা থেকে ডকুমেন্ট পূরণ পর্যন্ত। এবং এই ফ্রেমওয়ার্কের বিচারে, অপেক্ষা বেশি দীর্ঘ নয়।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
উইং-ব্রাউজার-এজেন্ট: ব্রাউজার-ভিত্তিক AI যা বাস্তব ওয়েবে দীর্ঘ কাজের ধারা সামলাতে পারে