কেন বড় মাল্টি-এজেন্ট টিম আটকে যায়
যখন LLM-এজেন্টগুলো ডেভেলপমেন্টে ব্যাপকভাবে ব্যবহার করা শুরু হয়, অনেক টিম যুক্তিসঙ্গত কিন্তু সবসময় কার্যকর নয় এমন একটি পথ বেছে নেয়: যতটা সম্ভব অ্যালগরিদমিক "বিশেষজ্ঞ" নিয়োগ করা এবং তাদের মধ্যে ভূমিকা বণ্টন করা। একজন কোড লেখে, দ্বিতীয়জন দুর্বলতা খোঁজে, তৃতীয়জন স্ক্রিপ্ট যাচাই করে। সমস্যা হলো, প্রতিটি নতুন এজেন্ট আগেরটির চেয়ে কম মূল্য যোগ করে: পুরো রিপোজিটরি-স্তরের কাজে, সমন্বয়ের খরচ দ্রুত "অতিরিক্ত হাতের" সুবিধাকে ছাড়িয়ে যায়।

এর প্রতিক্রিয়ায় একটি বিপরীতমুখী প্রবণতা দেখা দেয়: এজেন্টদের সাব-এজেন্টে রূপান্তরিত করা হয় — বাধ্য টুলস, যেগুলো প্রয়োজনে ডাকা হয় এবং সংলাপে জড়ায় না। এই পদ্ধতি বিশৃঙ্খলা দূর করে, কিন্তু এর সাথে সাথে সম্মিলিত কাজের প্রধান সম্পদকেও ধ্বংস করে দেয়: কেউ আর অন্যের সিদ্ধান্তকে চ্যালেঞ্জ করে না, ফলে ভুলগুলো অলক্ষিত থেকে যায়।
সামঞ্জস্যের বিন্দু: ন্যূনতম সহযোগিতা
সুবর্ণ গড় খোঁজার কাজটি নিয়েছিলেন Eric S. Qiu এবং Joyce Gill তাদের গবেষণাপত্রে «Adversarial Review: Structured Disagreement for Grounded Agentic Code Review» (arXiv:2608.18167, cs.AI এবং cs.SE ক্যাটাগরি; ১৬ আগস্ট ২০২৬-এ জমা দেওয়া, ICML 2026 Workshop on DL4C-তে গৃহীত)। তাদের অনুমান সহজ: সাব-এজেন্ট আর্কিটেকচারের সরলতা বজায় রাখা যায়, কিন্তু এতে ন্যূনতম সহযোগিতা যোগ করা যায় — একটি নোড, যেখানে এজেন্টদের মতামত ইচ্ছাকৃতভাবে সংঘর্ষে লিপ্ত হয়।
ফলস্বরূপ তৈরি হয়েছে Adversarial Review (AR) প্রোটোকল। লেখকরা ইচ্ছাকৃতভাবে জটিল শ্রেণিবিন্যাস তৈরি করেননি এবং অসংখ্য ভূমিকা সৃষ্টি করেননি। পরিবর্তে, তিনজন অংশগ্রহণকারী কাজ করে:
- কোডিং এজেন্ট কোডে পরিবর্তন প্রস্তুত করে;
- রিভিউয়ার মূল্যায়ন করে যে এই পরিবর্তনগুলো কতটা সঠিক;
- সমালোচক কোড নয়, বরং রিভিউটিকেই অডিট করে এবং এর দুর্বল দিকগুলো খুঁজে বের করে।
সমালোচক শুধু "আমি একমত নই" বলেন না — তিনি কাঠামোগত মতভেদ উপস্থাপন করেন: তিনি কোডের নির্দিষ্ট অংশগুলো নির্দেশ করেন যা রিভিউয়ারের সিদ্ধান্তকে সমর্থন করে না। এবং শুধুমাত্র এই চক্রটি সম্পন্ন হলে, মূল এজেন্ট পরিবর্তন আনার অনুমতি পায়।

পরীক্ষায় কী দেখা গেল
মতভেদের প্রভাব বেঞ্চমার্কের ফলাফলে স্পষ্টভাবে দৃশ্যমান।
LiveCodeBench-এ AR পরীক্ষিত সকল পদ্ধতির মধ্যে সফল উত্তীর্ণের সর্বোচ্চ হার দেখিয়েছে। একটি গুরুত্বপূর্ণ বিষয়: এর জন্য তিনটি এজেন্টই যথেষ্ট ছিল, যেখানে AR যে বেসলাইন সংস্করণকে ছাড়িয়ে গেছে, সেটি পাঁচটি ব্যবহার করেছিল।
SWE-PRBench-এ পরিস্থিতি আরও আকর্ষণীয় ছিল। প্রোটোকলের নিষ্পাপ সংস্করণটি অপ্রত্যাশিতভাবে একটি ব্যর্থতার মোড উন্মোচন করে, যাকে লেখকরা মিথ্যা ঐকমত্য নাম দিয়েছেন: এজেন্টরা পর্যাপ্ত প্রমাণ ছাড়াই একটি সাধারণ মতামতে পৌঁছেছিল। অর্থাৎ, এমনকি বিশেষভাবে নির্মিত মতভেদও একটি আনুষ্ঠানিক "সবার সাথে একমত"-এ পরিণত হতে পারে। এটি প্রম্পটের একটি মাত্র ইটারেশন দিয়ে নিরাময় হয়, যেখানে তর্ক করা এবং মতভেদের যুক্তি দেওয়ার প্রয়োজনীয়তা স্পষ্টভাবে উল্লেখ করা থাকে — এই উন্নতির পর পদ্ধতিটি F1-এ প্রথম স্থান অর্জন করে।
সবশেষে, SWE-bench Verified-এ AR আবারও বেসলাইন পদ্ধতির ফলাফল উন্নত করেছে। এটি গুরুত্বপূর্ণ, কারণ রিপোজিটরি-স্তরের কাজগুলো বিচ্ছিন্ন ফাংশনের চেয়ে সম্পূর্ণ ভিন্ন মাত্রার জটিলতা: একটি মডিউলের পরিবর্তন পার্শ্ববর্তী ডজনখানেক মডিউল ভেঙে দিতে পারে।
উপসংহার: শক্তি আসে ভোটের সংখ্যা থেকে নয়, বরং আপত্তি করার অধিকার থেকে
লেখকরা একটি স্বজ্ঞাবিরোধী, কিন্তু পরীক্ষা-নিরীক্ষায় নিশ্চিত সিদ্ধান্তে পৌঁছেছেন: কার্যকর কোড-রিভিউয়ের জন্য বড় টিম বা জটিল যোগাযোগ কাঠামোর প্রয়োজন হয় না। মতভেদ থাকলেই যথেষ্ট, যদি তা হয়:
- ন্যূনতম — একটি সংঘর্ষের বিন্দু, অসীম চ্যাট নয়;
- কাঠামোগত — প্রতিটি অংশগ্রহণকারীর নিজস্ব স্পষ্ট কাজ আছে;
- প্রমাণ-ভিত্তিক — আপত্তি কোডের তথ্যের উপর ভিত্তি করে, ব্যক্তিগত পছন্দের উপর নয়।
যারা এজেন্ট পাইপলাইন তৈরি করছেন, তাদের জন্য ব্যবহারিক শিক্ষা: ভূমিকা যোগ করে সমস্যা সমাধানের চেষ্টা করবেন না। বরং প্রক্রিয়ায় সন্দেহের একটি বাধ্যতামূলক পর্যায় অন্তর্ভুক্ত করুন — এবং একজন এজেন্টকে অন্যজনের সিদ্ধান্তকে আনুষ্ঠানিকভাবে চ্যালেঞ্জ করার অনুমতি দিন। রিভিউয়ের মূল্য নির্ধারিত হয় ভোটের সংখ্যা দিয়ে নয়, বরং এমন কারও উপস্থিতি দিয়ে, যে মূল বিষয়ে আপত্তি জানাতে সক্ষম।



