ভূমিকা: অতিরিক্ত কনফিগারেশনের সমস্যা
আধুনিক LLM-এজেন্টরা ক্রমবর্ধমানভাবে গুরুত্বপূর্ণ অবকাঠামো পরিচালনার দায়িত্ব নিচ্ছে — কুলিং সিস্টেম থেকে বিদ্যুৎ গ্রিড পর্যন্ত। কিন্তু এজেন্টের কাজ করার জন্য, তার একটি পরিবেশ প্রয়োজন যা উপলব্ধ ডেটা, টুল এবং অনুমোদিত ক্রিয়াকলাপ নির্ধারণ করে। বেশিরভাগ সিস্টেমে এই পরিবেশ সব কাজের জন্য একই: সম্পূর্ণ অনুমতির সেট, সমস্ত উপলব্ধ তথ্য, সমস্ত সম্ভাব্য ফাংশন।
এই পদ্ধতিটি সর্বজনীন মনে হলেও, এর উল্লেখযোগ্য ত্রুটি রয়েছে। প্রথমত, এটি অতিরিক্ত খরচ: সম্পূর্ণ টুল সেটের প্রতিটি অনুরোধ প্রচুর পরিমাণ ডেটা প্রক্রিয়া করে, টোকেন এবং সময় ব্যয় করে। দ্বিতীয়ত, অতিরিক্ত ক্ষমতা সমস্যা তৈরি করতে পারে: এজেন্ট অপ্রয়োজনীয় তথ্যে "ডুবে" যেতে পারে বা ভুল টুল বেছে নিতে পারে। তৃতীয়ত, অনুমতি ব্যবস্থাপনা এবং নিরাপত্তাও ক্ষতিগ্রস্ত হয় যখন এজেন্টের একসাথে সবকিছুতে অ্যাক্সেস থাকে।
পদ্ধতি: কাজের সম্পদ এবং ক্ষমতার মিল
গবেষকদের মূল ধারণা — harness কনফিগারেশনকে সম্পদ মিলানোর কাজ হিসেবে দেখা। প্রতিটি কাজের ডেটা, টুল এবং ক্রিয়াকলাপের জন্য প্রয়োজনীয়তা রয়েছে, আর পরিবেশের রয়েছে প্রদত্ত ক্ষমতা। সর্বোচ্চ সেট "সব পরিস্থিতির জন্য" দেওয়ার পরিবর্তে সর্বোত্তম মিল খুঁজে বের করতে হবে।
এর জন্য, গুরুত্বপূর্ণ অবকাঠামো পরিচালনার সময় উদ্ভূত কাজগুলিকে নিয়ন্ত্রিত সিস্টেমের গাণিতিক বর্ণনার ভিত্তিতে শ্রেণীবদ্ধ করা হয়। উদাহরণস্বরূপ, তরল কুলিংয়ে তাপমাত্রা নিয়ন্ত্রণের কাজটি বিদ্যুৎ গ্রিডে লোড ব্যালেন্সিংয়ের কাজ থেকে আলাদা: তাদের বিভিন্ন প্যারামিটার, সময়ের স্কেল এবং ঝুঁকি রয়েছে।
Harness কনফিগারেশনগুলি, পালাক্রমে, এজেন্টকে দেওয়া তথ্যের পরিমাণ এবং ধরন অনুসারে র্যাঙ্ক করা হয়। এভাবে প্রতিটি কাজের বিভাগের জন্য সম্ভাব্য "স্বাধীনতার মাত্রা"র একটি মানচিত্র তৈরি হয়।

মিলের মানচিত্র কোথা থেকে আসে
"কাজ — harness" মানচিত্র দুটি উপায়ে তৈরি করা হয়। প্রথমটি — প্রোফাইল সাহিত্য বিশ্লেষণ: নির্দিষ্ট কাজ সমাধানে এজেন্টরা সাধারণত কী ব্যবহার করে? দ্বিতীয়টি — নিয়ন্ত্রিত পরীক্ষায় এজেন্টদের প্রকৃত আচরণ পরিমাপ: আসলে কী প্রয়োজন, আর কী ফলাফলকে প্রভাবিত করে না। এটি সম্পূর্ণ তাত্ত্বিক অনুমানের চেয়ে আরও নির্ভরযোগ্য ভিত্তি দেয়।
নিয়ন্ত্রিত এস্কেলেশনের অ্যালগরিদম
এই মানচিত্রগুলির ভিত্তিতে লেখকরা map-guided escalation অ্যালগরিদম প্রস্তাব করেন। এজেন্ট প্রথমে ন্যূনতম অনুমতির সেট পায় যা মানচিত্র অনুযায়ী তার কাজের সাথে মেলে। কাজ শেষ করার পর এজেন্ট স্ব-যাচাই করে: সম্পদ কি যথেষ্ট ছিল, কাজটি কি সঠিকভাবে সমাধান হয়েছে? যদি স্ব-যাচাই ব্যর্থতা দেখায়, harness সম্প্রসারিত হয় — সম্ভবত পরবর্তী স্তরে বা সম্পূর্ণ পর্যন্ত। এই চক্রটি ততক্ষণ পুনরাবৃত্তি হয় যতক্ষণ না কাজটি সফলভাবে সমাধান হয় বা সর্বোচ্চে পৌঁছানো যায়।
পদ্ধতির সৌন্দর্য হল এটির জন্য প্রতিটি কাজের জন্য আগে থেকে সেটিংস বেছে নেওয়ার প্রয়োজন হয় না — এস্কেলেশন স্বয়ংক্রিয়ভাবে এবং শুধুমাত্র তখনই ঘটে যখন প্রয়োজন হয়। সহজ কাজগুলি প্রায় সবসময় ন্যূনতম সেট দিয়ে সমাধান হয়, আর জটিল কাজগুলি প্রয়োজন অনুযায়ী অতিরিক্ত সম্পদ পায়।
পরীক্ষা: পরীক্ষাগুলি কী দেখিয়েছে
গবেষকরা দুটি পরিস্থিতিতে পদ্ধতিটি যাচাই করেছেন। তরল কুলিংয়ে, নতুন পদ্ধতি ব্যবহার করে এজেন্টের নির্ভুলতা ছিল 0.715, যা সম্পূর্ণ provision-এর 0.652-এর চেয়ে বেশি। একই সাথে টোকেন খরচ প্রায় অর্ধেক কমেছে — 48% সাশ্রয়। তদুপরি, নির্ভুলতা পরিচিত স্ব-সংশোধন পদ্ধতি Reflexion-এর সাথে তুলনীয় ছিল, কিন্তু তার খরচ ছাড়াই।
বিদ্যুৎ গ্রিডে ফলাফল ভিন্ন ছিল। সম্পূর্ণ টুল সেট এখনও সর্বোচ্চ নির্ভুলতা দেয়, তাই গুণমান গুরুত্বপূর্ণ হলে এটি পরিত্যাগ করা অনুচিত। তবে, ম্যাপ-ভিত্তিক provisioning সস্তা বিকল্প প্রস্তাব করে — এমন কাজের জন্য যেখানে সম্পদ সাশ্রয়ের বিনিময়ে সামান্য গুণমান হ্রাস গ্রহণযোগ্য।

উপসংহার এবং ব্যবহারিক সুপারিশ
মূল উপসংহার: সবার জন্য একমাত্র সঠিক কনফিগারেশন নেই। প্রতিটি বিষয় ক্ষেত্রের নিজস্ব Pareto সীমান্ত রয়েছে — নির্ভুলতা এবং খরচের মধ্যে সর্বোত্তম ভারসাম্য। কিছু ডোমেইনের জন্য সাশ্রয়ী কনফিগারেশন জয়ী হয়, অন্যগুলির জন্য সম্পূর্ণ সেট প্রয়োজনীয় থাকে।
অনুশীলনকারীদের উচিত:
- কাজ এবং harness-এর মিলের মানচিত্র তৈরি এবং বজায় রাখা;
- ন্যূনতম পর্যাপ্ত সেট দিয়ে শুরু করা, ব্যর্থ স্ব-যাচাইয়ের পরেই তা সম্প্রসারিত করা;
- "গড়ে" নয়, বরং নির্দিষ্ট ডোমেইনের জন্য সর্বোত্তম সিদ্ধান্ত নেওয়া।
এই ধরনের পদ্ধতি সম্পদ সাশ্রয় করতে সাহায্য করে গুণমান না হারিয়ে যেখানে অতিরিক্ততা ন্যায়সঙ্গত নয়, এবং সম্পূর্ণ সেট সেই ক্ষেত্রে রেখে দেয় যেখানে এটি সত্যিই প্রয়োজনীয়।



