আণবিক এআই নিজে থেকে কাজ করতে শিখছে: রসায়নের জন্য এলএলএম-এজেন্টরা কীভাবে গঠিত এবং "স্বায়ত্তশাসনের সিঁড়ি" কোথায় নিয়ে যায়

14 সেপ্টেম্বর 2026১৪ প্রদর্শন

arXiv:2608.23104-এর একটি সাম্প্রতিক পর্যালোচনায় আণবিক বিজ্ঞানে LLM-এজেন্টদের একইসাথে দুই দিক থেকে দেখার প্রস্তাব দেওয়া হয়েছে — একটি ইঞ্জিনিয়ারিং নির্মাণ হিসেবে এবং স্বায়ত্তশাসনের দিকে ধাপে ধাপে একটি পথ হিসেবে। লেখকেরা এজেন্টকে তার উপাদান অংশে ভাগ করেন: রাসায়নিক গঠন উপলব্ধি, ক্ষেত্রভিত্তিক টুলের সাথে সংযোগ, গণনা ও পরীক্ষা থেকে পাওয়া প্রতিক্রিয়া — এবং দেখান যে সহায়ক আর এমন গবেষকের মধ্যে সীমারেখা এখন কোথায়, যিনি নিজেই কাজের লক্ষ্য নির্ধারণ করেন।

আণবিক এআই নিজে থেকে কাজ করতে শিখছে: রসায়নের জন্য এলএলএম-এজেন্টরা কীভাবে গঠিত এবং "স্বায়ত্তশাসনের সিঁড়ি" কোথায় নিয়ে যায়

আণবিক বিজ্ঞানকে দীর্ঘদিন ধরেই কৃত্রিম বুদ্ধিমত্তার জন্য সবচেয়ে সম্ভাবনাময় — এবং সবচেয়ে জটিল — ক্ষেত্রগুলোর একটি হিসেবে বিবেচনা করা হয়। ঠিক এটিই নিয়ে arXiv:2608.23104 প্রিপ্রিন্ট «Molecular LLM Agents: From Architectural Design to Scientific Autonomy»: ২৫ পৃষ্ঠা, cs.CL ও cs.AI ক্যাটাগরি, ২৪ আগস্ট ২০২৬ তারিখের v1 সংস্করণ এবং ২৫ আগস্টের সংশোধিত v2। লেখকদলের সদস্যরা হলেন Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei এবং Qing Li। কাজটি বেঞ্চমার্কে আরেকটি রেকর্ডের জন্য নয়, বরং পরিভাষায় শৃঙ্খলা আনার চেষ্টার জন্য আকর্ষণীয়: কোনটিকে আদৌ আণবিক এজেন্ট বলা হবে, এটি কোন কোন উপাদান দিয়ে গঠিত হয় এবং কতটা স্বাধীনভাবে কাজ করতে পারে।

আণবিক এজেন্ট «সাধারণ» এজেন্ট থেকে কীভাবে আলাদা

কথোপকথনভিত্তিক সহায়ক ও কোড এজেন্টরা টেক্সট, রিপোজিটরি ও ওয়েবপেজের জগতে বাস করে। তারা যে সরঞ্জাম ব্যবহার করে, সেগুলো প্রায় সবসময়ই এমন কিছু গ্রহণ ও ফেরত দেয় যা চোখে পড়ে যায়। রসায়নের ক্ষেত্রে এই কৌশল কাজ করে না: অণু কোনো অনুচ্ছেদ নয়।

একটি ডোমেইন এজেন্টকে একসাথে কয়েক ধরনের অসঙ্গতিপূর্ণ ডেটা নিয়ে কাজ করতে হয়:

  • প্রতীকী নোটেশন যেমন SMILES — সংক্ষিপ্ত স্ট্রিং, যেখানে একটি ভুল অক্ষর ঔষধি সম্ভাব্য পদার্থকে অন্য একটি পদার্থে পরিণত করে;
  • আণবিক গ্রাফ, যেখানে শুধু পরমাণু নয়, বন্ধনের ক্রম, চার্জ, স্টেরিওরসায়নও গুরুত্বপূর্ণ;
  • ত্রিমাত্রিক কনফরমেশন — কারণ অণুর ধর্ম তার গঠন দ্বারা নির্ধারিত হয়, শুধু সংকেত দ্বারা নয়;
  • স্পেকট্রা ও সিমুলেশনের ফলাফল — দীর্ঘ সংখ্যাসূচক সারি, যেখান থেকে অর্থ বের করতে হয়;
  • «ভেজা» ল্যাবরেটরির পরিমাপ, অর্থাৎ ফাইলের নয়, বরং পদার্থ নিয়ে করা প্রকৃত পরীক্ষার ডেটা।

এখান থেকেই লেখকদের মূল ভাবনা: এমন এজেন্টের সক্ষমতা একটি সফল মডেল থেকে নয়, বরং একসাথে কয়েকটি স্তম্ভ থেকে গড়ে ওঠে। প্রয়োজন রাসায়নিকভাবে নির্ভুল আণবিক বস্তুর উপলব্ধি, কেন্দ্রে একটি ভাষা মডেলসহ এজেন্টিক ফ্রেমওয়ার্ক, নির্দিষ্ট বিষয়ক্ষেত্রের সাথে যুক্ত সরঞ্জাম, এবং একটি ফিডব্যাক চ্যানেল — গণনামূলক বা পরীক্ষামূলক। এর উপরে বসে পরিকল্পনা করার এবং সময়মতো প্রয়োজনীয় সরঞ্জাম আহ্বান করার দক্ষতা।

স্থাপত্যের দৃষ্টিভঙ্গি: আণবিক এজেন্ট কী দিয়ে গড়া হয়

নিবন্ধের দুটি দৃষ্টিভঙ্গির প্রথমটি প্রকৌশলগত। লেখকরা গঠনটিকে চারটি স্তরে ভাগ করেন এবং যেকোনো বিদ্যমান প্রকল্পকে ঠিক এভাবেই দেখার প্রস্তাব দেন।

উপলব্ধি: অণু একটি বস্তু, অনুচ্ছেদ নয়

ভাষা মডেলগুলো টেক্সটে প্রশিক্ষিত, তাই শুরুতে তারা SMILES স্ট্রিংকে টোকেনের সমষ্টি হিসেবে দেখে এবং সহজেই অস্তিত্বহীন ভ্যালেন্সি «হ্যালুসিনেট» করে। এখানে ডোমেইন মডেলের সাথে সংযোগ সহায়তা করে: উদাহরণস্বরূপ, AlphaFold দেখায় যে একটি বিশেষায়িত স্থাপত্য সংকীর্ণ আণবিক কাজটি সার্বজনীন স্থাপত্যের চেয়ে বেশি নির্ভুলভাবে সমাধান করে। এজেন্টের জন্য এর অর্থ সহজ একটি বিষয়: যুক্তি দেওয়ার আগে তাকে যাচাই করতে জানতে হবে — অণুটি আদৌ বিদ্যমান কি না, তার গ্রাফ সংকেতের সাথে মেলে কি না, ফরম্যাটের মধ্যে রূপান্তরের সময় স্টেরিওরসায়ন হারিয়ে যায়নি কি না।

ফ্রেমওয়ার্ক, টুলবক্স ও প্রশিক্ষণ

দ্বিতীয় ও তৃতীয় স্তর হলো «মস্তিষ্ক» ও «হাত»। ভাষা মডেল পরিকল্পনা করে এবং কোন গণনা চালাবে তা সিদ্ধান্ত নেয়; ডোমেইন টুলবক্স তাকে ডকিং, কোয়ান্টাম-রাসায়নিক গণনা, ডেটাবেসে অনুসন্ধান, ধর্ম পূর্বাভাস দেয়। এমন পদ্ধতির একটি ভালো উদাহরণ হলো ChemCrow এজেন্ট: সেখানে মূল্য সৃষ্টি করে মডেল নিজে নয়, বরং সযত্নে বর্ণিত সরঞ্জামগুলো, যেগুলো সে আহ্বান করে।

চতুর্থ স্তর হলো প্রশিক্ষণ ও অপ্টিমাইজেশন। এজেন্টকে সফল সমাধানের ট্রাজেক্টরিতে ফাইন-টিউন করা যায়, আবার কেবল সরঞ্জামের বর্ণনা ও সেগুলো বেছে নেওয়ার কৌশল উন্নত করা যায়। দ্বিতীয় পথটি সস্তা, এবং লেখকরা স্পষ্টভাবে বোঝান: এই ক্ষেত্রের অর্ধেক ব্যর্থতা দুর্বল মডেল নিয়ে নয়, বরং খারাপভাবে নকশা করা ফিডব্যাক লুপ নিয়ে।

বৈজ্ঞানিক স্বায়ত্তশাসনের সিঁড়ি: L1–L4

নিবন্ধের দ্বিতীয় দৃষ্টিভঙ্গি হলো সেই «স্বায়ত্তশাসনের সিঁড়ি», যা প্রকৌশল ব্যবস্থায় স্তরের যুক্তি থেকে ধার করা। এটি প্রয়োজন যাতে বিমূর্তভাবে «এজেন্ট কি বুদ্ধিমান» নিয়ে তর্ক না করা হয়, বরং বোঝা যায় সে আসলে কতগুলো সিদ্ধান্ত নিজের কাঁধে নেয়।

L1 — নির্দিষ্ট দৃশ্যপটের সহায়ক

এখানে মানুষ ধাপের ক্রম নির্ধারণ করে, আর মডেল আলাদা আলাদা কাজ সম্পাদন করে: গঠন রূপান্তর করা, ডেসক্রিপ্টর গণনা করা, বিকল্প প্রস্তাব করা। স্বায়ত্তশাসন প্রায় নেই, তবে পূর্বানুমেয়তা সর্বোচ্চ।

L2 — অভিযোজিত গণনামূলক এজেন্ট

এজেন্ট নিজেই সিদ্ধান্ত নেয় কোন সরঞ্জাম কখন ও কোন ক্রমে আহ্বান করবে, ভুল হলে পুনরায় পরিকল্পনা করে, সম্পূর্ণ ডিজিটাল পরিসরে কাজ করে। এটিই আজকের মূলধারা: ঝুঁকি নষ্ট গণনার মধ্যে সীমাবদ্ধ, নষ্ট নমুনার মধ্যে নয়।

L3 — প্রকৃত পরীক্ষার ফলাফল বিবেচনাকারী এজেন্ট

সবচেয়ে আকর্ষণীয় এবং সবচেয়ে ঝুঁকিপূর্ণ স্তর। এজেন্ট কেবল পরিকল্পনাই করে না, বরং ভৌত ল্যাবরেটরি থেকে ফিডব্যাক পায় — স্পেকট্রা, ক্রোমাটোগ্রাম, সংশ্লেষণের ডেটা — এবং সেগুলোর ভিত্তিতে পরিকল্পনা সংশোধন করে। এই শ্রেণির ব্যবস্থার উদাহরণ বিদ্যমান: Coscientist ল্যাবরেটরি অটোমেশন ব্যবহার করে সংশ্লেষণের পরিকল্পনা প্রদর্শন করেছিল। কিন্তু ঠিক এখানেই ভুলের মূল্য বিমূর্ত থাকা বন্ধ করে: ভুল পদক্ষেপ রিএজেন্ট, যন্ত্রের সময় এবং সবচেয়ে খারাপ ক্ষেত্রে মানুষের নিরাপত্তা নষ্ট করে।

L4 — বৈজ্ঞানিক এজেন্ডা গঠনকারী এজেন্ট

সর্বোচ্চ ধাপ — যখন ব্যবস্থা নিজেই বেছে নেয় কোন অনুমান যাচাই করতে হবে, কোন দিকগুলোকে অগ্রাধিকার দেওয়া হবে এবং সাহিত্যে কোথায় ফাঁক খুঁজতে হবে। এখন পর্যন্ত এটি কার্যকর সমাধানের বর্ণনার চেয়ে বরং একটি দিকনির্দেশক। কিন্তু ঠিক এটিই দিক নির্ধারণ করে: «দ্রুত সম্পাদক» এবং «সহ-লেখক-পরিকল্পনাকারী»-এর মধ্যে পার্থক্য মৌলিক, এবং এটি অনুভূতি দিয়ে নয়, শব্দে নির্ধারণ করা উচিত।

এমন কাঠামো কেন প্রয়োজন

দুটি দৃষ্টিভঙ্গির ব্যবহারিক উপকারিতা হলো অসম তুলনার সুযোগ। যদি দুটি এজেন্টই নিজেদের «স্বায়ত্তশাসিত» বলে, কিন্তু একটি সিমুলেটরে ঘোরে আর দ্বিতীয়টি একটি সংশ্লেষণ-রোবট নিয়ন্ত্রণ করে, তবে এগুলো ভিন্ন দায়িত্বশ্রেণির ব্যবস্থা।

লেখকরা তিনটি কাজে ফ্রেমওয়ার্কটি ব্যবহারের প্রস্তাব দেন:

  1. নির্ণয়। এজেন্টকে স্তরে স্তরে ভাগ করলে দেখা যায় তার দুর্বলতা কোথায়: আণবিক উপলব্ধিতে, সরঞ্জামে নাকি পরিকল্পনায়।
  2. ঝুঁকি মূল্যায়ন। স্তর যত উঁচু, ব্যর্থতার পরিণাম তত গুরুতর — এবং কাজের আগে যাচাই তত বেশি জরুরি, পরে নয়।
  3. নকশা। কোনো কাজের জন্য আসলে কোন স্তরের স্বায়ত্তশাসন প্রয়োজন তা বোঝা, যেখানে সযত্ন L2-ই যথেষ্ট হতো সেখানে L4 বানানোর প্রলোভন থেকে রক্ষা করে।

সীমাবদ্ধতা ও যা অমীমাংসিত রয়ে গেছে

সৎ একটি সতর্কীকরণ: সিঁড়িটি একটি ধারণাগত মডেল, মাপা স্কেল নয়। এটি ভাবতে সহায়তা করে, কিন্তু যাচাই, সার্টিফিকেশন ও ফলাফলের পুনরুৎপাদনযোগ্যতার বিকল্প নয়। তাছাড়া রসায়ন «প্রায় সঠিক» ভালোভাবে সহ্য করে না: টেক্সটে টাইপো — বিরক্তিকর, কাঠামোগত সংকেতে — সেটি ইতিমধ্যে অন্য একটি পদার্থ।

আলাদা একটি অমীমাংসিত প্রশ্ন হলো ডেটা। প্রকৃত ল্যাবরেটরি থেকে ফিডব্যাক ব্যয়বহুল ও বিরল, আর তা ছাড়া L3 এজেন্ট তত্ত্বই থেকে যায়। দ্বিতীয় প্রশ্ন হলো ব্যাখ্যাযোগ্যতা: রসায়নবিদের বুঝতে হবে কেন ব্যবস্থাটি ঠিক এই সংশ্লেষণ পথটির প্রস্তাব দিল, নাহলে আস্থা থাকবে না।

সংক্ষেপে মূল কথা

আণবিক LLM এজেন্ট কেবল «রসায়ন প্লাস চ্যাটবট» নয়। এটি ভিন্ন একটি শ্রেণির ব্যবস্থা, যেখানে ভাষা মডেল গ্রাফ, স্পেকট্রা, গণনা প্যাকেজ ও ল্যাবরেটরি সরঞ্জামের মধ্যে ডিসপ্যাচার হিসেবে কাজ করে। arXiv:2608.23104 কাজটি সবার আগে এর শব্দভাণ্ডারের জন্য উপকারী: চারটি স্থাপত্য স্তর ও স্বায়ত্তশাসনের চারটি ধাপ এমন এজেন্টরা কী করতে পারে, কী তাদের অভাব এবং দৈনন্দিন কাজের উপকারী ত্বরান্বিতকরণ ও মানুষের কাছে ছেড়ে দেওয়াই ভালো এমন সিদ্ধান্তের মধ্যে সীমারেখা কোথায় — তা নিয়ে কথা বলার একটি সাধারণ ভাষা দেয়।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
আণবিক এআই নিজে থেকে কাজ করতে শিখছে: রসায়নের জন্য এলএলএম-এজেন্টরা কীভাবে গঠিত এবং "স্বায়ত্তশাসনের সিঁড়ি" কোথায় নিয়ে যায়