SGHA: সম্পূর্ণ স্বায়ত্তশাসিত বৈজ্ঞানিক ফাঁক অনুসন্ধান স্থানীয় LLM-এ, কোনো বাহ্যিক API ছাড়াই

28 আগস্ট 2026১২ প্রদর্শন

নতুন সিস্টেমটি নিবন্ধের বিশাল সংগ্রহকে একটি কাঠামোবদ্ধ প্রমাণ গ্রাফে রূপান্তরিত করে এবং ৯ বিলিয়ন প্যারামিটার বিশিষ্ট একটি ওপেন মডেল ব্যবহার করে অমীমাংসিত গবেষণা সমস্যা খুঁজে বের করে। এই পদ্ধতি প্রক্রিয়ার স্বচ্ছতা বাড়ায়, হ্যালুসিনেশনের ঝুঁকি কমায় এবং বাহ্যিক পরিষেবাগুলিতে ডেটা স্থানান্তরের প্রয়োজন হয় না।

SGHA: সম্পূর্ণ স্বায়ত্তশাসিত বৈজ্ঞানিক ফাঁক অনুসন্ধান স্থানীয় LLM-এ, কোনো বাহ্যিক API ছাড়াই

শিরোনাম: কেন AI বিজ্ঞানীরা শুরুতে আটকে যান

আধুনিক ভাষা মডেলগুলো বৈজ্ঞানিক কাজের রুটিন কাজগুলো মোটামুটি ভালোভাবে সামলাতে শিখেছে: তারা হাইপোথিসিস তৈরি করে, পরীক্ষার জন্য কোড লেখে এবং এমনকি নিবন্ধের খসড়াও তৈরি করে। তবে গবেষণার পুরো চক্রটি স্বয়ংক্রিয় করার চেষ্টা করলে একটি অপ্রত্যাশিত বাধার সৃষ্টি হয় — প্রাথমিক পর্যায়ে, যেখানে গবেষণার সমস্যাটি নিজেই প্রণয়ন করতে হয়।

বেশিরভাগ বিদ্যমান AI বিজ্ঞানী এই ধাপে মালিকানাধীন মডেলের বাণিজ্যিক API-তে যান। এটি একটি ব্ল্যাক বক্সের মতো: প্রস্তাবনাগুলো মডেলের প্যারামেট্রিক জ্ঞান এবং সাহিত্য অনুসন্ধান থেকে আসে, যা আগে থেকেই তৈরি করা ধারণার সাথে মানানসই। সিদ্ধান্তটি কোন তথ্যের উপর ভিত্তি করে তা যাচাই করা প্রায় অসম্ভব। এর সাথে হ্যালুসিনেশন এবং নির্দিষ্ট মডেলের পদ্ধতিগত পক্ষপাতের ঝুঁকি যোগ করুন — তাহলে দেখা যাবে যে গবেষণার সূচনা বিন্দুটি কেবল এলোমেলো নয়, বরং ভিত্তিহীনও হতে পারে।

আরেকটি বড় সমস্যা হলো গোপনীয়তা। বিজ্ঞানীরা সবসময় তাদের কাজ বাহ্যিক API-তে পাঠাতে প্রস্তুত নন, বিশেষ করে যদি এটি অ-পেটেন্টকৃত ধারণা বা সংবেদনশীল বিষয় হয়। তাই অবাক হওয়ার কিছু নেই যে গবেষণা পরিকাঠামোর সীমানা অতিক্রম করে না এমন স্থানীয় পদ্ধতিগুলো越来越多的 মনোযোগ আকর্ষণ করছে।

এখানেই মঞ্চে আসে SGHA সিস্টেম, যা সারভেশ ঘারাত এবং জুনপেই কোমিয়ামা তৈরি করেছেন। তাদের প্রিপ্রিন্টটি ১৮ আগস্ট ২০২৬ তারিখে আর্কাইভে প্রকাশিত হয়েছে। লেখকরা একটি সম্পূর্ণ স্বায়ত্তশাসিত বৈজ্ঞানিক ফাঁক শনাক্তকরণ পাইপলাইন প্রস্তাব করেছেন, যা একটি স্থানীয় ওপেন মডেলে কাজ করে এবং কোনো বাহ্যিক API-তে একবারও কল করে না। তবে আসুন দেখি এটি কীভাবে কাজ করে।

SGHA কীভাবে কাজ করে: কর্পাস থেকে গবেষণা সমস্যা পর্যন্ত

সাধারণ এজেন্টদের থেকে ভিন্ন, যারা কেবল মুক্তভাবে "চিন্তা" করে, SGHA বৈজ্ঞানিক কর্পাসের সুস্পষ্ট কাঠামোর উপর জোর দেয়। প্রথম ধাপ — নিবন্ধগুলির একটি সংগ্রহকে প্রমাণ-সংযুক্ত নিবন্ধ বস্তু এবং টাইপকৃত প্রমাণ গ্রাফে রূপান্তর করা। সহজভাবে বললে, প্রতিটি প্রকাশনা সত্তা এবং সম্পর্কে বিভক্ত হয়: এটি কী দাবি করে, কোন কাজের উপর নির্ভর করে, কোন পরীক্ষাগুলো সিদ্ধান্ত নিশ্চিত করে।

তারপর সিস্টেম এই গ্রাফে অমীমাংসিত কাঠামোগত প্যাটার্ন — সম্ভাব্য ফাঁক — খোঁজে। এটি কেবল টেক্সট মিল নয়, বরং তথ্য-ভিত্তিক যাচাইযোগ্য "গর্ত": উদাহরণস্বরূপ, দুটি গবেষণা ক্ষেত্র স্পষ্টভাবে সম্পর্কিত, কিন্তু কেউ সেগুলো একত্রিত করার চেষ্টা করেনি। গুরুত্বপূর্ণ বিষয় হলো, প্রতিটি প্রার্থী ফাঁক একটি পূর্ণাঙ্গ সমস্যা বিবৃতি হওয়ার আগে কার্যকারিতা পরীক্ষার মধ্য দিয়ে যায়।

প্যাটার্ন থেকে সমস্যা পরিবার পর্যন্ত

আউটপুটে SGHA গবেষণা সমস্যার পরিবার তৈরি করে, যার প্রতিটিতে উল্লেখ থাকে:

  • অনুমান;
  • লক্ষ্য;
  • সাফল্যের মানদণ্ড;
  • অবশিষ্ট অস্পষ্টতা।

এই পদ্ধতি গবেষককে কেবল একটি ধারণা নয়, বরং এর যুক্তি এবং প্রযোজ্যতার সীমানা দেখতে দেয়। একই সাথে, সমস্ত যুক্তি কর্পাসের প্রমাণের মধ্যে সীমাবদ্ধ, যা হ্যালুসিনেশনের সম্ভাবনা ব্যাপকভাবে হ্রাস করে।

সম্পূর্ণ স্থানীয়: শুধুমাত্র ৯ বিলিয়ন প্যারামিটারের ওপেন মডেল

SGHA-এর মূল বৈশিষ্ট্য হলো সম্পূর্ণ স্বায়ত্তশাসন। ভাষা প্রক্রিয়াকরণ এবং যুক্তির সাথে সম্পর্কিত সমস্ত উপাদান স্থানীয়ভাবে স্থাপিত ৯ বিলিয়ন প্যারামিটারের ওপেন মডেলে সম্পাদিত হয়। কোনো মালিকানাধীন ফ্রন্টিয়ার মডেল API নেই, বাইরে কোনো ডেটা স্থানান্তর নেই। এমনকি দীর্ঘ গবেষণা প্রক্রিয়াতেও একটি বাহ্যিক অনুরোধের প্রয়োজন হবে না।

এটি কেবল সুবিধার বিষয় নয়। শিল্প অর্ডার বা চিকিৎসা ডেটা নিয়ে কাজ করা ল্যাবরেটরিগুলির জন্য, এই পদ্ধতি ডেটা ব্যবস্থাপনা এবং গোপনীয়তার সাথে সম্পর্কিত একটি সম্পূর্ণ শ্রেণির সমস্যা দূর করে। তাছাড়া, 9B ওপেন মডেল আধুনিক মানদণ্ডে যথেষ্ট বিনয়ী আকার, যা সিস্টেমটিকে একটি শক্তিশালী ওয়ার্কস্টেশনে চালানোর জন্য অ্যাক্সেসযোগ্য করে তোলে।

মূল্যায়ন: AI Scientist-v2-এর সাথে তুলনা

লেখকরা পাঁচটি মেশিন লার্নিং ক্ষেত্রে সিস্টেমটি পরীক্ষা করেছেন, AI Scientist-v2 প্রকল্পের আইডিয়া প্রণয়ন মডিউলের সাথে তুলনা করে। ফলাফল দেখায় যে কর্পাসের সুস্পষ্ট কাঠামো এবং প্রমাণ যাচাইয়ের পদ্ধতি কম সম্ভাবনাময় নয় এবং যাচাইযোগ্য সমস্যা বিবৃতি দেয়, অনেক বেশি শক্তিশালী ফ্রন্টিয়ার মডেল ব্যবহারের চেয়ে। SGHA কেবল বিষয়ের নাম তৈরি করে না, বরং কোন নিবন্ধ এবং সম্পর্কের ভিত্তিতে এটি একটি নির্দিষ্ট প্রশ্নের বিবৃতিতে পৌঁছেছে তা খুঁজে বের করতে দেয়।

এটি "ব্ল্যাক বক্স" সমস্যার সমাধান করে এবং প্রক্রিয়াটিকে নিরীক্ষণযোগ্য করে তোলে। এবং সম্পূর্ণ স্থানীয়তা বিবেচনায়, এই ধরনের এজেন্টকে নিরাপত্তা নীতি নিয়ে চিন্তা না করেই বৈজ্ঞানিক কর্মপ্রবাহে সহজেই সংহত করা যায়।

উপসংহার এবং সম্ভাবনা

SGHA একটি বিশ্বাসযোগ্য উদাহরণ যে বৈজ্ঞানিক সমস্যা প্রণয়নের জন্য বিশাল ক্লাউড মডেল সংযুক্ত করার প্রয়োজন নেই। কর্পাসের কাঠামোবদ্ধকরণ, প্রমাণ গ্রাফ এবং 9B লোকাল মডেল সম্ভাবনাময় এবং যাচাইযোগ্য গবেষণা সমস্যার জন্য পর্যাপ্ত মানের নিশ্চয়তা দিতে সক্ষম। অবশ্যই, সামনে অনেক কাজ বাকি: লেখকরা কোড এবং আর্টিফ্যাক্ট প্রকাশের প্রতিশ্রুতি দিয়েছেন, যা অন্য দলগুলিকে ফলাফল পুনরুত্পাদন এবং সিস্টেমটিকে নিজ নিজ ক্ষেত্রে মানিয়ে নেওয়ার সুযোগ দেবে।

যদি প্রবণতা অব্যাহত থাকে, আগামী বছরগুলিতে আমরা AI বিজ্ঞানীদের একটি সম্পূর্ণ শ্রেণি দেখতে পাব, যারা বাহ্যিক API-এর উপর নির্ভরশীল নয় এবং যাচাইয়ের জন্য সম্পূর্ণ স্বচ্ছ। অর্থাৎ, বিজ্ঞানের স্বয়ংক্রিয়তা কেবল আরও কার্যকরই নয়, আরও নিরাপদও হয়ে উঠবে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
SGHA: সম্পূর্ণ স্বায়ত্তশাসিত বৈজ্ঞানিক ফাঁক অনুসন্ধান স্থানীয় LLM-এ, কোনো বাহ্যিক API ছাড়াই