নিউরো-সিম্বলিক লার্নিং এবং ডেসক্রিপশন লজিকে সমস্যা কোথায়
OWL 2 DL অন্টোলজি, যা SROIQ ডেসক্রিপশন লজিকের উপর ভিত্তি করে, দীর্ঘদিন ধরে বায়োমেডিসিন এবং সেম্যান্টিক ওয়েবে একটি কার্যকরী হাতিয়ার — এগুলো বড় জ্ঞানভান্ডারকে সংক্ষিপ্তভাবে বর্ণনা করতে সক্ষম। কিন্তু যখন এই ধরনের অন্টোলজি ব্যবহার করে নিউরাল নেটওয়ার্ক প্রশিক্ষণের কথা আসে, তখন সমস্যা শুরু হয়। ক্লাসিক্যাল পদ্ধতিগুলো হয় যুক্তিকে "ঝাপসা" করে দেয়, অন্টোলজিকে ক্রমাগত ভেক্টর স্পেসে এমবেড করার মাধ্যমে, যার ফলে কঠোর যৌক্তিক অনুমান হারিয়ে যায়, অথবা সেগুলো EL++ হর্ন ফ্র্যাগমেন্টে সীমাবদ্ধ থাকে, যার শুধুমাত্র একটি ক্যানোনিকাল মডেল থাকে। এর ফলে, অভিব্যক্তিপূর্ণ অন্টোলজিগুলো প্রায়শই হাইব্রিড সিস্টেমের জন্য অগম্য হয়ে পড়ে।
অন্টোলজিকে একটি ডিফারেনশিয়েবল স্কিমায় কম্পাইল করা
Baobab সিস্টেম কোনো আপস করতে চায় না: এটি একটি সসীম ABox সহ সম্পূর্ণ SROIQ অন্টোলজিকে একটি Sentential Decision Diagram (SDD)-তে কম্পাইল করে। প্রক্রিয়াটি দুটি ধাপে এগোয়: প্রথমে, প্রোপোজিশনাল কোরটি কনসিকোয়েন্স-ভিত্তিক ক্যালকুলাস দিয়ে পরিপূর্ণ করা হয়, তারপর SROIQ-নির্দিষ্ট কাঠামোগুলো — নমিনাল, রোল সংখ্যার সীমাবদ্ধতা এবং রোল অ্যাক্সিওম — সক্রিয় ডোমেনে ইনস্ট্যান্টিয়েট করা হয়। ফলস্বরূপ, একটি স্কিমা পাওয়া যায় যার মাধ্যমে ওয়েটেড মডেল কাউন্ট (WMC) সম্পাদন করা যায়। এই WMC-ই নিউরাল নেটওয়ার্ক এবং যৌক্তিক সীমাবদ্ধতার মধ্যে সংযোগকারী সেতু হয়ে ওঠে।

যুক্তি সংরক্ষণের সাথে নিউরাল নেটওয়ার্ক প্রশিক্ষণ
প্রমাণ বিবেচনায় রেখে SDD-এর ওয়েটেড মডেল কাউন্ট একটি পারসেপশন নেটওয়ার্ক — যেমন, একটি কনভোল্যুশনাল নিউরাল নেটওয়ার্ক — প্রশিক্ষণ দিতে সক্ষম করে, এমনকি যখন ডেটার শুধুমাত্র একটি অংশ ABox-এ লেবেল করা থাকে। পরীক্ষায়, লেখকরা একটি অন্টোলজি তৈরি করেছেন যা SROIQ-এর সমস্ত স্বতন্ত্র বৈশিষ্ট্য ব্যবহার করে, এবং উত্তরসূরি সম্পর্কের সাথে যুক্ত MNIST সংখ্যা চিনতে একটি CNN প্রশিক্ষণ দিয়েছেন। নেটওয়ার্কটি শুধু ছবিগুলোকে শ্রেণীবদ্ধ করেনি — এটি সুপ্ত অন্টোলজিকাল ধারণাগুলো পুনরুদ্ধার করেছে। স্বাধীনভাবে পারসেপশন প্রশিক্ষণ দিলে এই ধরনের ধারণাগুলো এলোমেলোতার স্তরে থাকে, কিন্তু এখানে সেগুলো যৌক্তিক সীমাবদ্ধতার কারণে শেখা হয়েছে।
রিজনিং শর্টকাট এবং ক্যালিব্রেটেড পোস্টেরিয়র
যখন সুপারভাইজরি সিগন্যাল অন্টোলজির সাথে সমানভাবে সামঞ্জস্যপূর্ণ একাধিক সমাপ্তির বিকল্প দেয়, তখন স্বাধীনভাবে প্রশিক্ষিত একটি নেটওয়ার্ক প্রায়শই সেগুলোর একটিতে "সঙ্কুচিত" হয়ে যায়। লেখকরা এই ঘটনাটিকে রিজনিং শর্টকাট বলে অভিহিত করেছেন। গবেষণাপত্রে দেখানো হয়েছে যে, প্রশ্নের জাস্টিফিকেশন দ্বারা সূচিত একটি মিশ্রণ একটি ক্যালিব্রেটেড পোস্টেরিয়র উপস্থাপন করতে সক্ষম — যা একটি একক মডেলের জন্য অপ্রাপ্য। তদুপরি, যদি এই মিশ্রণটি স্কিমার তালিকাভুক্ত সমাপ্তি থেকে শুরু করা হয়, তাহলে বাস্তব ছবি সহ MNIST কাজে একটি বায়েসিয়ান-অপটিমাল পোস্টেরিয়র পাওয়া যায়। তুলনার জন্য: একক WMC এবং প্রশিক্ষিত এনসেম্বল মিশ্রণ এই ফলাফল দেয় না।

সঠিকতা যাচাই এবং প্রাপ্যতা
লেখকরা উল্লেখ করেছেন যে এটি প্রথম কাজ যেখানে অ-হর্ন ডেসক্রিপশন লজিকের জন্য রিজনিং শর্টকাটগুলো চিহ্নিত এবং প্রশমিত করা হয়েছে। কম্পাইলারের সঠিকতা এবং প্রতিনিধিত্বযোগ্যতার ফলাফল Lean 4-এ মেশিন-যাচাই করা হয়েছে — এটি পদ্ধতির নির্ভরযোগ্যতার পক্ষে একটি গুরুতর যুক্তি। সিস্টেমের কোড উন্মুক্ত, তাই ফলাফলগুলো পুনরুত্পাদন এবং বিকাশ করা সম্ভব।
উপসংহার
Baobab দেখায় যে, শেখার ক্ষমতার জন্য ডেসক্রিপশন লজিকের অভিব্যক্তিকে বিসর্জন দেওয়ার প্রয়োজন নেই। SROIQ-কে একটি ডিফারেনশিয়েবল স্কিমায় কম্পাইল করা যৌক্তিক ফলাফলগুলো সংরক্ষণ করে এবং একই সাথে বাস্তব ডেটাতে নিউরাল নেটওয়ার্ক প্রশিক্ষণের সুযোগ দেয়। আর জাস্টিফিকেশন-সূচিত মিশ্রণের মাধ্যমে রিজনিং শর্টকাট সমস্যার সমাধান — আরও নির্ভরযোগ্য এবং ক্যালিব্রেটেড হাইব্রিড মডেলের দিকে একটি গুরুত্বপূর্ণ পদক্ষেপ।



