NL2SHACL-Bench: নতুন মানদণ্ড যা পাঠ্য প্রয়োজনীয়তা থেকে SHACL-শেপ তৈরি করার মূল্যায়নের জন্য

11 সেপ্টেম্বর 2026০ প্রদর্শন

ISWC 2026-এর নিবন্ধে লেখকরা একটি টুল উপস্থাপন করেছেন যা LLM-এর সাধারণ প্রশ্নগুলিকে বৈধ SHACL-সীমাবদ্ধতায় রূপান্তর করার ক্ষমতা পরিমাপ করে, বিবেচনায় রেখে যে একই নিয়ম বিভিন্ন রূপে দেখা যেতে পারে। চারটি মডেলের পরীক্ষায় দেখা গেছে: তারা সহজেই সিনট্যাক্স সামলাতে পারে, কিন্তু প্রায়ই জটিল সীমাবদ্ধতার অর্থ বুঝতে পারে না।

NL2SHACL-Bench: নতুন মানদণ্ড যা পাঠ্য প্রয়োজনীয়তা থেকে SHACL-শেপ তৈরি করার মূল্যায়নের জন্য

SHACL-এর অপ্রকাশ্য জটিলতা

SHACL-কে RDF-গ্রাফ যাচাইয়ের জন্য অন্যতম প্রধান ভাষা হিসেবে বিবেচনা করা হয়, কারণ এটি ডেটা নির্দিষ্ট স্কিমা এবং সীমাবদ্ধতা মেনে চলে কিনা তা পরীক্ষা করতে দেয়। কিন্তু সমস্যা হলো, শেপ তৈরি করতে গভীর প্রযুক্তিগত দক্ষতার প্রয়োজন হয়, যা সাধারণত নির্দিষ্ট বিষয়领域的 বিশেষজ্ঞদের থাকে না। প্রাকৃতিক ভাষায় প্রয়োজনীয় সীমাবদ্ধতাগুলো বর্ণনা করে তৈরি ফরমাল কোড পাওয়া অনেক বেশি সুবিধাজনক হবে। আধুনিক কোড জেনারেশন মডেলগুলো ঠিক এই কাজটিই সমাধান করার চেষ্টা করছে, কিন্তু তাদের ফলাফল কীভাবে উদ্দেশ্যমূলকভাবে মূল্যায়ন করা যায় তা এখনও স্পষ্ট ছিল না।

NL2SHACL-Bench: একটি নতুন মূল্যায়ন সরঞ্জাম

গবেষকদের একটি দল — ওয়াই. ঝোউ, এন. বোবেট এবং এম. অ্যাকোস্টা — প্রাকৃতিক ভাষা থেকে SHACL শেপে অনুবাদের জন্য একটি টেস্ট সেট NL2SHACL-Bench উপস্থাপন করেছে। কাজটি ISWC 2026 সম্মেলনে গৃহীত হয়েছে, এবং arXiv-এ প্রিপ্রিন্টের দুটি সংস্করণ প্রকাশিত হয়েছে: প্রথমটি ২০২৬ সালের জুলাইয়ের শেষে, আপডেট করা সংস্করণটি আগস্টের শেষে। নিবন্ধে বেঞ্চমার্কের কাঠামো এবং পরীক্ষা-নিরীক্ষার পদ্ধতি বিস্তারিতভাবে বর্ণনা করা হয়েছে।

এর আগে এই ধরনের কাজের জন্য কোনো বিশেষায়িত বেঞ্চমার্ক ছিল না। গবেষকদের কোনো একক মান ছাড়াই নিজস্ব উদাহরণ সংগ্রহ করতে হতো, যা সমাধানগুলোর মধ্যে তুলনা করা কঠিন করে তুলত। নতুন সেটটি এই শূন্যতা পূরণ করবে এবং সম্প্রদায়কে একটি সাধারণ রেফারেন্স পয়েন্ট দেবে বলে আশা করা হচ্ছে।

কেন সাধারণ স্ট্রিং তুলনা কাজ করে না

NL2SHACL-সিস্টেম মূল্যায়নের অন্যতম প্রধান সমস্যা হলো শব্দার্থিক সমতা। দুটি শেপ একই নিয়ম প্রকাশ করতে পারে, কিন্তু গঠন বা সিরিয়ালাইজেশন পদ্ধতিতে ভিন্ন হতে পারে। যদি শুধুমাত্র টেক্সটুয়াল উপস্থাপনা তুলনা করা হয়, তাহলে অর্থগতভাবে অভিন্ন ফলাফল বাতিল হয়ে যাবে, আর বাহ্যিকভাবে একই রকম ফলাফল ভুলভাবে গৃহীত হবে। তাই বেঞ্চমার্কের লেখকরা এমন পদ্ধতির উপর জোর দিয়েছেন যা প্রকৃত অর্থগত সামঞ্জস্য পরীক্ষা করে, সাধারণ স্ট্রিং মিল নয়।

পরীক্ষায় চারটি আধুনিক বড় ভাষার মডেল অংশ নিয়েছে। দেখা গেছে, তারা সিনট্যাক্টিক্যালি সঠিক SHACL তৈরি করতে বেশ আত্মবিশ্বাসী, কিন্তু জটিল লজিক্যাল এবং স্ট্রাকচারাল প্যাটার্নগুলিতে উল্লেখযোগ্যভাবে খারাপ পারফর্ম করে, যেখানে সীমাবদ্ধতার অর্থ সঠিকভাবে পুনরুত্পাদন প্রয়োজন। এটি একটি গুরুত্বপূর্ণ সংকেত: যে কোডটি পরিপাটি দেখায়, তা সবসময় ব্যবহারকারী যা বুঝিয়েছেন তা প্রতিফলিত করে না।

এটি কী পরিবর্তন করে

NL2SHACL-Bench-এর আবির্ভাব RDF-গ্রাফ নিয়ে কাজ করার জন্য ব্যবহারিক সরঞ্জাম তৈরির দিকে একটি গুরুত্বপূর্ণ পদক্ষেপ। এখন ডেভেলপার এবং গবেষকরা চোখে দেখে নয়, বরং একটি ইউনিফাইড টেস্ট সেটের মাধ্যমে মডেলগুলোর অগ্রগতি পরিমাপ করতে পারেন। এটি ভাষার মডেলগুলোর দুর্বল দিকগুলো আরও সঠিকভাবে চিহ্নিত করতে এবং ধীরে ধীরে এমন একটি সমাধানের কাছাকাছি যেতে সাহায্য করবে যা মানুষের উদ্দেশ্য সত্যিই বোঝে।

এখনই বলা খুব তাড়াতাড়ি যে টেক্সট থেকে SHACL জেনারেশন সম্পূর্ণ সমাধান হয়ে গেছে — জটিল সীমাবদ্ধতা এখনও মডেলগুলোকে বিভ্রান্ত করে। কিন্তু একটি মানসম্মত রেফারেন্সের উপস্থিতি ভবিষ্যতের গবেষণাকে পদ্ধতিগত করে তোলে এবং তাদের ফলাফল একে অপরের সাথে তুলনীয় করে তোলে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
NL2SHACL-Bench: নতুন মানদণ্ড যা পাঠ্য প্রয়োজনীয়তা থেকে SHACL-শেপ তৈরি করার মূল্যায়নের জন্য