সঠিক উত্তর — এখনও অঙ্কন নয়
আধুনিক বড় ভাষার মডেলগুলো অলিম্পিয়াড-স্তরের গণিতের সমস্যা সমাধানে আত্মবিশ্বাসের সাথে কাজ করে। জ্যামিতিতে এটি বিশেষভাবে লক্ষণীয়: মডেলটি একটি সংখ্যাগত উত্তর দেয়, এবং মনে হয় যেন এটি শর্তটি কল্পনা করতে পারে। তবে সমস্যা সমাধানের দক্ষতা এবং সঠিক চিত্র আঁকার দক্ষতার মধ্যে একটি বড় পার্থক্য রয়েছে। বীজগাণিতিক রূপান্তরের মাধ্যমে উত্তর পাওয়া যায়, কিন্তু একটি অঙ্কনের জন্য বিন্দু, রেখা এবং অতিরিক্ত নির্মাণের পারস্পরিক অবস্থান বিবেচনা করা প্রয়োজন। উদাহরণস্বরূপ, GPT এবং Claude মানসম্মত গণিত পরীক্ষায় উচ্চ ফলাফল দেখায়, কিন্তু সম্প্রতি পর্যন্ত এমন কোনো পরীক্ষা ছিল না যা আলাদাভাবে তাদের অঙ্কন তৈরির ক্ষমতা যাচাই করত।
নতুন গবেষণার লেখকরা (প্রিপ্রিন্ট arXiv:2608.18111, ICML 2026-এর অংশ হিসেবে AI4MATH ওয়ার্কশপে উপস্থাপিত) লক্ষ্য করেন যে বিদ্যমান বেঞ্চমার্কগুলি, জনপ্রিয় MathVista এবং MathVerse সহ, মূলত চূড়ান্ত উত্তর মূল্যায়ন করে। তাদের মতে, তাদের মধ্যে কোনোটি ডায়াগ্রাম নির্মাণকে একটি স্বাধীন দক্ষতা হিসেবে বিচ্ছিন্ন করে না। এটি-ই নতুন ডেটাসেটের সূচনা বিন্দু হয়ে ওঠে।
বেঞ্চমার্কের ভিতরে কী আছে
গবেষকরা অলিম্পিয়াড জ্যামিতির ৯৫৪টি সমস্যার একটি উন্মুক্ত সেট সংগ্রহ করেছেন। প্রতিটি সমস্যা সম্পূর্ণ স্বয়ংসম্পূর্ণ: এর শর্তে বাহ্যিক রেফারেন্সের প্রয়োজন হয় না এবং এটি একটি দ্ব্যর্থহীন ব্যাখ্যা সম্ভব করে। অতিরিক্তভাবে, সেটটিতে ২৯৭টি সমস্যার একটি জটিল উপসেট চিহ্নিত করা হয়েছে, যার জন্য অঙ্কন নিয়ে বিশেষভাবে যত্নশীল কাজ গুরুত্বপূর্ণ।
প্রতিটি সমস্যার জন্য, লেখকরা একটি রেফারেন্স সমাধান এবং Asymptote কোডে মানব-নির্মিত একটি উচ্চ-নির্ভুল অঙ্কন প্রস্তুত করেছেন। এই বিন্যাসটি ডায়াগ্রাম রেন্ডার করা এবং মডেল যা তৈরি করে তার সাথে তুলনা করা সম্ভব করে।

ডায়াগ্রাম-ভিত্তিক যুক্তি মূল্যায়নের জন্য, বিকাশকারীরা বিভিন্ন ধরনের মেট্রিক প্রস্তাব করেন। তারা টেক্সট, কোড, চূড়ান্ত চিত্র অনুযায়ী ফলাফল পরীক্ষা করে, পাশাপাশি ভিশন-ল্যাঙ্গুয়েজ মডেল এবং পৃথক সীমাবদ্ধতা পরীক্ষাও ব্যবহার করে। এর ফলে শুধু চিত্রটি আঁকা হয়েছে কিনা তা নয়, এটি মূল জ্যামিতিক শর্তের সাথে কতটা সামঞ্জস্যপূর্ণ তাও দেখা যায়।
প্রথম পরীক্ষাগুলি কী দেখিয়েছে
লেখকরা বেঞ্চমার্কের মাধ্যমে বেশ কয়েকটি মৌলিক মডেল চালিয়েছেন। ফলাফল প্রাথমিক অনুমানকে নিশ্চিত করেছে: মডেলগুলি সমস্যা সমাধানে লক্ষণীয়ভাবে ভালো, তাদের জন্য ডায়াগ্রাম তৈরি করার চেয়ে। উৎপন্ন অঙ্কনের সফল কম্পাইলেশনের গড় হার ছিল মাত্র ৩৬.১৪%। এর অর্থ হল বেশিরভাগ ক্ষেত্রে, মডেলটি হয় কোডের সাথে মানিয়ে নিতে পারে না, অথবা জ্যামিতিকভাবে ভুল চিত্র তৈরি করে।

অধিকন্তু, কম ফলাফল শুধুমাত্র Asymptote ভাষার জটিলতা দিয়ে ব্যাখ্যা করা যায় না: কিছু সমস্যার জন্য মডেলগুলি সঠিক উত্তর দেয়, কিন্তু এমনকি আনুমানিক শর্তও আঁকতে পারে না। মনে হচ্ছে আধুনিক AI-তে স্থানিক চিন্তাভাবনা এবং গাণিতিক যুক্তি স্বাধীনভাবে বিকশিত হচ্ছে, এবং বর্তমান প্রশিক্ষণ পদ্ধতিগুলি তাদের সংযুক্ত করে না।
কেন এটি গুরুত্বপূর্ণ
সঠিক অঙ্কন অলিম্পিয়াড জ্যামিতির একটি গুরুত্বপূর্ণ অংশ। প্রায়শই অতিরিক্ত নির্মাণ — একটি আঁকা বৃত্ত, রেখাংশ বা প্রতিসম বিন্দু — সমাধানের ইঙ্গিত দেয়। যদি একটি মডেল এই ধরনের সহায়ক উপাদান তৈরি করতে না জানে, তবে জ্যামিতিতে তার "সাফল্য"কে সমস্যার পূর্ণাঙ্গ বোঝাপড়া হিসেবে গণ্য করা যায় না।
তৈরি বেঞ্চমার্ক গবেষকদের সমাধানের দক্ষতাকে ভিজ্যুয়ালাইজ করার দক্ষতা থেকে আলাদা করতে দেয়। এটি বিকাশকারীদের গ্রাফিকাল উপস্থাপনা নিয়ে কাজ করার জন্য মডেলগুলিকে উদ্দেশ্যমূলকভাবে প্রশিক্ষণ দেওয়া শুরু করার প্রথম পদক্ষেপ। ৯৫৪টি সমস্যার উন্মুক্ত ডেটা অ্যানোটেশনের লিঙ্কে উপলব্ধ, তাই যে কেউ নতুন পরীক্ষাটি ব্যবহার করতে পারে।
সারসংক্ষেপ সহজ: সঠিক উত্তর — সঠিক অঙ্কনের নিশ্চয়তা নয়। নতুন ডেটাসেট এটি স্পষ্টভাবে দেখতে সাহায্য করে এবং সম্ভবত AI-এর আরও "স্থানিক" প্রশিক্ষণের ভিত্তি হয়ে উঠবে।



