কেন LLM-এর পছন্দসংক্রান্ত মতামতকে নির্ভুল বলে ধরে নেওয়া উচিত নয়
আধুনিক ভাষার মডেলগুলো বিভিন্ন বিষয়ে বিশ্বাসযোগ্য যুক্তি দিতে সক্ষম, তাই এদেরকে ভোক্তাদের পছন্দ মূল্যায়নের জন্য 'বিশেষজ্ঞ' হিসেবে ব্যবহার করার প্রবণতা বাড়ছে। উদাহরণস্বরূপ, ChatGPT-কে জিজ্ঞাসা করা হয় একজন ব্যক্তি ব্যাগেজসহ ফ্লাইটের জন্য কত টাকা দিতে প্রস্তুত, অথবা মেট্রোর নিকটবর্তী হওয়া তার জন্য কতটা গুরুত্বপূর্ণ। ধারণাটি আকর্ষণীয়: যদি মডেলটি মানুষের রুচি সম্পর্কে যথেষ্ট ভালো জানে, তাহলে তার উত্তরের ভিত্তিতে স্বয়ংক্রিয়ভাবে পণ্য, দাম এবং পরিষেবা নির্বাচন করা যেতে পারে। কিন্তু কীভাবে যাচাই করা যায় যে এই মূল্যায়নগুলো действительно স্থিতিশীল পছন্দকে প্রতিফলিত করে, নাকি এলোমেলো শব্দ মাত্র?

একদল গবেষক বৈজ্ঞানিক দৃষ্টিকোণ থেকে এটি পরীক্ষা করার সিদ্ধান্ত নেন। উত্তরের যৌক্তিকতা প্রথম নজরে দেখার বদলে, তারা আরও কঠোর প্রশ্ন তুলেছিলেন: মডেলের উত্তরগুলোকে কি একটি একক ইউটিলিটি ফাংশন দিয়ে বর্ণনা করা যায়? ইউটিলিটি ফাংশন হলো পছন্দ সাজানোর একটি গাণিতিক উপায়: যদি এটি বিদ্যমান থাকে, তাহলে সব উত্তর একে অপরের সাথে সামঞ্জস্যপূর্ণ হতে হবে। উদাহরণস্বরূপ, যদি আপনি বলেন যে যাতায়াতের সময় এক ঘণ্টা কমানোর জন্য অতিরিক্ত ৫০০ টাকা দিতে প্রস্তুত, কিন্তু তারপর এমন একটি বিকল্প বেছে নেন যা বেশি সময়সাপেক্ষ এবং দামেও বেশি — এটি ইতিমধ্যেই একটি দ্বন্দ্ব।
পদ্ধতি: অসামঞ্জস্য কীভাবে পরিমাপ করা যায়
লেখকরা পরিসংখ্যানগত পরীক্ষা তৈরি করেছেন যা পরিমাপ করতে সাহায্য করে যে মডেলের উত্তরগুলো সর্বোত্তমভাবে নির্বাচিত ইউটিলিটি ফাংশন থেকে কতটা বিচ্যুত হয়। যদি বিচ্যুতি কম হয়, তাহলে মডেলটি তার পছন্দে প্রায় ধারাবাহিক। যদি বেশি হয় — তাহলে মতামতগুলো এলোমেলো বা পরিস্থিতিগত, এবং সেগুলোকে একক স্কেলে আনা যায় না।
পরীক্ষাগুলো তিন ধরনের পরিস্থিতিতে পরিচালিত হয়েছিল: বিমান ভ্রমণ নির্বাচন, অ্যাপার্টমেন্ট ভাড়া এবং হোটেল বুকিং। এগুলো বাস্তবসম্মত ক্ষেত্র, যেখানে অর্থ প্রদানের ইচ্ছা মূল্যায়ন ব্যবসার জন্য বিশেষভাবে গুরুত্বপূর্ণ। পরীক্ষায় ছয়টি ভিন্ন বড় ভাষার মডেল অংশ নিয়েছিল — এতে নমুনাটি আরও প্রতিনিধিত্বশীল।
ফলাফল: সর্বত্র দ্বন্দ্ব
দেখা গেল, ছয়টি মডেলই ধারাবাহিকভাবে পরস্পরবিরোধী উত্তর দেয়। অর্থাৎ, একই ধরনের প্রশ্ন ভিন্ন ভিন্ন শব্দে করা হলে, তারা উচ্চ সম্ভাবনায় এমন বিকল্প বেছে নেয় যা একে অপরের সাথে খাপ খায় না। উদাহরণস্বরূপ, একটি মডেল বলতে পারে যে পার্কিংয়ের ব্যবস্থা তার জন্য অত্যন্ত গুরুত্বপূর্ণ, কিন্তু দুটি নির্দিষ্ট অ্যাপার্টমেন্ট তুলনা করার সময় তার জন্য অতিরিক্ত অর্থ দিতে অস্বীকার করে, যদিও আগে সে তার প্রস্তুতি জানিয়েছিল।

এই ধরনের পার্থক্য ত্রুটির মাধ্যমে ব্যাখ্যা করা কঠিন। গবেষকরা জোর দিয়ে বলেন যে এটি বরং একটি পদ্ধতিগত বৈশিষ্ট্য: বড় ভাষার মডেলগুলোর কোনো স্থির 'রুচি' নেই, বরং প্রতিটি উত্তর তারা নতুন করে তৈরি করে, প্রসঙ্গ এবং সম্ভাব্যতামূলক নিদর্শনের ভিত্তিতে। তাই এগুলো খসড়া ধারণার জন্য ব্যবহার করা যেতে পারে, কিন্তু ব্যক্তিগত পছন্দের সঠিক মডেলিংয়ের জন্য নয়।
কেন এটি অনুশীলনের জন্য গুরুত্বপূর্ণ
প্রাপ্ত ফলাফল একাধিক জনপ্রিয় ধারণাকে সরাসরি আঘাত করে। আচরণগত অর্থনীতি এবং বিপণনে, LLM-কে স্বয়ংক্রিয় ব্যক্তিগতকরণের জন্য ব্যবহার করার কথা ক্রমবর্ধমানভাবে বলা হচ্ছে: ধরা যাক, মডেলটি ব্যবহারকারীর অনুরোধ থেকে তার পছন্দ শিখেছে এবং এখন সর্বোত্তম অফার নির্বাচন করতে পারে। কিন্তু যদি মডেলের নিজস্ব মতামতই অভ্যন্তরীণভাবে পরস্পরবিরোধী হয়, তাহলে তার উপর ভিত্তি করে তৈরি যেকোনো অপ্টিমাইজেশন অ্যালগরিদম ব্যর্থ হবে।
অধিকন্তু, এই সমস্যাটি গবেষণা পদ্ধতিগুলোকেও স্পর্শ করে। যদি কোনো গবেষক জরিপে ইউটিলিটি মূল্যায়নের জন্য LLM ব্যবহার করেন, তাহলে তাকে প্রথমে নিশ্চিত হতে হবে যে মডেলটি এলোমেলো উত্তর দিচ্ছে না। অন্যথায়, সেই গবেষণার ফলাফল অবিশ্বস্ত হবে।
সুসংবাদটি হলো, লেখকরা শুধু সমস্যাটি নির্দেশ করেননি, বরং এর নির্ণয়ের জন্য সরঞ্জামও প্রস্তাব করেছেন — পরীক্ষা এবং বিচ্যুতির সূচক। নতুন মডেল যাচাই বা বিদ্যমানগুলোর উন্নতিতে এগুলো ইতিমধ্যেই ব্যবহার করা যেতে পারে। সম্ভবত, সময়ের সাথে সাথে বিশেষ প্রশিক্ষণ পদ্ধতি তৈরি হবে যা মতামতের স্ব-সামঞ্জস্য বাড়াবে। কিন্তু এখনও LLM-কে মানুষের প্রকৃত চাহিদা সম্পর্কে নির্ভরযোগ্য তথ্যের উৎস হিসেবে বিশ্বাস করা অকাল।



