ছোট এবং বিন্দুতে
একটি মেশিন শেখার সম্মেলনে একটি আধুনিক ভাষার মডেল কি একটি লাইভ পর্যালোচনাকারী হতে পারে? গবেষকরা সত্যিই আইএলআর উপাদানের ওপর এটা পরীক্ষা করেছিল — ক্ষেত্রের সবচেয়ে সম্মানজনক জায়গাগুলোর মধ্যে একটা । এআরএক্সভিতে প্রকাশিত একটি কাগজে (২৬০৮. ৮৬৫৯), ইব্রাহিম উটো-গাররো এবং জয়ো দিয়াজেরো-রগজ তুলনা করেছেন, মানব সিদ্ধান্তের বিরুদ্ধে বৈজ্ঞানিক হস্তক্ষেপের মূল্যায়নের সাথে তুলনা করেছেন।
উপসংহার হল: প্রত্যাখ্যাত ব্যক্তিদের মাঝে "সাধারনা" কাগজের একটি ভালো কাজ করে, কিন্তু তারা পুরোপুরি জরিমানার পার্থক্য ভুলে যায়, যেমন একটি উপস্থাপনা বা পোস্টার। একই সময়ে প্রত্যেক মডেল তার নিজস্ব স্বাক্ষর প্রদর্শন করে: একজন উদার স্কোর প্রদান করে, আরেকজন শক্ত কাগজের সাথে খুব বেশি কড়া। এ ছাড়া, মেশিন পর্যালোচনাকারীরা মানব বিশেষজ্ঞদের চেয়ে সম্পূর্ণ ভিন্ন দুর্বলতার ওপরও মনোযোগ কেন্দ্রীভূত করে ।
সংক্ষিপ্তভাবে, শক্ত ফিল্টার ব্যবহার করা সম্ভব, কিন্তু চূড়ান্ত সিদ্ধান্তের ওপর পুরোপুরি নির্ভর করা এখন সময় । নিচে, আমরা পরীক্ষা আর আবিষ্কারের বিস্তারিত তথ্য ভেঙে ফেলি।

গবেষণা কিভাবে সেট করা হয়
তথ্য ও অবস্থা
লেখকেরা ৩০০টি আইএলআর ইএলআরএ-এর কাছে জমা দেন এবং তিনটি বিভাগ জুড়ে নমুনাগুলো ঠিক করেন: উপস্থাপনা, পোস্টার, পোস্টার এবং কাগজপত্রগুলো — প্রতি শত শত । এই পদক্ষেপটি নিশ্চিত করে যে মডেলগুলো কেবল অনুমানই করে না কিন্তু সব তিনটি ক্লাসকে পৃথক করতে বাধ্য করা হচ্ছে।
প্রতিটি মডেল GPT-5.4১৯৬ সালে জর্জ ডি. একটা গুরুত্বপূর্ণ বিষয়: মানব সিদ্ধান্তের বিষয়ে তথ্য আগে থেকেই জমাকৃত লেখাগুলো থেকে বাদ দেওয়া হয়েছিল । এটা দরকার এই প্রশ্নের উত্তর না দেয়া আর সত্যিকার অর্থে পরীক্ষা করা যে মডেলের স্বাধীন বিচার করার ক্ষমতা আছে।
তুলনা
গবেষকরা তিনটে কোণ থেকে ফলাফল লক্ষ করেছেন । প্রথমত, তারা পরীক্ষা করে দেখেছে যে মডেলগুলো চূড়ান্ত সিদ্ধান্তের ফলাফল কিভাবে সঠিকভাবে নির্ধারণ করা হয়- উভয় ক্ষেত্রেই (ভ্রমণ বা না) এবং বিস্তারিত ভাবে (অথবা পোস্টার)। দ্বিতীয়ত, তারা গবেষণা করেছে কি ভাবে মডেলগুলো সুপারিশের মাত্রা ব্যবহার করছে: উদাহরণ হিসেবে বলা যায়, যদি তারা স্কোরের পরিমাণ হিসেব করে। তৃতীয়ত, তারা যেগুলোকে কাগজপত্রের দুর্বলতার সঙ্গে তুলনা করে, সেগুলো মানুষের দ্বারা এবং অ্যালগরিদমের মধ্যে পাওয়া যায় ।

ফলাফল কী হয়
জমা দেওয়ার পরিণতিকে অবহেলা করা
সবচেয়ে উৎসাহজনক সংবাদ: তিনটি এলএমএল আস্থার সাথে সব পত্রিকা বাতিল করা হয়েছে। এর মানে মডেল পর্যালোচনা করে কনফারেন্স সংক্রান্ত তথ্য প্রশিক্ষণ ছাড়া গুরুত্বপূর্ণ সংকেত বহন করা হয়। তবে, সাফল্য সেখানেই শেষ হয় ।
কোন মডেলই মানব বিচার ব্যবস্থার মধ্যে পার্থক্য পুনরায় ঘটাতে সক্ষম হয়নি। এই অ্যালগরিদমের জন্য যে সমস্ত কাগজ গ্রহণ করা হয়েছে, সেগুলো মনে হয় সমান আকার ধারণ করেছে, এমনকি যদিও কোন উপস্থাপনা বা পোস্টারের মধ্যে উল্লেখযোগ্য অনুক্রম রয়েছে। এটি একটি গুরুত্বপূর্ণ ফাঁক: উত্তম মানের মান যা কেবলমাত্র ভালো কাজের থেকে উল্লেখযোগ্য গবেষণা থেকে আলাদা, কিন্তু মেশিন দ্বারা এখনো ধরা হয় নি।
মডেল উপলব্ধকারীর মধ্যে পার্থক্য
মডেলটির আচরণ আরো শক্তিশালী হয়েছে ডেভেলপারের সাথে। ৩. ১ প্রোপ্লিকেশন একটি ক্লাসিক পর্যালোচনার মতো কাজ করেছে: এর স্কোর নিয়মিত গড়ে যাচ্ছে। মজার, GPT-5.4 এবং ক্লড Opus 4.6 মানুষের কাছে ছিল যখন তা প্রত্যাখ্যান ও পোস্টার পেপারে স্বাক্ষর করা হয়েছিল, কিন্তু একই সময়ে তাদের প্রতি কঠোর আচরণ দেখানো হয়েছে।
( ১ করি. উচ্চ প্রত্যাশার কারণে হয়তো মডেলগুলো শক্তিশালী কাগজের মাধ্যমে তৈরি করা হয়েছে: একটি দুর্বল লেখার পরিবর্তে একটি ভালো জায়গায় নিরাপদ স্থান খুঁজে পাওয়া সহজ। অথবা সম্ভবত স্থাপত্যশিল্পের দৃষ্টি আকর্ষণ করে কি ভাবে প্রশংসা করা যায় তা জানে না: এর জন্য “ভাল” এবং “ভাল” শব্দের মধ্যে কোন পার্থক্য নেই।
বিষয়
সবচেয়ে কৌতূহলী অংশ হলো মেশিন পর্যালোচনাকারীদের মনোযোগ আকর্ষণ করা। তিনটে মডেলই প্রায়ই মৌলিক তুলনামূলক পরীক্ষাগুলোর অভাব — বৈজ্ঞানিক কাজের এক প্রাচীন সমালোচনা । এদিকে, মানব বিশেষজ্ঞরা অনেক বেশী সময় ব্যয়ের দক্ষতা নিয়ে প্রশ্ন তুলেছে: কতগুলো প্রস্তাবিত পদ্ধতি প্রয়োজন, সেটা কতটা ব্যবহারিক।
এটা শুধু স্টাইলের পার্থক্য নয়. এটা অগ্রাধিকারের পার্থক্য তুলে ধরে। মানুষ আসল বিশ্ব আবেদনের কথা চিন্তা করছে, প্রশিক্ষণ ও বিতরণের খরচ নিয়ে, যেখানে মডেলরা টেক্সটকে একটি আনুষ্ঠানিক দলিল হিসেবে মূল্যায়ন করে। আপনি যদি একটা কাগজের প্রাথমিক চেকের জন্য এলএমএল ব্যবহার করেন, তা হলে আপনাকে প্রস্তুত থাকতে হবে যে, কিছু গুরুত্বপূর্ণ মন্তব্য আপনার কাছে আসবে না ।

অন্তর্ভুক্ত
এই গবেষণার প্রধান পাঠ হচ্ছে, “গণনা/অভিভাবিত” স্তরে মডেলের সঠিক অবস্থান এখনো বিস্তারিত মূল্যায়নের ক্ষেত্রে তার প্রতিযোগিতাকে নির্দেশ করে না। এটা ঠিক যে, অন্যদের কাছ থেকে দুর্বল কাগজ আলাদা করার ক্ষমতা খুবই জরুরি ।
এই ব্যবহারিক প্রযুক্তিটি স্বয়ং পরামর্শ প্রদান করছে: প্রাথমিক সহকারী হিসেবে এলএমএলএল ব্যবহার করা যেতে পারে, যা সুস্পষ্ট ভাবে জমা দেওয়া অথবা পতাকার সুস্পষ্ট ত্রুটির মধ্যে দিয়ে তৈরি করা হয়। কিন্তু কঠিন কাগজের ভাগ্য মানুষের সাথে থাকা উচিত- যদি মানুষের মূল্যবোধের মাত্রা (যদি দক্ষতা, সাহিত্য, ক্ষেত্রের মূল্যায়ন), তবুও কম্পিউটারের চরিত্র থেকে আলাদা।
দীর্ঘ সময় ধরে, নির্দিষ্ট সম্প্রদায়ের জন্য মডেল এবং নির্দিষ্ট পর্যালোচনাকারীদের জন্য এটা বোঝা যেতে পারে। কিন্তু তা না হওয়া পর্যন্ত, বৈজ্ঞানিক যোগাযোগ ব্যবস্থায় স্বয়ংক্রিয় পর্যালোচনার ওপর নির্ভর করা খুবই কম সময় ।



