মেশিন পর্যালোচনাকারীঃ জিপি, গেইমিন এবং ক্লড এর বৈজ্ঞানিক কাগজপত্রের সংক্ষিপ্ত বিশ্লেষণ

14 আগস্ট 2026২০ প্রদর্শন

গবেষকেরা তিনটি বড় ভাষার মডেলের পর্যালোচনার তুলনা করেছেন। তারা আবিষ্কার করে যে, এই অ্যালগরিদম আস্থার সঙ্গে গ্রহণ করা হয়েছে, কিন্তু তা বাতিল করে দেওয়া হয়েছে, তবে তারা এবং পোস্টারের মর্যাদা এবং পোস্টারের ক্ষেত্রে আরো সূক্ষ্ম পার্থক্য অর্জন করতে ব্যর্থ হয়েছে।.

মেশিন পর্যালোচনাকারীঃ জিপি, গেইমিন এবং ক্লড এর বৈজ্ঞানিক কাগজপত্রের সংক্ষিপ্ত বিশ্লেষণ

ছোট এবং বিন্দুতে

একটি মেশিন শেখার সম্মেলনে একটি আধুনিক ভাষার মডেল কি একটি লাইভ পর্যালোচনাকারী হতে পারে? গবেষকরা সত্যিই আইএলআর উপাদানের ওপর এটা পরীক্ষা করেছিল — ক্ষেত্রের সবচেয়ে সম্মানজনক জায়গাগুলোর মধ্যে একটা । এআরএক্সভিতে প্রকাশিত একটি কাগজে (২৬০৮. ৮৬৫৯), ইব্রাহিম উটো-গাররো এবং জয়ো দিয়াজেরো-রগজ তুলনা করেছেন, মানব সিদ্ধান্তের বিরুদ্ধে বৈজ্ঞানিক হস্তক্ষেপের মূল্যায়নের সাথে তুলনা করেছেন।

উপসংহার হল: প্রত্যাখ্যাত ব্যক্তিদের মাঝে "সাধারনা" কাগজের একটি ভালো কাজ করে, কিন্তু তারা পুরোপুরি জরিমানার পার্থক্য ভুলে যায়, যেমন একটি উপস্থাপনা বা পোস্টার। একই সময়ে প্রত্যেক মডেল তার নিজস্ব স্বাক্ষর প্রদর্শন করে: একজন উদার স্কোর প্রদান করে, আরেকজন শক্ত কাগজের সাথে খুব বেশি কড়া। এ ছাড়া, মেশিন পর্যালোচনাকারীরা মানব বিশেষজ্ঞদের চেয়ে সম্পূর্ণ ভিন্ন দুর্বলতার ওপরও মনোযোগ কেন্দ্রীভূত করে ।

সংক্ষিপ্তভাবে, শক্ত ফিল্টার ব্যবহার করা সম্ভব, কিন্তু চূড়ান্ত সিদ্ধান্তের ওপর পুরোপুরি নির্ভর করা এখন সময় । নিচে, আমরা পরীক্ষা আর আবিষ্কারের বিস্তারিত তথ্য ভেঙে ফেলি।

গবেষণা কিভাবে সেট করা হয়

তথ্য ও অবস্থা

লেখকেরা ৩০০টি আইএলআর ইএলআরএ-এর কাছে জমা দেন এবং তিনটি বিভাগ জুড়ে নমুনাগুলো ঠিক করেন: উপস্থাপনা, পোস্টার, পোস্টার এবং কাগজপত্রগুলো — প্রতি শত শত । এই পদক্ষেপটি নিশ্চিত করে যে মডেলগুলো কেবল অনুমানই করে না কিন্তু সব তিনটি ক্লাসকে পৃথক করতে বাধ্য করা হচ্ছে।

প্রতিটি মডেল GPT-5.4১৯৬ সালে জর্জ ডি. একটা গুরুত্বপূর্ণ বিষয়: মানব সিদ্ধান্তের বিষয়ে তথ্য আগে থেকেই জমাকৃত লেখাগুলো থেকে বাদ দেওয়া হয়েছিল । এটা দরকার এই প্রশ্নের উত্তর না দেয়া আর সত্যিকার অর্থে পরীক্ষা করা যে মডেলের স্বাধীন বিচার করার ক্ষমতা আছে।

তুলনা

গবেষকরা তিনটে কোণ থেকে ফলাফল লক্ষ করেছেন । প্রথমত, তারা পরীক্ষা করে দেখেছে যে মডেলগুলো চূড়ান্ত সিদ্ধান্তের ফলাফল কিভাবে সঠিকভাবে নির্ধারণ করা হয়- উভয় ক্ষেত্রেই (ভ্রমণ বা না) এবং বিস্তারিত ভাবে (অথবা পোস্টার)। দ্বিতীয়ত, তারা গবেষণা করেছে কি ভাবে মডেলগুলো সুপারিশের মাত্রা ব্যবহার করছে: উদাহরণ হিসেবে বলা যায়, যদি তারা স্কোরের পরিমাণ হিসেব করে। তৃতীয়ত, তারা যেগুলোকে কাগজপত্রের দুর্বলতার সঙ্গে তুলনা করে, সেগুলো মানুষের দ্বারা এবং অ্যালগরিদমের মধ্যে পাওয়া যায় ।

ফলাফল কী হয়

জমা দেওয়ার পরিণতিকে অবহেলা করা

সবচেয়ে উৎসাহজনক সংবাদ: তিনটি এলএমএল আস্থার সাথে সব পত্রিকা বাতিল করা হয়েছে। এর মানে মডেল পর্যালোচনা করে কনফারেন্স সংক্রান্ত তথ্য প্রশিক্ষণ ছাড়া গুরুত্বপূর্ণ সংকেত বহন করা হয়। তবে, সাফল্য সেখানেই শেষ হয় ।

কোন মডেলই মানব বিচার ব্যবস্থার মধ্যে পার্থক্য পুনরায় ঘটাতে সক্ষম হয়নি। এই অ্যালগরিদমের জন্য যে সমস্ত কাগজ গ্রহণ করা হয়েছে, সেগুলো মনে হয় সমান আকার ধারণ করেছে, এমনকি যদিও কোন উপস্থাপনা বা পোস্টারের মধ্যে উল্লেখযোগ্য অনুক্রম রয়েছে। এটি একটি গুরুত্বপূর্ণ ফাঁক: উত্তম মানের মান যা কেবলমাত্র ভালো কাজের থেকে উল্লেখযোগ্য গবেষণা থেকে আলাদা, কিন্তু মেশিন দ্বারা এখনো ধরা হয় নি।

মডেল উপলব্ধকারীর মধ্যে পার্থক্য

মডেলটির আচরণ আরো শক্তিশালী হয়েছে ডেভেলপারের সাথে। ৩. ১ প্রোপ্লিকেশন একটি ক্লাসিক পর্যালোচনার মতো কাজ করেছে: এর স্কোর নিয়মিত গড়ে যাচ্ছে। মজার, GPT-5.4 এবং ক্লড Opus 4.6 মানুষের কাছে ছিল যখন তা প্রত্যাখ্যান ও পোস্টার পেপারে স্বাক্ষর করা হয়েছিল, কিন্তু একই সময়ে তাদের প্রতি কঠোর আচরণ দেখানো হয়েছে।

( ১ করি. উচ্চ প্রত্যাশার কারণে হয়তো মডেলগুলো শক্তিশালী কাগজের মাধ্যমে তৈরি করা হয়েছে: একটি দুর্বল লেখার পরিবর্তে একটি ভালো জায়গায় নিরাপদ স্থান খুঁজে পাওয়া সহজ। অথবা সম্ভবত স্থাপত্যশিল্পের দৃষ্টি আকর্ষণ করে কি ভাবে প্রশংসা করা যায় তা জানে না: এর জন্য “ভাল” এবং “ভাল” শব্দের মধ্যে কোন পার্থক্য নেই।

বিষয়

সবচেয়ে কৌতূহলী অংশ হলো মেশিন পর্যালোচনাকারীদের মনোযোগ আকর্ষণ করা। তিনটে মডেলই প্রায়ই মৌলিক তুলনামূলক পরীক্ষাগুলোর অভাব — বৈজ্ঞানিক কাজের এক প্রাচীন সমালোচনা । এদিকে, মানব বিশেষজ্ঞরা অনেক বেশী সময় ব্যয়ের দক্ষতা নিয়ে প্রশ্ন তুলেছে: কতগুলো প্রস্তাবিত পদ্ধতি প্রয়োজন, সেটা কতটা ব্যবহারিক।

এটা শুধু স্টাইলের পার্থক্য নয়. এটা অগ্রাধিকারের পার্থক্য তুলে ধরে। মানুষ আসল বিশ্ব আবেদনের কথা চিন্তা করছে, প্রশিক্ষণ ও বিতরণের খরচ নিয়ে, যেখানে মডেলরা টেক্সটকে একটি আনুষ্ঠানিক দলিল হিসেবে মূল্যায়ন করে। আপনি যদি একটা কাগজের প্রাথমিক চেকের জন্য এলএমএল ব্যবহার করেন, তা হলে আপনাকে প্রস্তুত থাকতে হবে যে, কিছু গুরুত্বপূর্ণ মন্তব্য আপনার কাছে আসবে না ।

অন্তর্ভুক্ত

এই গবেষণার প্রধান পাঠ হচ্ছে, “গণনা/অভিভাবিত” স্তরে মডেলের সঠিক অবস্থান এখনো বিস্তারিত মূল্যায়নের ক্ষেত্রে তার প্রতিযোগিতাকে নির্দেশ করে না। এটা ঠিক যে, অন্যদের কাছ থেকে দুর্বল কাগজ আলাদা করার ক্ষমতা খুবই জরুরি ।

এই ব্যবহারিক প্রযুক্তিটি স্বয়ং পরামর্শ প্রদান করছে: প্রাথমিক সহকারী হিসেবে এলএমএলএল ব্যবহার করা যেতে পারে, যা সুস্পষ্ট ভাবে জমা দেওয়া অথবা পতাকার সুস্পষ্ট ত্রুটির মধ্যে দিয়ে তৈরি করা হয়। কিন্তু কঠিন কাগজের ভাগ্য মানুষের সাথে থাকা উচিত- যদি মানুষের মূল্যবোধের মাত্রা (যদি দক্ষতা, সাহিত্য, ক্ষেত্রের মূল্যায়ন), তবুও কম্পিউটারের চরিত্র থেকে আলাদা।

দীর্ঘ সময় ধরে, নির্দিষ্ট সম্প্রদায়ের জন্য মডেল এবং নির্দিষ্ট পর্যালোচনাকারীদের জন্য এটা বোঝা যেতে পারে। কিন্তু তা না হওয়া পর্যন্ত, বৈজ্ঞানিক যোগাযোগ ব্যবস্থায় স্বয়ংক্রিয় পর্যালোচনার ওপর নির্ভর করা খুবই কম সময় ।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
জিপিটি, গেইমিন এবং ক্লড — বৈজ্ঞানিক কাজগুলো সম্বন্ধে এক তুলনামূলক পর্যালোচনা