অনিয়মিত টাইম সিরিজ: কেন MSE এখন পুরনো?
অনিয়মিত টাইম সিরিজের পূর্বাভাস — এমন একটি কাজ যা সর্বত্র দেখা যায়: আর্থিক লেনদেন থেকে শুরু করে মেডিকেল সেন্সরের ডেটা পর্যন্ত। এই ধরনের সিরিজে পর্যবেক্ষণগুলো সমান ব্যবধানে আসে না, বরং এলোমেলোভাবে, ফাঁক ও ঘনত্বসহ আসে। প্রথম নজরে মনে হতে পারে যে এখানে মূল সমস্যা হলো একটি বুদ্ধিমান মডেল তৈরি করা যা ডেটার অনিয়ম মোকাবিলা করতে পারে। তবে, arXiv-এর গবেষকদের সাম্প্রতিক কাজ (প্রিপ্রিন্ট 2608.17293) যেমন দেখায়, আরও একটি মৌলিক সমস্যা রয়েছে: আমরা কেবল এই মডেলগুলোর গুণমান ভুলভাবে মূল্যায়ন করছি।
পরিমাপের অদৃশ্য ত্রুটি
বহু বছর ধরে, পূর্বাভাসের গুণমান মূল্যায়নের জন্য ডি-ফ্যাক্টো মান হলো গড় বর্গীয় ত্রুটি (MSE)। যুক্তিটি সহজ: পূর্বাভাস এবং বাস্তবতার মধ্যে পার্থক্য যত কম, তত ভালো। কিন্তু এই যুক্তিটি ভেঙে পড়ে যখন অনিয়মিত টাইম সিরিজের কথা আসে।
দোষটা বিস্তারিতের মধ্যে লুকিয়ে আছে: MSE শুধুমাত্র সেই সময়ের মুহূর্তগুলোতে ত্রুটি পরিমাপ করে যখন ডেটাতে প্রকৃত পর্যবেক্ষণ থাকে। অনিয়মিত সিরিজে এই মুহূর্তগুলো অত্যন্ত অসমভাবে বিতরণ করা হয়। ফলে, চূড়ান্ত মেট্রিকটি মডেলটি প্রক্রিয়াটি কতটা ভালোভাবে বোঝে তার উপর নয়, বরং নির্দিষ্ট নমুনায় পরিমাপের পয়েন্টগুলো কীভাবে সাজানো হয়েছে তার উপর অনেক বেশি নির্ভর করে।
দুইজন ডাক্তারের কথা কল্পনা করুন যারা রোগীর রক্তচাপ পরিমাপ করছেন। একজন প্রতি ১৫ মিনিটে পরিমাপ করে, অন্যজন দিনে কয়েকবার। এদিকে রক্তচাপ নিজেই ক্রমাগত পরিবর্তিত হয়। যদি আমরা পূর্বাভাসের নির্ভুলতা মূল্যায়ন করি শুধুমাত্র পরিমাপের পয়েন্টগুলোর সাথে তুলনা করে, ফলাফলগুলি শুধুমাত্র পরিমাপের ফ্রিকোয়েন্সির পার্থক্যের কারণে ব্যাপকভাবে ভিন্ন হবে, প্রকৃত পূর্বাভাসের গুণমানের কারণে নয়। গবেষকরা একে পক্ষপাতদুষ্ট মূল্যায়ন বলে অভিহিত করেছেন — একটি মডেল একটি ডেটাসেটে চমৎকার MSE দেখাতে পারে এবং অন্যটিতে ব্যর্থ হতে পারে, শুধুমাত্র কারণ টাইমস্ট্যাম্পগুলো ভিন্নভাবে বিতরণ করা হয়েছে।

এ কারণেই এই প্রসঙ্গে MSE মূলত অ্যালগরিদমের «পূর্বাভাসের ক্ষমতা» নয়, বরং টেস্ট সেটে টাইমস্ট্যাম্পের নির্দিষ্ট কনফিগারেশন পরিমাপ করে।
CSE: টাইমস্ট্যাম্পের পেছনে দেখার চেষ্টা
গবেষণায় প্রস্তাবিত সমাধানটির নাম Continuous-time Squared Error (CSE)। মেট্রিকটির ধারণাটি মার্জিত: পূর্বাভাস এবং বাস্তবতা শুধুমাত্র বিচ্ছিন্ন পর্যবেক্ষণ পয়েন্টে তুলনা করার পরিবর্তে, CSE নিরবিচ্ছিন্ন সময়ে মডেলের ত্রুটি মূল্যায়ন করার চেষ্টা করে।
এটি কীভাবে কাজ করে? মূল প্রক্রিয়া হলো গুরুত্বের ওজন নির্ধারণ (importance weighting)। প্রতিটি পর্যবেক্ষণ পয়েন্ট তার আশেপাশে টাইমস্ট্যাম্পের নমুনা ঘনত্বের ব্যস্তানুপাতিক একটি ওজন পায়। যদি কোনো সময়ের ব্যবধানে অনেক পরিমাপ থাকে, তবে প্রতিটি নির্দিষ্ট পরিমাপ সামগ্রিক মূল্যায়নে কম অবদান রাখে। যদি পরিমাপ বিরল হয়, তাদের ওজন বৃদ্ধি পায়। এটি অনিয়মের প্রভাবকে «মসৃণ» করতে এবং মডেলটি কীভাবে পুরো সময়ের ব্যবধানে আচরণ করে তার একটি সৎ মূল্যায়ন পেতে দেয়, শুধুমাত্র ঘনবসতিপূর্ণ অংশে নয়।
গবেষকরা শুধুমাত্র স্বজ্ঞাত ব্যাখ্যায় সীমাবদ্ধ থাকেননি — তারা তাত্ত্বিক প্রমাণও দিয়েছেন। তাদের গণনা অনুসারে, «সত্য» নিরবিচ্ছিন্ন সময়ের ঝুঁকির সাপেক্ষে CSE মূল্যায়নের অ্যাসিম্পটোটিক ত্রুটি ক্লাসিক্যাল MSE-এর চেয়ে বেশি নয়। সহজ ভাষায়, পর্যাপ্ত পরিমাণে বড় ডেটা থাকলে CSE গাণিতিকভাবে নিশ্চিতভাবে মডেলটি কতটা ভালো তার আরও সঠিক উপস্থাপনা দেয়।

পরীক্ষা-নিরীক্ষা এবং বাস্তবতা
তাদের মেট্রিক যাচাই করার জন্য, গবেষকরা একটি পদ্ধতিগত বেঞ্চমার্ক তৈরি করেছেন। এটি সিন্থেটিক ডেটা, আধা-সিন্থেটিক (মিশ্র) এবং আটটি বাস্তব ডেটাসেট কভার করে। এই পদ্ধতিটি শুধুমাত্র যাচাই করতে দেয়নি যে CSE মডেল করা উদাহরণগুলিতে কাজ করে, যেখানে প্রকৃত ফলাফল জানা আছে, বরং নতুন মেট্রিকটি বাস্তব, «নোংরা» ডেটাতে কীভাবে আচরণ করে তাও দেখতে দিয়েছে।
ফলাফলগুলি তাৎপর্যপূর্ণ ছিল। CSE নিরবিচ্ছিন্ন ঝুঁকি (অর্থাৎ মডেলের প্রকৃত ত্রুটি) MSE-এর চেয়ে উল্লেখযোগ্যভাবে বেশি নির্ভুলভাবে পুনর্গঠন করে। অনুশীলনকারীদের জন্য প্রধান উপসংহার: শুধুমাত্র MSE-এর উপর নির্ভর করা বিভ্রান্তিকর হতে পারে।
বাস্তব পরিস্থিতিতে, একটি মডেল যা MSE অনুযায়ী সেরা বলে মনে হয়, আসলে প্রতিযোগীদের থেকে পিছিয়ে থাকতে পারে, যদি পুরো সময়ের পরিসরে এর গুণমান মূল্যায়ন করা হয়। এবং এর বিপরীতটিও সত্য। এই আবিষ্কারটি অনেক আগের গবেষণার ফলাফল পুনর্বিবেচনা করতে বাধ্য করে, যেখানে নির্দিষ্ট আর্কিটেকচারের শ্রেষ্ঠত্ব সম্পর্কে সিদ্ধান্তগুলো মেট্রিকের একটি আর্টিফ্যাক্টের ফলাফল হতে পারে, অ্যালগরিদমের প্রকৃত শ্রেষ্ঠত্ব নয়।
অনুশীলনে এর অর্থ কী?
CSE-তে রূপান্তর কেবল একটি একাডেমিক খেলা নয়। এটি চিন্তাভাবনার একটি পরিবর্তন। গবেষকদের জন্য, এর অর্থ বেঞ্চমার্ক এবং মডেল তুলনার মান পুনর্বিবেচনার প্রয়োজনীয়তা। নতুন মেট্রিকটি «খড় থেকে শস্য» আলাদা করতে দেয়: বোঝা যায় কোন মডেলগুলো সত্যিই প্রক্রিয়ার গতিশীলতা ভালোভাবে পূর্বাভাস দেয়, এবং কোনগুলো কেবল নমুনার কাঠামোর সাথে খাপ খাইয়ে নিয়েছে।
যে ডেভেলপাররা রেডিমেড পূর্বাভাস লাইব্রেরি ব্যবহার করেন, তাদের মনে রাখা উচিত: পরিচিত রেটিং এবং সূচকগুলো প্রতারণাপূর্ণ হতে পারে। অনিয়মিত ডেটার সাথে কাজ করার জন্য একটি মডেল নির্বাচন করার সময়, শুধুমাত্র ঘোষিত MSE-এর দিকে নয়, বরং ডেটা আসার বিভিন্ন মোডে এটি কীভাবে আচরণ করে সেদিকেও নজর দেওয়া উচিত। সম্ভবত, শীঘ্রই আমরা জনপ্রিয় লাইব্রেরিগুলিতে CSE-এর অন্তর্ভুক্তি দেখতে পাব — অন্ততপক্ষে, লেখকরা ইতিমধ্যে তাদের বাস্তবায়নের কোড খুলে দিয়েছেন।
সারমর্ম সহজ: যদি আপনি অনিয়মিত টাইম সিরিজ নিয়ে কাজ করেন, তবে এখন নিজেকে প্রশ্ন করার সময় এসেছে — আপনি যে মেট্রিকটির দিকে তাকিয়ে আছেন, সেটি কি সত্যিই প্রতিফলিত করে যা আপনি পরিমাপ করতে চান? সম্ভবত, উত্তরটি হবে নেতিবাচক।



