টেবিলের বদলে কাঁচা I/Q: EMRB যাচাই করে, LLM-গুলো কোডের মাধ্যমে রেডিও সিগন্যাল নিয়ে যুক্তি করতে সক্ষম কি না

16 সেপ্টেম্বর 2026২০ প্রদর্শন

নতুন EMRB বেঞ্চমার্ক মডেলগুলোর কাছে তৈরি ফিচার নয়, বরং কাঁচা সিগন্যাল রেকর্ড দেয়: প্রয়োজনীয় মানগুলো খুঁজে বের করতে কোড লিখে চালাতে হবে। সেটে পাঁচটি কঠিনতার স্তরে ২০০টি টাস্ক এবং ২৭ ধরনের প্রশ্ন রয়েছে, আর পরীক্ষিত LLM-গুলোতে সাধারণ পরিমাপ ও সিস্টেম ডিজাইনের মধ্যে ব্যবধান খুবই লক্ষণীয় হয়ে উঠেছে।

টেবিলের বদলে কাঁচা I/Q: EMRB যাচাই করে, LLM-গুলো কোডের মাধ্যমে রেডিও সিগন্যাল নিয়ে যুক্তি করতে সক্ষম কি না

কাঁচা ডেটা, তৈরি টেবিলের বদলে

মডেলগুলো 점점 더 কোড এজেন্টের ভূমিকায় কাজ করছে: তাদের ডেটা প্রসেসিংয়ের স্ক্রিপ্ট লেখা, গ্রাফ তৈরি, মেট্রিক গণনা, ইঞ্জিনিয়ারিং ডেটা বিশ্লেষণের দায়িত্ব দেওয়া হয়। কিন্তু এমন এক শ্রেণির কাজ আছে যা এখনও প্রায় পরীক্ষা করা হয়নি — ভৌত স্তরের "কাঁচামাল" নিয়ে কাজ করা। ঠিক এই শূন্যস্থানই পূরণ করে EMRB (Electromagnetic Reasoning Benchmark) বেঞ্চমার্ক, যা arXiv:2608.24086 প্রিপ্রিন্টে (cs.AI, cs.CE, cs.SE বিভাগ) বর্ণিত হয়েছে।

মূল ধারণাটি সরল, তাই убедительнымও। ইনপুটে শুধু কাঁচা I/Q রেকর্ডিং, অর্থাৎ কোয়াড্রেচার স্যাম্পল, যেমন রিসিভার থেকে আসে। কোনো পূর্ব-প্রক্রিয়াজাত ফিচার নেই, লেবেলযুক্ত স্পেকট্রোগ্রাম নেই, আর অবশ্যই তৈরি মানের টেবিল নেই। প্রশ্ন যে রাশিকে নিয়ে, মডেলকে প্রথমে তা ডেটার মধ্যে খুঁজে বের করতে হবে — নিজে লেখা ও চালানো কোডের মাধ্যমে।

সাধারণ পরিমাপ থেকে এটি কীভাবে আলাদা

গত কয়েক বছরে অনেক টাস্ক সেট এসেছে যেখানে মডেলদের রেডিও সিগন্যাল নিয়ে যুক্তি করার প্রস্তাব দেওয়া হয়। কিন্তু বেশিরভাগ ক্ষেত্রেই মডেলের হয়ে কাজটি আগেই করা থাকে: রেকর্ডিং থেকে ফিচার বের করা, স্পেকট্রাম গণনা, নয়েজ লেভেল অনুমান, সবকিছু একটি কাঠামোবদ্ধ টেবিলে সাজানো। এমন বিন্যাসে শুধু পাটিগণিত ও সংখ্যা মেলানো বাকি থাকে — দক্ষতা দরকারি, কিন্তু রেডিওফিজিক্সের সঙ্গে সম্পর্কহীন।

পার্থক্যটি মৌলিক। যখন রাশিগুলো আগেই দেওয়া থাকে, প্রাথমিক ধাপে মডেলের ভুল চোখে পড়ে না: ব্যান্ডউইথ বা ফ্রিকোয়েন্সির ভুল অনুমান হয়ই না, কারণ এই মানগুলো শর্তে দেওয়া আছে। কিন্তু ডেটা যখন অপরিশোধিত, সিগন্যাল রেকনেসান্সের ধাপে যেকোনো ভুল পরবর্তী পুরো গণনাকে টেনে নিয়ে যায়। তাই EMRB পরিভাষার জ্ঞান নয়, বরং একটি শৃঙ্খল গড়ার সক্ষমতা পরীক্ষা করে: স্যাম্পলগুলোর দিকে তাকানো, বোঝা যে সেখানে কী সিগন্যাল আছে, প্রয়োজনীয় বৈশিষ্ট্য আলাদা করা, তা সঠিকভাবে গণনা করা এবং মাত্রা হারিয়ে না ফেলা।

বেঞ্চমার্কটি কীভাবে সাজানো

লেখকরা — Mingxu Zhang, Ying Sun, Yuhan Li, Yang Ji, Dazhong Shen, Ke Zhang এবং Shan Huang — ২০০টি কাজ সংকলন করেছেন। কাজগুলো পাঁচটি কঠিনতার স্তর এবং ২৭টি প্রশ্নের ধরনে সাজানো: সিগন্যাল শনাক্তকরণ থেকে শুরু করে OFDM সিস্টেম ডিজাইন পর্যন্ত। উপাদানের উৎস ১১ ধরনের সিগন্যাল, প্রতিটির জন্য যাচাইকৃত রেফারেন্স গ্রাউন্ড ট্রুথ প্রস্তুত করা হয়েছে।

পাঁচটি স্তর

স্তরগুলো মডেলের স্বাধীনতার ক্রমবর্ধমান ক্রমে সাজানো। নিচে — মৌলিক প্যারামিটার পরিমাপ: সিগন্যাল খুঁজে বের করা, তার বৈশিষ্ট্য অনুমান করা। উপরে — ব্যাখ্যা ও তুলনা, তারপর বহু-ধাপ বিশ্লেষণ, তারপর ডায়াগনস্টিকস এবং সবশেষে সিস্টেম ডিজাইন, যেখানে মডেলকে পরিমাপ করতে নয়, বরং নির্দিষ্ট চাহিদা অনুযায়ী সমাধান ডিজাইন করতে হয়।

২৭ ধরনের প্রশ্ন ও ১১ ধরনের সিগন্যাল

এমন বৈচিত্র্য দরকার যাতে ফলাফল একটি সফল বা ব্যর্থ বাক্যগঠনের উপর নির্ভর না করে। ভিন্ন ধরনের সিগন্যাল ভিন্ন ফাঁদ তৈরি করে: কোথাও নয়েজ বাধা দেয়, কোথাও — স্পেকট্রামে ওভারল্যাপ, কোথাও স্যাম্পলিং নিয়ে সতর্কভাবে কাজ করা দরকার। প্রশ্ন ও সিগন্যালের ধরনের সংখ্যা মিলে এমন একটি ক্ষেত্র তৈরি করে যেখানে আকস্মিকভাবে অনুমান করা কঠিন।

উন্মুক্ত ডেটা

সব উপাদান ও কোড একটি পাবলিক GitHub রিপোজিটরিতে রাখা হয়েছে, তাই ফলাফল স্বাধীনভাবে পুনরায় যাচাই করা যায়। বেঞ্চমার্কের জন্য এটি সাধারণের চেয়ে বেশি গুরুত্বপূর্ণ: যদি কাজগুলো মাঠের রেকর্ডিং থেকে হাতে সংকলিত না হয়ে জেনারেট করা হয়, তবে রেফারেন্সের সঠিকতার প্রশ্নটি কেন্দ্রীয় হয়ে ওঠে — এবং এখানে উন্মুক্ততাই একমাত্র কার্যকর উত্তর।

মডেলগুলো কী দেখাল

১৪টি ভাষা মডেল পরীক্ষা করা হয়েছে: মালিকানাধীন, ওপেন-ওয়েট এবং আলাদাভাবে যুক্তি-কেন্দ্রিক মডেল। চূড়ান্ত বিস্তার — ২৪.১% থেকে ৭৮.৯%। এই পরিসরই অনেক কিছু বলে: সেরা ও সবচেয়ে খারাপ মডেলের মধ্যে পার্থক্য এখানে শতাংশে নয়, গুণে মাপা হয়।

কিন্তু আরও আকর্ষণীয় অন্য কিছু। স্তর জটিল হওয়ার সঙ্গে সঙ্গে গড় ফলাফল তীব্রভাবে কমে: মৌলিক পরিমাপে ৮৪.৯% থেকে সিস্টেম ডিজাইনে ২১.২%। অর্থাৎ মডেলগুলো পরিমাপযোগ্য রাশি গণনা করতে গেলে বেশ ভালো করে, কিন্তু সেই রাশিগুলো থেকে একটি কার্যকর সমাধান গড়তে গেলে প্রায় ভেঙে পড়ে।

এটি র্যাঙ্কিং নয়, রোগনির্ণয় হিসেবে পড়া উচিত। বর্তমান মডেলগুলোর শক্তি — কোড সম্পাদন এবং পরিচিত বিন্যাসের উপর পাটিগণিত। দুর্বলতা — একটি ইঞ্জিনিয়ারিং কাজকে পরিমাপযোগ্য ধাপের ভাষায় অনুবাদ করা: কোন রাশিগুলো আদৌ দরকার, কোন ক্রমে খুঁজতে হবে, পাওয়া ফলটি আদৌ সঠিকের কাছাকাছি কি না তা যাচাই করা। ঠিক এই ফাঁকই বেঞ্চমার্কটিকে দরকারি করে তোলে।

ReconPilot: রেকনেসান্স, বিশ্লেষণ, যাচাই

লেখকরা শুধু পরিমাপেই সীমাবদ্ধ থাকেননি। তাঁরা ReconPilot প্রস্তাব করেছেন — একটি কাঠামোবদ্ধ পদ্ধতি, যেখানে কাজ তিনটি ধাপে বিভক্ত: সিগন্যাল রেকনেসান্স, লক্ষ্যভিত্তিক বিশ্লেষণ এবং স্ব-যাচাই। প্রথমে মডেল রেকর্ডিংটি অধ্যয়ন করে এবং বুঝে নেয় সে কী নিয়ে কাজ করছে। তারপর নির্দিষ্ট কাজটি সমাধান করে। এরপর নিজের ফলাফলে ফিরে এসে তার সামঞ্জস্য যাচাই করে।

তিনটি বেস মডেলে এই পদ্ধতি মোট স্কোরে ৩.৮ থেকে ১৭.৬ পয়েন্ট যোগ করে। পরীক্ষিত ১৫টি "ব্যাকবোন + স্তর" সমন্বয়ের ১৩টিতে উন্নতি অর্জিত হয়েছে। বাক্যগঠনের দিকে খেয়াল করুন: লাভ সমান নয়, এবং দুটি ক্ষেত্রে তা একেবারেই নেই। এটি সৎ পরীক্ষার স্বাভাবিক লক্ষণ — সর্বজনীন সমাধান মেলেনি, কিন্তু প্রবণতা স্থিতিশীল।

লক্ষণীয় যে, ধাপগুলোর স্পষ্ট বিভাজনই সাহায্য করে। যে মডেলকে শুধু "সিগন্যাল বিশ্লেষণ করো" বলা হয়, সে ডেটা বুঝেছে কি না নিশ্চিত না হয়েই গণনার দিকে ঝাঁপ দেয়। রেকনেসান্সকে আলাদা বাধ্যতামূলক ধাপ হিসেবে রাখলে মডেল আগে দেখতে বাধ্য হয়, তারপর গণনা করে।

এ থেকে কী দাঁড়ায়

ইঞ্জিনিয়ারিং অনুশীলনের জন্য উপসংহারটি বেশ সরাসরি: বাস্তব পরিমাপের উপর এজেন্টের গণনায় ভরসা করার আগে, ইঙ্গিত ছাড়া ডেটায় তাকে পরীক্ষা করা উচিত। সুবিধাজনক ইন্টারফেস এবং চ্যাটে মসৃণ উত্তর কিছুই বলে না যে মডেল রিসিভার থেকে আসা অপরিশোধিত ডেটার মুখোমুখি হলে টিকবে কি না।

আরও সাধারণ একটি ভাবনাও আছে, যা রেডিওর সীমা ছাড়িয়ে যায়। যে কোনো ক্ষেত্রে যেখানে যুক্তি কাঁচা পরিমাপের উপর নির্ভর করে — হাইড্রোঅ্যাকুস্টিকস, কম্পন, টেলিমেট্রি — এজেন্টকে প্রথমে ডেটার মধ্যে রাশিটি খুঁজে বের করতে জানতে হবে, তারপর তা নিয়ে কাজ করতে হবে। ফিচারযুক্ত টেবিল কাজের এই অংশটি লুকিয়ে রাখে, আর তার সঙ্গে লুকিয়ে পড়ে ভুলগুলোও।

সীমাবদ্ধতা ও পরবর্তী কী

প্রশ্নটি সম্পূর্ণ নিষ্পত্তি হয়েছে বলা যায় না। ২০০টি কাজ — পরিমাণ যথেষ্ট, কিন্তু অসীম নয়, আর ১১ ধরনের সিগন্যালের ভিত্তিতে জেনারেশন মানে বাস্তব মাঠের রেকর্ডিং তাদের সব আর্টিফ্যাক্টসহ সেখানে এখনও উপস্থাপিত নয়। ১৪টি মডেলের মূল্যায়ন — মুহূর্তের একটি স্ন্যাপশট, চূড়ান্ত রায় নয়: এই ক্ষেত্রে শীর্ষস্থানীয়দের তালিকা দ্রুত বদলায়।

তবুও কাজটির বিন্যাস সঠিক মনে হয়। আমরা যদি চাই LLM-গুলো ডেটার পুনর্কথনের বদলে ডেটা নিয়েই কাজ করুক, তবে তাদের ঠিক সেখানেই পরীক্ষা করা উচিত যেখানে ইঙ্গিত শেষ হয়। EMRB ঠিক তাই করে — এবং দেখায় যে সিগন্যাল রেকনেসান্সে মডেলগুলোর বৃদ্ধির সুযোগ এখনও অনেক বড়।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
টেবিলের বদলে কাঁচা I/Q: EMRB যাচাই করে, LLM-গুলো কোডের মাধ্যমে রেডিও সিগন্যাল নিয়ে যুক্তি করতে সক্ষম কি না