PTXBench: LLM-এর GPU-কার্নেল অপ্টিমাইজ করার দক্ষতা পরিমাপের নতুন উপায়

3 সেপ্টেম্বর 2026১৭ প্রদর্শন

বেঞ্চমার্কটি H100 এবং B200 GPU-এর জন্য GEMM এবং attention কাজে মডেলগুলো পরীক্ষা করে — সঠিকতা থেকে প্রকৃত গতির উন্নতি পর্যন্ত। ফলাফল দেখায় যে, লক্ষ্য নির্দেশাবলীর সঠিক সম্পাদনও প্রতিযোগিতামূলক কর্মক্ষমতা নিশ্চিত করে না।

PTXBench: LLM-এর GPU-কার্নেল অপ্টিমাইজ করার দক্ষতা পরিমাপের নতুন উপায়

শিরোনাম: GPU-কernel অপ্টিমাইজেশনের জন্য নতুন বেঞ্চমার্ক PTXBench

GPU-কernel অপ্টিমাইজেশনের জন্য সাধারণত হার্ডওয়্যার আর্কিটেকচার এবং নিম্ন-স্তরের নির্দেশাবলীর গভীর বোঝাপড়ার প্রয়োজন হয়। ভাষার মডেলগুলো এখনও এই কাজে ধারাবাহিকভাবে সফল হতে পারছে না: তারা বিশ্বাসযোগ্য কোড তৈরি করতে পারে, কিন্তু তা সবসময় সঠিক এবং দ্রুত হয় না। PTXBench — একটি নতুন বেঞ্চমার্ক যা এই প্রক্রিয়ায় পরিমাপযোগ্যতা এবং স্বচ্ছতা আনার চেষ্টা করে।

PTXBench কী এবং কেন এটি প্রয়োজন

PTXBench হলো বড় ভাষার মডেলগুলোর জন্য একটি মূল্যায়ন প্ল্যাটফর্ম, যারা GPU-কernel অপ্টিমাইজেশনের জন্য আর্কিটেকচার-নির্দিষ্ট PTX (Parallel Thread Execution) ব্যবহার করার চেষ্টা করে। PTX হলো NVIDIA-এর GPU-র জন্য নির্দেশাবলীর একটি মধ্যবর্তী উপস্থাপনা, এবং এই স্তরেই রেজিস্টার, মেমোরি এবং শিডিউলার নিয়ন্ত্রণ করা সম্ভব। সাধারণ বেঞ্চমার্কগুলো শুধুমাত্র চূড়ান্ত কোড পরীক্ষা করে, কিন্তু PTXBench আরও গভীরে দেখে: মডেলটি কি সত্যিই লক্ষ্যযুক্ত নিম্ন-স্তরের নির্দেশাবলী প্রয়োগ করছে, নাকি শুধু "C-এর মতো" কোড তৈরি করছে?

লেখকরা দুটি ক্লাসিক্যাল কাজের উপর জোর দিয়েছেন: ম্যাট্রিক্স গুণন (GEMM) এবং অ্যাটেনশন মেকানিজম, যা ট্রান্সফরমারগুলোর জন্য অত্যন্ত গুরুত্বপূর্ণ। পরীক্ষাগুলো বর্তমান এক্সিলারেটর — H100 এবং B200-তে সম্পাদিত হয়েছে। এই নির্বাচন মডেলের মৌলিক দক্ষতা এবং আধুনিক আর্কিটেকচারের সাথে খাপ খাওয়ানোর ক্ষমতা উভয়ই পরীক্ষা করার সুযোগ দেয়।

বেঞ্চমার্ক কী পরিমাপ করে

PTXBench মডেলগুলোকে তিনটি মূল প্যারামিটারে মূল্যায়ন করে:

  • ফাংশনাল সঠিকতা — তৈরি করা kernel-এর কাজের ফলাফল রেফারেন্সের সাথে মিলতে হবে।
  • লক্ষ্যযুক্ত নির্দেশাবলীর সম্পাদন — রানটাইমে সেই PTX-নির্দেশাবলী দেখা যায় কিনা, যা মডেলের ব্যবহার করা উচিত ছিল।
  • ত্বরণ — তৈরি করা kernel frontier-লাইব্রেরির তুলনায় কত দ্রুত, অর্থাৎ সেরা রেডিমেড বাস্তবায়নের তুলনায়।

এই পদ্ধতি তিনটি ভিন্ন সমস্যাকে আলাদা করে। মডেল সঠিক কোড লিখতে পারে, কিন্তু প্রয়োজনীয় নির্দেশাবলী ব্যবহার নাও করতে পারে। অথবা সেগুলো ব্যবহার করতে পারে, কিন্তু স্ট্যান্ডার্ড লাইব্রেরির চেয়ে খারাপ পারফরম্যান্স পেতে পারে। PTXBench দেখতে দেয় যে ব্যর্থতা ঠিক কোন পর্যায়ে ঘটছে।

ফলাফল: অপ্টিমাইজেশন এখনও মডেলগুলোর জন্য অসম

মূল্যায়ন দেখিয়েছে যে PTX-এর সাথে কাজ করার ক্ষমতা কাজের উপর ব্যাপকভাবে নির্ভর করে। সহজ ক্ষেত্রে মডেলগুলো ভালো ফলাফল দেখায়, কিন্তু attention-এর জটিল backward-কাজে সফল সমাধানের হার দ্রুত কমে যায়। এটি প্রত্যাশিত: ব্যাকওয়ার্ড পাসের জন্য গ্রেডিয়েন্ট এবং মেমোরির সাথে আরও সতর্ক কাজ প্রয়োজন।

আরেকটি গুরুত্বপূর্ণ সিদ্ধান্ত: লক্ষ্যযুক্ত নির্দেশাবলীর সম্পাদন নিজেই গতি নিশ্চিত করে না। মডেল সঠিক PTX-নির্দেশাবলীতে "পৌঁছাতে" পারে, কিন্তু সমান্তরালকরণের ভুল কৌশল বা সিঙ্ক্রোনাইজেশনের ভুল বিন্যাস বেছে নিতে পারে। শেষ পর্যন্ত, পরীক্ষিত কোনো মডেলই পুরো কাজের সেটে frontier-লাইব্রেরির সাথে ধারাবাহিকভাবে প্রতিযোগিতা করতে পারেনি।

মডেলটি কীভাবে ফাইন-টিউন করা হয়েছিল এবং কী কাজ করেছে

এই দক্ষতা উন্নত করা যায় কিনা তা বোঝার জন্য, লেখকরা supervised fine-tuning-এর মাধ্যমে Qwen3.6-27B মডেলটি ফাইন-টিউন করেছেন। অতিরিক্তভাবে, তারা একটি কৌশল ব্যবহার করেছেন যাকে বলা যেতে পারে শর্তসাপেক্ষ সংশোধন প্রশিক্ষণ: মডেলটি শুধু কোড তৈরি করতে নয়, বরং ভুল পদক্ষেপ সম্পর্কে প্রতিক্রিয়া পেয়ে তা সংশোধন করতেও শেখে।

এই পদ্ধতি কিছু কাজের উন্নতি করেছে, কিন্তু সমান অগ্রগতি নিশ্চিত করেনি। সাধারণীকরণ দুর্বল থেকে গেছে: মডেলটি কিছু ধরনের kernel-এ ভালো কাজ করতে পারত এবং অন্যগুলোতে ব্যর্থ হতো। বিশ্লেষণে দেখা গেছে যে প্রশিক্ষণ ডেটাসেটের আকারই একমাত্র নির্ধারক নয়। এর কভারেজ, বিভিন্ন পরিস্থিতির মধ্যে ভারসাম্য এবং "শিক্ষক"-এর গুণমান — যিনি reasoning-চেইনের জন্য উদাহরণ তৈরি করেন — আরও গুরুত্বপূর্ণ। যদি ডেটাতে সহজ ক্ষেত্রের দিকে ঝোঁক থাকে, মডেলটি জটিলতা শিখতে পারবে না।

মূল উপসংহার

PTXBench সম্প্রদায়কে একটি যাচাইযোগ্য পরীক্ষার প্ল্যাটফর্ম দেয়, যেখানে GPU-কernel অপ্টিমাইজেশনে LLM-এর অগ্রগতি ট্র্যাক করা যায়। এটি শুধু "দ্রুত/ধীর" স্কোর দেয় না, বরং দেখায় যে মডেলের পরিকল্পনা কোন স্তরে ভেঙে পড়ে: সিনট্যাক্সে, নির্দিষ্ট নির্দেশাবলীর প্রয়োগে বা কৌশল নির্বাচনে। এটি স্বয়ংক্রিয় kernel অপ্টিমাইজেশনকে অনুমানযোগ্য এবং ব্যবহারিক করার দিকে একটি গুরুত্বপূর্ণ পদক্ষেপ।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
PTXBench: LLM-এর GPU-কার্নেল অপ্টিমাইজ করার দক্ষতা পরিমাপের নতুন উপায়