পৃষ্ঠাগুলোর জন্য সাধারণ স্কেচ কেন কাজ করে না
দীর্ঘ কনটেক্সটে বড় ভাষা মডেল চালানোর মূল বাধা key-value (KV) cache। প্রতিটি ডিকোডিং ধাপে পুরো ক্যাশ পড়া হয়। Attention keys locally low-rank, যদিও globally high-rank। পৃষ্ঠাজুড়ে অভিন্ন একটি নির্দিষ্ট low-rank sketch পৃষ্ঠার দিকগুলোর প্রতি প্রমাণসিদ্ধভাবে অন্ধ।
একই summary আকারে পৃষ্ঠার নিজস্ব ভিত্তি পৃষ্ঠাগুলোকে র্যাংক করে এবং বাহকগুলোকে অনেক ভালোভাবে সংরক্ষণ করে। সাধারণ স্কেচ এই দিকগুলো দেখতে পায় না। প্রতি-কী স্পেকট্রাল summary সমস্যাটি সমাধান করে।

প্রতি পৃষ্ঠায় স্পেকট্রাল সারসংক্ষেপ
LOCKS প্রতিটি পৃষ্ঠাকে নিজস্ব rank-r spectral summary দেয়। সারসংক্ষেপটি রেসিডেন্ট: r=8-এ ক্যাশের এক দশমাংশ এবং r=2-এ এক পঁচিশতমাংশ। পদ্ধতিটি পৃষ্ঠার ভেতরের লজিট পুনর্গঠন করে। এটি log-sum-exp-এর মাধ্যমে প্রতিটি পৃষ্ঠার attention ভর অনুমান করে। তারপর শুধু উপরের পৃষ্ঠাগুলো প্রক্রিয়া করে।
মূল উপাদান:
- নাম: Page-Local Compact Key Summaries for Efficient Long-Context Decoding।
- সারসংক্ষেপ: প্রতিটি পৃষ্ঠার জন্য rank-r spectral summary।
- রেসিডেন্সি: r=8-এ ক্যাশের এক দশমাংশ, r=2-এ এক পঁচিশতমাংশ।
- পুনর্গঠন: পৃষ্ঠার ভেতরের লজিট।
- অনুমান: log-sum-exp-এর মাধ্যমে পৃষ্ঠার attention ভর।
- নির্বাচন: শুধু উপরের পৃষ্ঠাগুলো।
সিদ্ধান্ত: সারসংক্ষেপ ক্যাশের একটি অংশ নেয়, কিন্তু পৃষ্ঠার বৈশিষ্ট্য সংরক্ষণ করে। পৃষ্ঠা নির্বাচন স্পেকট্রাল ডেটার ভিত্তিতে হয়।
কী না পড়ে ব্লক নির্বাচন
নির্বাচন নিজে প্রার্থীদের কী বা ভ্যালু পড়ে না। বাছাই শুধু স্পেকট্রাল সারসংক্ষেপের ভিত্তিতে হয়। প্রতিটি ধাপে সারসংক্ষেপ সম্পূর্ণ স্ক্যান করা হয়। উল্লিখিত র্যাংক পরিসরে প্রতি ধাপে KV পড়া ১০–২৫ গুণ কমে।
প্রতি টোকেনে ডিকোডিং লেটেন্সি অর্ধেক হয়ে যায়। একটি H200 NVL-এ 1M টোকেনে r=8-এ গতি বৃদ্ধি 2.0×। এটি ঘন attention-এর সাথে তুলনা। নির্বাচন প্রার্থীদের কী পড়ার উপর নির্ভর করে না।

দীর্ঘ কাজে গুণমান
LOCKS কয়েক ধরনের কাজে গুণমান ধরে রাখে। long-document QA-তে (LongBench-v1; Llama-3.1-8B) ফলাফল পূর্ণ ক্যাশ থেকে এক পয়েন্টের মধ্যে থাকে। retrieval-dense RULER-এ পদ্ধতিটি প্রতিটি কী পড়া সঠিক LSE-ওরাকল অনুসরণ করে, এমনকি সবচেয়ে ছোট বাজেট পর্যন্ত। long-form reasoning-এ (AIME26, MATH-500; Qwen3-4B) ছোট বাজেট মোডে গুণমান সবচেয়ে বেশি ধরে রাখে। সেখানে eviction-ভিত্তিক reasoning সিলেক্টর ও কম্প্রেসর পিছিয়ে পড়ে।
2048 টোকেন বাজেটে LOCKS 100K+ কনটেক্সটে (GLM-4-9B-Chat-1M) FullKV-এর সমষ্টিগত গুণমানের সাথে মেলে। একইসাথে পদ্ধতিটি ২% টোকেন প্রক্রিয়া করে।
| শর্ত | ফলাফল |
|---|---|
| Long-document QA (LongBench-v1; Llama-3.1-8B) | পূর্ণ ক্যাশ থেকে এক পয়েন্টের মধ্যে |
| Retrieval-dense RULER | ছোট বাজেট পর্যন্ত সঠিক LSE-ওরাকল অনুসরণ করে |
| Long-form reasoning (AIME26, MATH-500; Qwen3-4B) | ছোট বাজেটে গুণমান সবচেয়ে বেশি ধরে রাখে |
| 2048-টোকেন বাজেট, 100K+ কনটেক্সট (GLM-4-9B-Chat-1M) | FullKV-এর সাথে মেলে, ২% টোকেন প্রক্রিয়া করে |
সিদ্ধান্ত: উল্লিখিত কাজগুলোতে এই পদ্ধতি সিলেক্টর ও eviction-based কম্প্রেসরের চেয়ে বেশি সময় গুণমান ধরে রাখে।
স্থাপন ও নির্বাচনের মানদণ্ড
পদ্ধতিটি অপরিবর্তিত vLLM-এর জন্য drop-in প্লাগইন হিসেবে সরবরাহ করা হয়। ব্যাচ ডিকোডিং সম্পূর্ণ CUDA গ্রাফে কাজ করে। vLLM পরিবর্তনের প্রয়োজন নেই।
নির্বাচনের মানদণ্ড: দীর্ঘ কনটেক্সট, সীমিত টোকেন বাজেট, KV পড়া ও ডিকোডিং লেটেন্সি কমানোর প্রয়োজন। যদি কাজটির জন্য প্রার্থীদের কী না পড়ে ব্লক নির্বাচন প্রয়োজন হয়, তবে পদ্ধতিটি উপযুক্ত।




