لماذا لا يعمل الرسم التخطيطي العام للصفحات
تتوقف صيانة نماذج اللغة الكبيرة على السياق الطويل عند ذاكرة التخزين المؤقت للمفاتيح والقيم (KV). تُقرأ الذاكرة المؤقتة بالكامل في كل خطوة فك ترميز. مفاتيح الانتباه منخفضة الرتبة محليًا، وإن كانت عالية الرتبة عالميًا. الرسم التخطيطي الثابت منخفض الرتبة، المشترك بين الصفحات، أعمى بشكل قابل للإثبات عن اتجاهات الصفحات.
عند نفس حجم الملخص، فإن الأساس الخاص بالصفحة يرتب الصفحات ويحفظ الحوامل بشكل أفضل بكثير. الرسم التخطيطي العام لا يرى هذه الاتجاهات. الملخص الطيفي لكل مفتاح يحل المشكلة.

ملخص طيفي لكل صفحة
يمنح LOCKS كل صفحة ملخصًا طيفيًا خاصًا بها من الرتبة r. الملخص مقيم: عُشر الذاكرة المؤقتة عند r=8 وخُمس وعشرون عند r=2. تعيد الطريقة بناء اللوجيتات داخل الصفحة. تقدّر كتلة الانتباه لكل صفحة عبر log-sum-exp. ثم تعالج الصفحات العليا فقط.
العناصر الرئيسية:
- الاسم: Page-Local Compact Key Summaries for Efficient Long-Context Decoding.
- الملخص: ملخص طيفي من الرتبة r لكل صفحة.
- الإقامة: عُشر الذاكرة المؤقتة عند r=8، وخُمس وعشرون عند r=2.
- إعادة البناء: اللوجيتات داخل الصفحة.
- التقدير: كتلة انتباه الصفحة عبر log-sum-exp.
- الاختيار: الصفحات العليا فقط.
الخلاصة: يشغل الملخص جزءًا من الذاكرة المؤقتة، لكنه يحفظ سمات الصفحات. يجري اختيار الصفحات وفق البيانات الطيفية.
اختيار الكتل دون قراءة المفاتيح
لا يقرأ الاختيار نفسه مفاتيح المرشحين أو قيمهم. يجري الاختيار فقط وفق الملخص الطيفي. يُمسح الملخص بالكامل في كل خطوة. تنخفض قراءة KV لكل خطوة بمقدار 10–25 ضعفًا في نطاق الرتب المذكور.
ينخفض زمن فك الترميز لكل رمز إلى النصف. عند 1M رمز على H200 NVL واحد يبلغ التسريع 2.0× عند r=8. هذه مقارنة مع الانتباه الكثيف. لا يعتمد الاختيار على قراءة مفاتيح المرشحين.

الجودة على المهام الطويلة
يحافظ LOCKS على الجودة في عدة أنواع من المهام. في long-document QA (LongBench-v1؛ Llama-3.1-8B) تبقى النتيجة في حدود نقطة واحدة من الذاكرة المؤقتة الكاملة. في retrieval-dense RULER تتبع الطريقة أوراكل LSE الدقيق، الذي يقرأ كل مفتاح، حتى أصغر الميزانيات. في long-form reasoning (AIME26، MATH-500؛ Qwen3-4B) تصمد الجودة أطول من غيرها في وضع الميزانيات الصغيرة. هناك تتراجع المحدِّدات وضاغطات الاستدلال القائمة على الإخلاء.
عند ميزانية 2048 رمزًا يتطابق LOCKS مع الجودة المجمّعة لـ FullKV على سياق 100K+ (GLM-4-9B-Chat-1M). في الوقت نفسه تعالج الطريقة 2% من الرموز.
| الشرط | النتيجة |
|---|---|
| Long-document QA (LongBench-v1؛ Llama-3.1-8B) | في حدود نقطة واحدة من الذاكرة المؤقتة الكاملة |
| Retrieval-dense RULER | تتبع أوراكل LSE الدقيق حتى الميزانيات الصغيرة |
| Long-form reasoning (AIME26، MATH-500؛ Qwen3-4B) | تصمد الجودة أطول من غيرها في الميزانيات الصغيرة |
| ميزانية 2048 رمزًا، سياق 100K+ (GLM-4-9B-Chat-1M) | تتطابق مع FullKV، تعالج 2% من الرموز |
الخلاصة: في المهام المذكورة يحافظ النهج على الجودة أطول من المحدِّدات وضاغطات الإخلاء.
التطبيق ومعيار الاختيار
يُقدَّم النهج كإضافة drop-in لـ vLLM غير المعدَّل. يعمل فك الترميز المجمّع في رسوم CUDA كاملة. لا حاجة لتعديل vLLM.
معيار الاختيار: سياق طويل، ميزانية رموز محدودة، الحاجة إلى تقليل قراءة KV وزمن فك الترميز. إذا تطلبت المهمة اختيار الكتل دون قراءة مفاتيح المرشحين، فإن النهج مناسب.




