كيف تقوم E2LLM بنشر نماذج لغوية كبيرة على أجهزة الحافة والضبابية غير المتجانسة

13 سبتمبر 20260 الآراء

يجمّع الإطار العقد الضعيفة في مجموعات مكررة ويوزّع مراحل معالجة الرموز بطرق مختلفة لاستخدام الموارد المحدودة بكفاءة. في الاختبارات، قلّص هذا النهج متوسط زمن الاستجابة إلى النصف تقريبًا مقارنةً بنظام Splitwise المعروف.

كيف تقوم E2LLM بنشر نماذج لغوية كبيرة على أجهزة الحافة والضبابية غير المتجانسة

بالنسبة لاستدلال نماذج اللغة الكبيرة (LLM) بالقرب من المستخدم، نادرًا ما تتوفر خوادم «ثقيلة» جاهزة. عادةً ما يكون الأمر مزيجًا من أجهزة الحافة (Edge) والبوابات وعُقد الضباب (Fog) بسعات ذاكرة وقدرات حاسوبية متفاوتة. نشر نموذج كما لو كان يتسع دائمًا على جهاز واحد يعني غض الطرف عن الواقع: فإما أن النموذج لا يتسع، أو يعمل بزمن استجابة غير مقبول، أو تبقى الموارد باهظة الثمن خاملة. يقدم إطار عمل E2LLM مسارًا أكثر عملية لهذا الغرض.

لماذا لا يناسب السيناريو التقليدي

تفترض الأساليب التقليدية لخدمة نماذج اللغة الكبيرة غالبًا أن النموذج بأكمله يعيش على جهاز واحد. في السحابة، يعمل هذا عادةً، لكن في بيئة الحافة/الضباب تكون العُقد أضعف وأكثر تباينًا. قد تمتلك بعض الأجهزة ذاكرة كافية للأوزان، لكنها لا تتحمل العمليات الحسابية؛ بينما يكون البعض الآخر سريعًا لكن بذاكرة محدودة. إذا حاولت ببساطة «توزيع» النموذج على جميع الأجهزة المتاحة، تبدأ مشاكل في التنسيق والاتصال والاستفادة القصوى من الموارد.

في الوقت نفسه، هناك حاجة عملية لثلاثة أمور في آن واحد:

  • زمن استجابة منخفض يمكن التنبؤ به،
  • استخدام اقتصادي للموارد،
  • تكلفة نشر معقولة.

تتعارض هذه الأمور مع بعضها البعض، لذا نحتاج إلى حل وسط، وليس تحسينًا أحادي الجانب. يُبنى E2LLM حول هذا الحل الوسط.

النسخ المتماثلة والأدوار: كيف يتغلب E2LLM على القيود

الفكرة الأساسية في E2LLM ليست تقسيم نموذج واحد بين جميع العُقد، بل تجميع الأجهزة في نسخ متماثلة (replicas). داخل كل نسخة متماثلة، تُخزَّن نسخة كاملة من النموذج، ثم تُوزَّع بعد ذلك على أعضاء المجموعة باستخدام التوازي النموذجي. يبدو هذا وكأنه إهدار للذاكرة، لكن في الواقع، هذا التكرار يعزز تحمل الأعطال ويسمح بمعالجة عدة طلبات بالتوازي.

بعد ذلك، تلعب المعرفة بآلية استدلال نماذج اللغة الكبيرة دورها. فهناك مرحلتان بملفات تحميل مختلفة: مرحلة ما قبل التعبئة (prefill)، حيث يعالج النموذج بنشاط رموز الإدخال ويبني ذاكرة تخزين مؤقت للانتباه، ومرحلة فك التشفير (decode)، حيث يولد رموز الإخراج. تتطلب هاتان المرحلتان موارد مختلفة: مرحلة prefill حساسة لقمة القدرة الحاسوبية، بينما مرحلة decode حساسة لعرض النطاق الترددي للذاكرة وزمن انتقال نقل البيانات.

بدلاً من إجبار كل مجموعة على القيام بالأمرين معًا، يعين E2LLM أدوارًا متخصصة للنسخ المتماثلة. فبعضها يصبح نسخًا متماثلة لمرحلة prefill وتعالج الطلبات الواردة بشكل أسرع، والبعض الآخر يصبح نسخًا متماثلة لفك التشفير (decoder) وتتولى التوليد السلس. هذا الفصل يسمح بعدم إهدار الموارد على المرحلة «غير الملائمة» لعتاد معين.

كيف تتشكل مجموعات الأجهزة

لا يمكن ببساطة أخذ أي أجهزة متاحة وتسميتها نسخة متماثلة. يقرر E2LLM أولاً أي العُقد تستحق الدمج من الأساس. لهذا، تُستخدم خوارزمية جينية: فهي تستعرض خيارات المجموعات وتحسنها تدريجيًا، مسترشدة بالأداء النهائي للنظام.

عند تحديد المجموعة، يجب فهم كيفية تقسيم النموذج بين الأعضاء داخلها. هنا تعمل البرمجة الديناميكية: فهي تبحث عن استراتيجية تقسيم تقلل من «الاختناقات» في نقل البيانات بين الأجهزة. بعبارة أخرى، يتولى المستوى الأعلى اختيار تكوين النسخ المتماثلة، بينما يتولى المستوى الأدنى التقسيم الأمثل للنموذج وفقًا لتكوين العتاد المحدد.

ما الفائدة العملية من ذلك

اختبر المؤلفون هذا النهج مقارنةً بالحل الأساسي Splitwise، الذي يفصل أيضًا بين مرحلتي prefill وdecode، لكنه أقل مرونة في التعامل مع البيئات غير المتجانسة. أظهرت التجارب أن E2LLM يتكيف جيدًا مع تغيرات حمل العمل. يتجلى هذا بشكل خاص عندما تختلف أطوال رموز الإدخال والإخراج اختلافًا كبيرًا: على سبيل المثال، تصل طلبات قصيرة، لكنها تتطلب ردودًا طويلة، ثم يتغير الحمل فجأة.

تحت الحمل المرتفع، يقلل النهج الجديد متوسط زمن الانتظار بأكثر من 50% مقارنةً بـ Splitwise. هذا يعني أن المستخدمين يقفون في طوابير الانتظار للتوليد بشكل أقل، وأن أجهزة الحافة/الضباب نفسها تعمل بشكل أكثر كفاءة، بدلاً من محاولة خدمة مرحلتي الاستدلال بالتساوي.

الخلاصة

يُظهر E2LLM أنه للتشغيل الفعال لنماذج اللغة الكبيرة على الحافة، ليست قوة الجهاز الفردي هي المهمة فحسب، بل أيضًا كيفية دمج الأجهزة وتوزيع الأدوار بينها. إن تكرار النموذج الكامل على مستوى النسخ المتماثلة مقترنًا بفصل مرحلتي prefill وdecode هو مقايضة مدروسة: قد تضطر للتضحية بالذاكرة في بعض الأماكن، لكن في المقابل يحصل النظام على أداء مستقر وزمن استجابة أقل.

الاستنتاج الرئيسي للسيناريوهات التطبيقية: في بيئة غير متجانسة، لا تحاول حشر النموذج بأكمله في عقدة واحدة أو توزيعه بالتساوي على الجميع. بل يجب تجميع مجموعات متخصصة من العتاد المتاح، ثم تحديد كيفية توزيع العمليات الحسابية داخلها. هكذا يصبح استدلال نماذج اللغة الكبيرة عمليًا حقًا خارج مجموعات السحابة الكبيرة.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
كيف تقوم E2LLM بنشر نماذج لغوية كبيرة على أجهزة الحافة والضبابية غير المتجانسة