SymbolicLight V1: نموذج لغوي بنبضات متفرقة ومسار متبقٍ مستمر

26 سبتمبر 202615 الآراء

تقدّم المقالة بنية ذات مسارين تجمع بين ديناميكيات LIF النبضية والمعالجة المستمرة للسياق والانتباه الموضعي؛ وقد دُرّبت أربعة نماذج من الصفر على بيانات صينية وإنجليزية. تُظهر اختبارات المشفّر أن نحو 90% من النبضات معدومة، لكن متوسط الحيرة يقلّ أداءً عن GPT‑2 ذي الحجم المماثل بنسبة 7.7%، كما أن التوليد المقاس أبطأ بكثير — وترسم هذه النتائج حدود المفاضلة بين التناثر والجودة والكفاءة الحسابية.

SymbolicLight V1: نموذج لغوي بنبضات متفرقة ومسار متبقٍ مستمر

كيف تعمل البنية المعمارية

SymbolicLight V1 نموذج لغوي ذو مسارين: ديناميكيات ثنائية من نوع Leaky Integrate-and-Fire (LIF) وتدفّق متبقٍ مستمر.

  • يمزج Dual-Path SparseTCAM بين حالة ذات اضمحلال أُسّي من الرتبة الأولى والانتباه ضمن نافذة محلية.
  • يعمل المكوّنان معًا ضمن تدفّق متبقٍ مستمر.
  • بعد المزج، يستخدم النموذج رأس فك ترميز مشروطًا بالسياق.

المعيار العملي: تستحق هذه البنية الدراسة لاستكشاف الجمع بين ديناميكيات النبضات المتناثرة والتدفّق المستمر. لكنها لا تثبت بحد ذاتها وجود ميزة في السرعة أو الدقة.

على أي بيانات دُرّب النموذج وقُيّم

دُرّبت أربعة نماذج من SymbolicLight V1 من الصفر. يحتوي كل منها على 194M معلمة.

  • تتضمن مجموعة التدريب 3B رمزًا باللغتين الصينية والإنجليزية.
  • تشمل المجموعة 10 مجالات.
  • بلغ PPL في مجموعة تقييم ثابتة موزونة حسب الرموز 8.88–8.93. وبلغ المتوسط 8.904، والانحراف المعياري للعينة 0.019.
  • لم يُتحقق من فصل مجموعة التقييم عن تدفقات التدريب.

تشكل رموز البرمجة 43.7% من مجموعة التقييم. وبلغ متوسط PPL غير الموزون عبر المجالات العشرة 29.38. وفي تجارب تدريب المُرمِّز، بلغ متوسط نسبة النبضات الصفرية 89.96%؛ وهذا ليس تقديرًا لمقدار التناثر في النموذج بأكمله.

المعيار العملي: ينبغي النظر إلى نتائج PPL إلى جانب تركيبة مجموعة التقييم وعدم التحقق من فصل البيانات. ولا يمكن تعميم نسبة النبضات الصفرية على النموذج بأكمله.

كيف قورن النموذج بـ GPT-2

عند استخدام المجموعة نفسها والمُرمِّز نفسه وميزانية الرموز نفسها والأجهزة نفسها، كان متوسط PPL الموزون حسب الرموز لدى SymbolicLight V1 أعلى بنسبة 7.7% من نظيره لدى GPT-2 201M.

المعيارالنتيجة
PPLمتوسط SymbolicLight: 8.904؛ GPT-2 201M: 8.27
التقييم دون تدريب مسبقفي خمسة معايير قياس، لم يُظهر نموذجان بحجم 200M فرقًا واضحًا في الدقة
تكرار 4-gramعند temperature 0.7 وtop-k 50، ينتج SymbolicLight تكرارات أقل
التعديل بحسب الإنتروبياتعكس القاعدة ترتيب النموذجين من حيث التكرار

المعيار العملي: يعتمد الاختيار على المؤشر الذي يجري تقييمه. تفوّق GPT-2 في PPL، بينما اعتمدت نتيجة التكرار على قاعدة التوليد.

ما الذي أظهرته قياسات السرعة واستهلاك الطاقة

قيسَت سرعة التوليد لدى SymbolicLight V1 وGPT-2 على RTX 2080 Ti. وحُصل على تقديرات استهلاك الطاقة من قراءات القدرة بعد التوليد، دون تكامل القدرة أثناءه.

النموذجسرعة التوليدتقدير استهلاك الطاقة
SymbolicLight V122.8 رمزًا/ثانيةنحو 2,848 ملي جول/رمز
GPT-291.5 رمزًا/ثانيةنحو 905 ملي جول/رمز

في هذه القياسات، ولّد GPT-2 بسرعة أكبر، وكان تقدير استهلاكه للطاقة أقل. ولا تستند تقديرات الطاقة إلى تكامل القدرة أثناء التوليد.

المعيار العملي: لا تتوفر للمقارنة بين السرعة واستهلاك الطاقة سوى نتائج هذا القياس على RTX 2080 Ti.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
SymbolicLight V1: نموذج لغوي بنبضات متفرقة ومسار متبقٍ مستمر