مختصر: ما الذي تم نشره بالضبط
في نهاية أغسطس 2026، نشر فريق LAION مجموعة LAION-BVD — مجموعة فيديو مفتوحة وُصفت في نسخة أولية بأنها مجموعة بيانات بحجم غير مسبوق للتدريب متعدد الوسائط. ظهر العمل على arXiv في 25 أغسطس 2026، ضمن تصنيفات الرؤية الحاسوبية والذكاء الاصطناعي وتعلّم الآلة.
الأرقام الجافة تبدو هكذا:
- 1.3 مليار رابط فيديو — نقطة البداية في التجميع، استُخرجت الروابط من زحف الويب CommonCrawl ورُبطت بمنصات محددة؛
- 80 مليون مقطع تم تنزيله فعليًا عبر هذه الروابط — ليس كل ما وُجد في الفهرس وصل إلى مرحلة التنزيل؛
- 10 ملايين ساعة من المدة الإجمالية.
الرقم الأخير يصعب استيعابه: إنه أكثر من ألف عام من المشاهدة المتواصلة. ولهذا السبب يُوصف الإصدار بأنه نقلة في ما هو متاح أصلًا للباحثين دون ميزانية شركات — فسابقًا كانت مجموعات الفيديو المماثلة في الحجم تبقى داخل مختبرات مغلقة.

كيف جُمعت
من الروابط إلى مقاطع جاهزة
تتكوّن خطوات المعالجة من عدة مراحل، ولكل منها أهميتها. أولًا تُنتقى الروابط وتُوحَّد صيغتها. ثم يبدأ التنزيل الجماعي. بعد ذلك يدخل في العمل كشف المشاهد الحساس لمحتوى الإطار: فالفيديو الطويل يُقطَّع لا وفق توقيت ثابت، بل وفق نقاط المونتاج الفعلية.
ثم يأتي الجزء الأكثر إثارة. بالنسبة للمقاطع الناتجة، تُولَّد التعليقات تركيبياً وبشكل آلي وفي نمطين معًا: نص مرافق للصورة المرئية، وآخر منفصل للمسار الصوتي. أي أن الصوت هنا ليس منتجًا ثانويًا، بل إشارة تدريب كاملة.
البنية النهائية مصممة للتدريب المسبق على ثلاثة أنواع من البيانات دفعة واحدة: الفيديو والصوت والصور.
الإطارات كمورد مستقل
لم يكتفِ المؤلفون بالمقاطع. تُستخرج من المشاهد إطارات توافق لحظة التغيير، وتُقدَّم كمصدر مستقل لأزواج «صورة — نص». المنطق بسيط: الصورة المرئية تقدّم شريحة مختلفة من العالم البصري مقارنة بمجموعات الصور المعتادة من الويب — بتوزيع مختلف للحبكات وزوايا التصوير والتفاصيل اليومية. وبالنسبة لمهام البحث بالصور، قد يكون هذا الانزياح في التوزيع أنفع من مليون صورة إضافية من المصادر نفسها المعتادة.

ما أظهرته التجارب
الفيديو والصوت
تصل النماذج المدرَّبة على المجموعة الجديدة إلى مستوى تنافسي في المعايير القياسية لثنائية «فيديو — نص» و«صوت — نص». والأهم من ذلك: مع زيادة حجم البيانات أو حجم النموذج، تتحسن الجودة باطراد. وهذه هي العلامة التي تميّز مجموعة بيانات «كبيرة فقط» عن مجموعة تستحق التوسع فيها أكثر.
الصور
هناك خط منفصل من التجارب — التدريب على الإطارات المستخرجة. والنتيجة هنا إيجابية أيضًا: أداء قوي في البحث بالصور. وذلك رغم أن توزيع الإطارات يختلف بوضوح عن مجموعات الويب المعتادة — أي أن المكسب لا يأتي من الحجم بحد ذاته، بل من الطابع المختلف للبيانات البصرية.
ما ينبغي تذكّره
- التعليقات تركيبية: توفر آلاف ساعات العمل البشري، لكنها تجلب ضوضاء وأخطاء منهجية. جودة الفلترة هنا أهم من حجم المجموعة.
- التجميع يبدأ من روابط الويب، ما يعني ظهور الأسئلة المعتادة في مثل هذه المشاريع: دوام الروابط، وشروط استخدام المصادر الأصلية، والإسناد. فالرخصة المفتوحة لمجموعة البيانات لا تلغي الأسئلة حول المصادر الأولية.
- المجموعة مُعلنة كإصدار بحثي — وهذا عمليًا يعني أن عتبة الدخول أدنى من المجموعات الداخلية للشركات، لكن قابلية إعادة إنتاج نتائج الآخرين ستظل بحاجة إلى تحقق شخصي.

لماذا هذا مهم
حتى الآن كان الفيديو متعدد الوسائط المفتوح بهذا الحجم أقرب إلى وعد من واقع: فالمجموعات الأكاديمية كانت تُقاس بآلاف الساعات، وكل ما كان يُقاس بالملايين كان مملوكًا لشركات ولا يخرج إلى العلن. LAION-BVD يغيّر هذه الحسبة — ومعها السقف المعياري لمن يبنون نماذجهم الخاصة.
هناك عدة نتائج عملية. أولًا، تنشأ قاعدة لمقارنات نزيهة: إذا تدرّب الجميع على المجموعة المفتوحة نفسها، تصبح النقاشات حول أي النتائج أفضل أكثر جدوى. ثانيًا، تنشأ لفرق العمل الصغيرة والجامعات بدائل عن استئجار التضمينات الجاهزة — إذ يمكن تدريب نموذج خاص. ثالثًا، يتوقف الصوت عن كونه ملحقًا للفيديو ويحصل على خط تدريب خاص به.
السؤال الرئيسي الآن ليس هل تكفي البيانات، بل من سيتعلم أولًا كيفية تنظيفها. فالتعليقات التركيبية وعشرات ملايين المقاطع والنفايات الحتمية في العينة تجعل الفلترة وتقييم الجودة عنق الزجاجة في المشروع كله. مجموعة البيانات مفتوحة — وما بعد ذلك يعتمد على المجتمع.



