لماذا نحتاج إلى خط أنابيب آخر لمجموعات البيانات
عادةً ما يتعثر إعداد البيانات لتدريب النماذج التي تتنبأ بالتدفق ثلاثي الأبعاد حول الأجسام ليس في الشبكة العصبية، بل في الروتين: تحتاج إلى توليد الهندسة، وبناء الشبكة الحسابية، وإجراء المحاكاة، وتوحيد النتائج في صيغة واحدة. من الصعب تكرار كل هذا تلقائيًا، لذلك تصبح مجموعات البيانات الجاهزة باهظة الثمن وسيئة التوسع.
تقدم الأداة مفتوحة المصدر ChannelFlow-Tools نهجًا مختلفًا: جمع مجموعات البيانات ليس مثالًا واحدًا في كل مرة، بل عبر خط أنابيب كامل — من التوليد الإجرائي للعوائق إلى تغليف حقول التدفق ثلاثية الأبعاد في موترات مناسبة للتدريب. وفقًا لوصف المشروع على arXiv، فإن الهدف الرئيسي للمؤلفين هو إزالة العمليات اليدوية وجعل العملية قابلة للتكرار قدر الإمكان.

ماذا يحدث داخل خط الأنابيب
تبدو المهمة النموذجية كما يلي: يتم وضع عائق في القناة، وبناءً على ظروف التدفق الداخلية، يجب التنبؤ بحقل السرعة والضغط ثلاثي الأبعاد حول الجسم. تكمن خصوصية ChannelFlow-Tools في أنه يمر تلقائيًا عبر المتغيرات الهندسية من ست عائلات من الأشكال. بدلاً من الاختيار اليدوي للأجسام، يتم استخدام التوليد الإجرائي، الذي يمكنه إنتاج مجموعة كبيرة ومتنوعة من العوائق بمعلمات مضبوطة.
بعد ذلك، تُترجم الهندسة إلى تمثيل voxel استنادًا إلى حقول المسافة الموقعة. هذا التمثيل مناسب للنماذج الالتفافية ولا يتطلب العمل المباشر مع شبكة حسابية غير منتظمة. بعد ذلك، يتم تشغيل نمذجة لattice Boltzmann — وهي طريقة للحل العددي لمعادلات الديناميكا المائية تتوافق جيدًا مع الحوسبة المتوازية. أخيرًا، تُجمع نتائج المحاكاة والأقنعة الهندسية الأصلية في موترات جاهزة لبنى الشبكات العصبية.
تتم إدارة العملية بأكملها عبر ملفات الإعدادات. وهذا يعني أنه يمكن تحديد معلمات التوليد وشروط المحاكاة وصيغة البيانات الناتجة بشكل تعريفي، وليس "حشوها" في الكود. وفقًا للمؤلفين، فإن مرحلة توليد الهندسة قابلة للتكرار بايتًا ببايت: الإعدادات المتطابقة تعطي أجسامًا متطابقة بغض النظر عن إعادة التشغيل. بالنسبة لمحاكي الفيزياء، فإن التكرار الكامل على مستوى البت أكثر صعوبة، ولكن على الأقل الجزء الإجرائي من المشروع مصنوع بدقة.
التحقق من البيانات ليس "بالعين"
إنشاء مجموعة البيانات هو نصف المهمة. قبل استخدامها للتدريب، أجرى المؤلفون عدة مستويات من التحقق. من بينها — فحص شامل لسلامة الشبكات الحسابية، واختبارات تحليلية لدوال المسافة الموقعة، والمقارنة مع معيار معروف لتدفق حول كرة. كما تم فحص السلامة البايتية للبيانات بعد جميع التحويلات.
هذا الجمهور مهم ليس فقط لجودة العينة الفردية، ولكن أيضًا للثقة في أن مجموعة البيانات بأكملها متسقة. إذا تم تدريب النموذج على عينة من آلاف المحاكاة، فإن حتى الأعطال النادرة في الهندسة أو التغليف يمكن أن تتحول إلى خطأ منهجي.

هل تعمل البيانات عمليًا
لإثبات ملاءمة مجموعات البيانات الناتجة، درب المؤلفون ثلاثة نماذج بديلة: 3D U-Net وFNO وU-FNO. تعلم كل منها التنبؤ بحقل التدفق بناءً على الهندسة المعروفة ومعلمات التدفق. تكونت عينة التدريب من 450 محاكاة بعدد رينولدز مخفض يتراوح تقريبًا من 1000 إلى 10000.
حقيقة الخطأ المنخفض في التدريب بحد ذاتها لا تعني الكثير. النتيجة الأكثر إثارة للاهتمام هي سلوك النماذج على تقسيمات الاختبار التي تتجاوز توزيع التدريب: عائلات أشكال أخرى وأعداد رينولدز لم تُشاهد من قبل. وفقًا للمؤلفين، تظل التنبؤات قابلة للتفسير فيزيائيًا. هذا يؤكد بشكل غير مباشر أن بنية البيانات التي يجمعها خط الأنابيب تنقل إلى النماذج أنماط التدفق الحقيقية، وليس فقط "تتذكر" الأمثلة من عينة التدريب.
الخلاصة
بناءً على المواد المتاحة، يسد ChannelFlow-Tools فجوة مهمة بين حلول CFD والتعلم الآلي. بدلاً من البرامج النصية المنفصلة للمعالجة المسبقة، يقدم المشروع خط أنابيب قابلًا للضبط والتحقق والتكرار. وهذا يجعله أداة مفيدة للباحثين الذين يعملون مع التدفقات ثلاثية الأبعاد حول الأجسام ويريدون التركيز أكثر على بنى النماذج بدلاً من تجميع مجموعة بيانات أخرى.
الورقة متاحة على arXiv تحت الرقم 2509.15236؛ في قائمة المؤلفين — Shubham Kavane وLukas Schröder وKajol Kulkarni وFernando Gonzalez وHarald Koestler.



