ChannelFlow-Tools : pipeline personnalisable pour la création de jeux de données d'écoulements tridimensionnels pour des tâches d'apprentissage automatique

7 septembre 202625 vues

Les auteurs ont présenté un pipeline ouvert qui génère automatiquement la géométrie des obstacles, effectue une modélisation hydrodynamique et transforme les résultats en tenseurs pour l'apprentissage de réseaux de neurones. Le système a été validé pour sa reproductibilité et la qualité des données, et l'ensemble obtenu a permis d'entraîner avec succès plusieurs modèles de substitution.

ChannelFlow-Tools : pipeline personnalisable pour la création de jeux de données d'écoulements tridimensionnels pour des tâches d'apprentissage automatique

Pourquoi un pipeline de plus pour les jeux de données

La préparation des données pour l'entraînement de modèles prédisant l'écoulement tridimensionnel autour de corps se heurte généralement non pas au réseau de neurones, mais à la routine : il faut générer la géométrie, construire le maillage de calcul, effectuer la simulation et ramener les résultats à un format unifié. Tout cela est difficile à reproduire automatiquement, c'est pourquoi les jeux de données prêts à l'emploi s'avèrent coûteux et se généralisent mal.

L'outil open source ChannelFlow-Tools propose une autre approche : assembler des ensembles de données non pas exemple par exemple, mais par un pipeline complet — de la génération procédurale des obstacles au conditionnement des champs d'écoulement tridimensionnels en tenseurs exploitables pour l'apprentissage. D'après la description du projet sur arXiv, l'objectif principal des auteurs est d'éliminer les opérations manuelles et de rendre le processus aussi reproductible que possible.

Ce qui se passe à l'intérieur du pipeline

Une tâche typique se présente ainsi : un obstacle est placé dans un canal, et à partir des conditions d'entrée de l'écoulement, il faut prédire le champ tridimensionnel de vitesse et de pression autour de l'objet. La particularité de ChannelFlow-Tools est qu'il parcourt automatiquement les variantes géométriques issues de six familles de formes. Au lieu d'une sélection manuelle des objets, on utilise une génération procédurale capable de produire une grande diversité d'obstacles avec des paramètres contrôlés.

Ensuite, la géométrie est convertie en représentation voxélique basée sur les champs de distance signés. Cette représentation est pratique pour les modèles convolutifs et ne nécessite pas de travailler directement avec un maillage de calcul irrégulier. Après cela, une simulation par lattice Boltzmann est lancée — une méthode de résolution numérique des équations hydrodynamiques qui se prête bien au calcul parallèle. Enfin, les résultats des simulations et les masques de géométrie d'origine sont assemblés en tenseurs prêts pour les architectures de réseaux de neurones.

L'ensemble du processus est piloté par des fichiers de configuration. Cela signifie que les paramètres de génération, les conditions de simulation et le format des données de sortie peuvent être définis de manière déclarative, plutôt que d'être « codés en dur ». Selon les auteurs, l'étape de génération de la géométrie est reproductible octet pour octet : des configurations identiques donnent des objets identiques, quel que soit le nombre de relances. Pour le simulateur physique, une reproductibilité binaire complète est plus difficile, mais au moins la partie procédurale du projet est réalisée de manière stricte.

Validation des données, pas « à l'œil »

Créer un jeu de données n'est que la moitié du travail. Avant de l'utiliser pour l'entraînement, les auteurs ont effectué plusieurs niveaux de validation. Parmi eux — une vérification de bout en bout de l'intégrité des maillages de calcul, des tests analytiques des fonctions de distance signées et une comparaison avec le benchmark connu de l'écoulement autour d'une sphère. L'intégrité octet des données après toutes les transformations a également été vérifiée.

Une telle vérification est importante non seulement pour la qualité d'un échantillon individuel, mais aussi pour avoir l'assurance que l'ensemble du corpus de données est cohérent. Si un modèle est entraîné sur un échantillon de milliers de simulations, même de rares défaillances dans la géométrie ou le conditionnement peuvent se transformer en erreur systématique.

Les données fonctionnent-elles en pratique

Pour démontrer l'adéquation des jeux de données obtenus, les auteurs ont entraîné trois modèles de substitution : 3D U-Net, FNO et U-FNO. Chacun d'eux apprenait à prédire le champ d'écoulement à partir de la géométrie connue et des paramètres du flux. L'échantillon d'entraînement était composé de 450 simulations avec un nombre de Reynolds réduit allant d'environ 1000 à 10 000.

Le simple fait d'une faible erreur à l'entraînement en dit peu. Un résultat plus intéressant est le comportement des modèles sur des splits de test qui sortent de la distribution d'entraînement : d'autres familles de formes et des nombres de Reynolds jamais rencontrés. Selon les auteurs, les prédictions restent physiquement interprétables. Cela confirme indirectement que la structure des données collectées par le pipeline transmet aux modèles les véritables lois de l'écoulement, et non pas seulement une « mémorisation » des exemples de l'échantillon d'entraînement.

Conclusion

D'après les documents disponibles, ChannelFlow-Tools comble une lacune importante entre les solveurs CFD et l'apprentissage automatique. Au lieu de scripts de prétraitement épars, le projet propose un pipeline configurable, vérifiable et reproductible. Cela en fait un outil utile pour les chercheurs qui travaillent sur les écoulements tridimensionnels et qui souhaitent consacrer plus d'attention aux architectures de modèles plutôt qu'à la construction d'un énième jeu de données.

L'article est disponible sur arXiv sous le numéro 2509.15236 ; la liste des auteurs comprend Shubham Kavane, Lukas Schröder, Kajol Kulkarni, Fernando Gonzalez et Harald Koestler.

Foire aux questions

ChannelFlow-Tools : pipeline personnalisable pour la création de jeux de données d'écoulements tridimensionnels pour des tâches d'apprentissage automatique