ChannelFlow-Tools: pipeline personalizable para la creación de conjuntos de datos de flujos tridimensionales para tareas de aprendizaje automático

7 septiembre 202624 vistas

Los autores presentaron un pipeline abierto que genera automáticamente geometría de obstáculos, realiza simulaciones hidrodinámicas y convierte los resultados en tensores para el entrenamiento de redes neuronales. El sistema fue validado en cuanto a reproducibilidad y calidad de los datos, y el conjunto obtenido permitió entrenar con éxito varios modelos sustitutos.

ChannelFlow-Tools: pipeline personalizable para la creación de conjuntos de datos de flujos tridimensionales para tareas de aprendizaje automático

¿Por qué se necesita otro pipeline para datasets?

La preparación de datos para entrenar modelos que predicen el flujo tridimensional alrededor de cuerpos generalmente no se topa con la red neuronal, sino con la rutina: hay que generar la geometría, construir la malla de cálculo, realizar la simulación y llevar los resultados a un formato unificado. Todo esto es difícil de reproducir automáticamente, por lo que los datasets listos resultan costosos y escalan mal.

La herramienta de código abierto ChannelFlow-Tools propone un enfoque diferente: recopilar conjuntos de datos no ejemplo por ejemplo, sino mediante un pipeline completo, desde la generación procedural de obstáculos hasta el empaquetado de campos de flujo tridimensionales en tensores aptos para el entrenamiento. Según la descripción del proyecto en arXiv, el objetivo principal de los autores es eliminar las operaciones manuales y hacer que el proceso sea lo más reproducible posible.

Qué ocurre dentro del pipeline

Una tarea típica se ve así: se coloca un obstáculo en un canal y, a partir de las condiciones de entrada del flujo, se debe predecir el campo tridimensional de velocidad y presión alrededor del objeto. La particularidad de ChannelFlow-Tools es que recorre automáticamente variantes geométricas de seis familias de formas. En lugar de seleccionar objetos manualmente, se utiliza la generación procedural, que puede producir una gran diversidad de obstáculos con parámetros controlados.

Luego, la geometría se convierte a una representación de vóxeles basada en campos de distancia con signo. Esta representación es conveniente para modelos convolucionales y no requiere trabajar directamente con la malla de cálculo irregular. Después se ejecuta una simulación de lattice Boltzmann, un método de solución numérica de las ecuaciones de la hidrodinámica que se adapta bien a la computación paralela. Finalmente, los resultados de las simulaciones y las máscaras de geometría originales se combinan en tensores listos para arquitecturas de redes neuronales.

Todo el proceso se gestiona mediante archivos de configuración. Esto significa que los parámetros de generación, las condiciones de simulación y el formato de los datos de salida se pueden definir de forma declarativa, sin «incrustarlos» en el código. Según afirman los autores, la etapa de generación de geometría es reproducible byte a byte: configuraciones idénticas producen objetos idénticos independientemente de cuántas veces se ejecute. Para el simulador físico, la reproducibilidad bit a bit completa es más compleja, pero al menos la parte procedural del proyecto está hecha de forma estricta.

Validación de datos, no «a ojo»

Crear un dataset es solo la mitad del trabajo. Antes de usarlo para el entrenamiento, los autores realizaron varios niveles de validación. Entre ellos se incluyen una verificación integral de la integridad de las mallas de cálculo, pruebas analíticas de las funciones de distancia con signo y la comparación con un benchmark conocido de flujo alrededor de una esfera. También se verificó la integridad byte a byte de los datos tras todas las transformaciones.

Esta auditoría es importante no solo para la calidad de una muestra individual, sino también para garantizar que todo el corpus de datos sea consistente. Si un modelo se entrena con una muestra de miles de simulaciones, incluso fallos poco frecuentes en la geometría o el empaquetado pueden convertirse en un error sistemático.

¿Funcionan los datos en la práctica?

Para demostrar la utilidad de los datasets resultantes, los autores entrenaron tres modelos sustitutos: 3D U-Net, FNO y U-FNO. Cada uno aprendió a predecir el campo de flujo a partir de la geometría conocida y los parámetros del flujo. La muestra de entrenamiento consistió en 450 simulaciones con un número de Reynolds reducido de aproximadamente 1000 a 10 000.

El hecho de que el error en el entrenamiento sea bajo, por sí solo, dice poco. Un resultado más interesante es el comportamiento de los modelos en divisiones de prueba que van más allá de la distribución de entrenamiento: otras familias de formas y números de Reynolds no vistos anteriormente. Según los autores, las predicciones siguen siendo físicamente interpretables. Esto confirma indirectamente que la estructura de datos recopilada por el pipeline transmite a los modelos patrones reales del flujo, y no solo «memoriza» ejemplos del conjunto de entrenamiento.

Conclusión

A juzgar por los materiales disponibles, ChannelFlow-Tools cubre una brecha importante entre los solucionadores de CFD y el aprendizaje automático. En lugar de scripts separados para el preprocesamiento, el proyecto ofrece un pipeline configurable, verificable y reproducible. Esto lo convierte en una herramienta útil para investigadores que trabajan con flujos tridimensionales alrededor de cuerpos y quieren dedicar más atención a las arquitecturas de modelos que a la construcción de otro dataset.

El artículo está disponible en arXiv con el número 2509.15236; en la lista de autores figuran Shubham Kavane, Lukas Schröder, Kajol Kulkarni, Fernando Gonzalez y Harald Koestler.

Preguntas frecuentes

ChannelFlow-Tools: pipeline personalizable para la creación de conjuntos de datos de flujos tridimensionales para tareas de aprendizaje automático