Introducción: por qué las tablas son difíciles
La predicción tabular es una de las tareas clave del aprendizaje automático. Los grandes modelos de lenguaje han aprendido a trabajar con texto e imágenes, pero las tablas siguen siendo un desafío especial. Para aplicar los LLM a las tablas, los investigadores han seguido dos caminos: el ajuste fino de modelos especializados (TFM) o el uso de aprendizaje en contexto.
El primer camino es la creación de modelos fundacionales tabulares, como TabPFN. Estos modelos muestran resultados impresionantes, pero requieren grandes costos computacionales. Reentrenarlos para cada nuevo conjunto de datos es un lujo inaceptable.
Aquí es donde entra en juego el few-shot prompting: se le muestran al modelo varios ejemplos del conjunto de entrenamiento y este predice un nuevo valor. Es barato y rápido, pero surge la pregunta: ¿qué ejemplos elegir exactamente? La selección aleatoria a menudo da malos resultados.
ARASH: selección inteligente de ejemplos
El método ARASH (Adaptive Retrieval And Shot Selection) resuelve precisamente este problema. En lugar de una selección aleatoria o heurística, analiza la vecindad local de cada punto en el conjunto de entrenamiento. La idea es seleccionar shots que sean lo más similares posible a la consulta actual y, al mismo tiempo, representativos de los datos.
El algoritmo funciona de forma adaptativa: para cada nueva consulta, la selección de ejemplos se realiza de nuevo, teniendo en cuenta su contexto local. Esto permite reducir el número de ejemplos necesarios al mínimo, manteniendo la precisión.
Qué supone esto en la práctica
Los experimentos han mostrado resultados impresionantes. Al usar ARASH junto con TabPFN, la longitud del prompt se reduce 1261.5 veces y el consumo de memoria, 2.56 veces. Además, la precisión se mantiene comparable a la del prompt completo. Esto significa que el modelo se puede usar en entornos con recursos limitados: en dispositivos periféricos, aplicaciones web o procesamiento de grandes flujos de datos.

Estos resultados se logran porque ARASH no selecciona simplemente filas similares, sino precisamente aquellas que aportan la máxima información para la consulta dada. Esto es especialmente importante cuando el conjunto de entrenamiento es grande y el tiempo de inferencia es limitado.
Conclusiones
ARASH es un paso más hacia que los potentes modelos tabulares estén disponibles en aplicaciones reales. La combinación de modelos generativos y una selección inteligente de ejemplos abre el camino hacia un aprendizaje few-shot eficiente sin pérdida de calidad.

En el futuro, cabe esperar avances en esta dirección: quizás surjan métodos que compriman aún más los prompts o se adapten a otros tipos de datos.



