La respuesta correcta no garantiza el dibujo correcto: un nuevo benchmark evalúa los diagramas geométricos de la IA

9 septiembre 20260 vistas

Los investigadores presentaron un conjunto abierto de 954 problemas de geometría de olimpiadas, donde lo importante no es resolver el ejemplo, sino construir una figura correcta. Se descubrió que incluso los modelos matemáticos más potentes rinden notablemente peor en los dibujos: en promedio, solo alrededor del 36% de los diagramas se ensamblan con éxito.

La respuesta correcta no garantiza el dibujo correcto: un nuevo benchmark evalúa los diagramas geométricos de la IA

La respuesta correcta aún no es un dibujo

Los grandes modelos de lenguaje modernos resuelven con confianza problemas de matemáticas olímpicas. En geometría esto es especialmente notable: el modelo da una respuesta numérica y parece que visualiza el enunciado. Sin embargo, entre la capacidad de resolver un problema y la capacidad de dibujar un diagrama correcto hay una gran diferencia. La respuesta se puede obtener mediante transformaciones algebraicas, mientras que el dibujo requiere tener en cuenta la disposición mutua de puntos, líneas y construcciones adicionales. Por ejemplo, GPT y Claude muestran altos resultados en pruebas matemáticas estándar, pero hasta hace poco no existía una prueba que verificara por separado su capacidad para crear dibujos.

Los autores del nuevo trabajo (preimpresión arXiv:2608.18111, presentado en el taller AI4MATH dentro de ICML 2026) señalan que los benchmarks existentes, incluidos los populares MathVista y MathVerse, evalúan principalmente la respuesta final. Ninguno de ellos, según afirman, aísla la construcción del diagrama como una habilidad independiente. Este fue el punto de partida para el nuevo conjunto de datos.

Qué contiene el benchmark

Los investigadores recopilaron un conjunto abierto de 954 problemas de geometría olímpica. Cada problema es completamente autónomo: su enunciado no requiere referencias externas y admite una interpretación inequívoca. Además, en el conjunto se destaca un subconjunto complejo de 297 problemas para los que se requiere un trabajo especialmente cuidadoso con el dibujo.

Para cada problema, los autores prepararon una solución de referencia y un dibujo de alta precisión creado por humanos en código Asymptote. Este formato permite renderizar el diagrama y compararlo con lo que genera el modelo.

Para evaluar el razonamiento diagramático, los desarrolladores proponen varios tipos de métricas. Verifican el resultado por texto, por código, por la imagen final, y también recurren a modelos de visión-lenguaje y a comprobaciones individuales de restricciones. Gracias a esto, se puede ver no solo si la figura se ha renderizado, sino también en qué medida corresponde a las condiciones geométricas originales.

Qué mostraron las primeras pruebas

Los autores ejecutaron varios modelos fundamentales a través del benchmark. Los resultados confirmaron la hipótesis inicial: los modelos resuelven problemas notablemente mejor de lo que crean diagramas para ellos. La tasa media de compilación exitosa de los dibujos generados fue de solo 36,14%. Esto significa que en la mayoría de los casos el modelo o no maneja el código, o construye una figura geométricamente incorrecta.

Además, el bajo resultado no puede explicarse únicamente por la complejidad del lenguaje Asymptote: para algunos problemas los modelos dan la respuesta correcta, pero no pueden dibujar ni siquiera un enunciado aproximado. Parece que el pensamiento espacial y el razonamiento matemático en la IA moderna se desarrollan de forma independiente, y los métodos de entrenamiento actuales no los conectan entre sí.

Por qué es importante

Un dibujo preciso es una parte importante de la geometría olímpica. A menudo es precisamente la construcción adicional —una circunferencia trazada, un segmento o un punto simétrico— la que sugiere la solución. Si el modelo no sabe construir tales elementos auxiliares, su «éxito» en geometría no puede considerarse una comprensión completa del problema.

El benchmark creado permite a los investigadores separar la habilidad de resolver de la habilidad de visualizar. Este es el primer paso para que los desarrolladores comiencen a entrenar modelos de manera específica para trabajar con representaciones gráficas. Los datos abiertos de 954 problemas están disponibles en el enlace del resumen, por lo que cualquiera puede utilizar la nueva prueba.

La conclusión es simple: una respuesta correcta no es garantía de un dibujo correcto. El nuevo conjunto de datos ayuda a verlo claramente y, posiblemente, se convierta en la base para un entrenamiento de IA más «espacial».

Preguntas frecuentes

La respuesta correcta no garantiza el dibujo correcto: un nuevo benchmark evalúa los diagramas geométricos de la IA