Верный ответ — ещё не чертёж
Современные большие языковые модели уверенно решают задачи из олимпиадной математики. В геометрии это особенно заметно: модель выдаёт числовой ответ, и кажется, что она представляет себе условие. Однако между умением решить задачу и умением начертить корректную диаграмму есть большая разница. Ответ можно получить с помощью алгебраических преобразований, а чертёж требует учёта взаимного расположения точек, линий и дополнительных построений. Например, GPT и Claude показывают высокие результаты в стандартных математических тестах, но до последнего времени не существовало теста, который отдельно проверил бы их способность создавать чертежи.
Авторы новой работы (препринт arXiv:2608.18111, представлен на воркшопе AI4MATH в рамках ICML 2026) замечают, что существующие бенчмарки, включая популярные MathVista и MathVerse, оценивают главным образом финальный ответ. Ни один из них, по их словам, не изолирует построение диаграммы как самостоятельный навык. Это и стало отправной точкой для нового набора данных.
Что внутри бенчмарка
Исследователи собрали открытый набор из 954 задач по олимпиадной геометрии. Каждая задача полностью самодостаточна: её условие не требует внешних ссылок и допускает однозначную интерпретацию. Дополнительно в наборе выделено сложное подмножество из 297 задач, для которых важна особенно тщательная работа с чертежом.
Для каждой задачи авторы подготовили эталонное решение и высокоточный чертёж, созданный человеком в коде Asymptote. Такой формат позволяет рендерить диаграмму и сравнивать её с тем, что генерирует модель.

Для оценки диаграммных рассуждений разработчики предлагают несколько типов метрик. Они проверяют результат по тексту, по коду, по итоговому изображению, а также привлекают vision-language модели и отдельные проверки ограничений. Благодаря этому можно увидеть не только, отрисовалась ли фигура, но и насколько она соответствует исходным геометрическим условиям.
Что показали первые тесты
Авторы прогнали через бенчмарк несколько фундаментальных моделей. Результаты подтвердили исходную гипотезу: модели заметно лучше решают задачи, чем создают к ним диаграммы. Средний показатель успешной компиляции сгенерированных чертежей составил всего 36,14%. Это означает, что в большинстве случаев модель либо не справляется с кодом, либо строит геометрически некорректную фигуру.

Причём низкий результат нельзя объяснить только сложностью языка Asymptote: для части задач модели выдают правильный ответ, но не могут нарисовать даже примерное условие. Похоже, пространственное мышление и математическое рассуждение у современных ИИ развиваются независимо, и текущие методы обучения не связывают их между собой.
Почему это важно
Точный чертёж — важная часть олимпиадной геометрии. Часто именно дополнительное построение — проведённая окружность, отрезок или симметричная точка — подсказывает решение. Если модель не умеет строить такие вспомогательные элементы, её «успех» в геометрии нельзя считать полноценным пониманием задачи.
Созданный бенчмарк позволяет исследователям отделить умение решать от умения визуализировать. Это первый шаг к тому, чтобы разработчики начали целенаправленно обучать модели работать с графическими представлениями. Открытые данные из 954 задач доступны по ссылке в аннотации, так что воспользоваться новым тестом может любой желающий.
Итог простой: верный ответ — не гарантия верного чертежа. Новый набор данных помогает увидеть это наглядно и, возможно, станет основой для более «пространственного» обучения ИИ.



