Верный ответ не гарантирует верный чертёж: свежий бенчмарк проверяет геометрические диаграммы у ИИ

9 сентября 20260 просмотров

Исследователи представили открытый набор из 954 олимпиадных задач по геометрии, где важно не решить пример, а построить корректную фигуру. Выяснилось, что даже сильные математические модели заметно хуже справляются с чертежами: в среднем успешно собирается лишь около 36% диаграмм.

Верный ответ не гарантирует верный чертёж: свежий бенчмарк проверяет геометрические диаграммы у ИИ

Верный ответ — ещё не чертёж

Современные большие языковые модели уверенно решают задачи из олимпиадной математики. В геометрии это особенно заметно: модель выдаёт числовой ответ, и кажется, что она представляет себе условие. Однако между умением решить задачу и умением начертить корректную диаграмму есть большая разница. Ответ можно получить с помощью алгебраических преобразований, а чертёж требует учёта взаимного расположения точек, линий и дополнительных построений. Например, GPT и Claude показывают высокие результаты в стандартных математических тестах, но до последнего времени не существовало теста, который отдельно проверил бы их способность создавать чертежи.

Авторы новой работы (препринт arXiv:2608.18111, представлен на воркшопе AI4MATH в рамках ICML 2026) замечают, что существующие бенчмарки, включая популярные MathVista и MathVerse, оценивают главным образом финальный ответ. Ни один из них, по их словам, не изолирует построение диаграммы как самостоятельный навык. Это и стало отправной точкой для нового набора данных.

Что внутри бенчмарка

Исследователи собрали открытый набор из 954 задач по олимпиадной геометрии. Каждая задача полностью самодостаточна: её условие не требует внешних ссылок и допускает однозначную интерпретацию. Дополнительно в наборе выделено сложное подмножество из 297 задач, для которых важна особенно тщательная работа с чертежом.

Для каждой задачи авторы подготовили эталонное решение и высокоточный чертёж, созданный человеком в коде Asymptote. Такой формат позволяет рендерить диаграмму и сравнивать её с тем, что генерирует модель.

Для оценки диаграммных рассуждений разработчики предлагают несколько типов метрик. Они проверяют результат по тексту, по коду, по итоговому изображению, а также привлекают vision-language модели и отдельные проверки ограничений. Благодаря этому можно увидеть не только, отрисовалась ли фигура, но и насколько она соответствует исходным геометрическим условиям.

Что показали первые тесты

Авторы прогнали через бенчмарк несколько фундаментальных моделей. Результаты подтвердили исходную гипотезу: модели заметно лучше решают задачи, чем создают к ним диаграммы. Средний показатель успешной компиляции сгенерированных чертежей составил всего 36,14%. Это означает, что в большинстве случаев модель либо не справляется с кодом, либо строит геометрически некорректную фигуру.

Причём низкий результат нельзя объяснить только сложностью языка Asymptote: для части задач модели выдают правильный ответ, но не могут нарисовать даже примерное условие. Похоже, пространственное мышление и математическое рассуждение у современных ИИ развиваются независимо, и текущие методы обучения не связывают их между собой.

Почему это важно

Точный чертёж — важная часть олимпиадной геометрии. Часто именно дополнительное построение — проведённая окружность, отрезок или симметричная точка — подсказывает решение. Если модель не умеет строить такие вспомогательные элементы, её «успех» в геометрии нельзя считать полноценным пониманием задачи.

Созданный бенчмарк позволяет исследователям отделить умение решать от умения визуализировать. Это первый шаг к тому, чтобы разработчики начали целенаправленно обучать модели работать с графическими представлениями. Открытые данные из 954 задач доступны по ссылке в аннотации, так что воспользоваться новым тестом может любой желающий.

Итог простой: верный ответ — не гарантия верного чертежа. Новый набор данных помогает увидеть это наглядно и, возможно, станет основой для более «пространственного» обучения ИИ.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Бенчмарк геометрии для ИИ: верный ответ ≠ верный чертёж