Неочевидная сложность SHACL
SHACL считается одним из ключевых языков для валидации RDF-графов, ведь он позволяет проверять, соответствуют ли данные заданным схемам и ограничениям. Но беда в том, что составление шейпов требует серьёзной технической подготовки, которой обычно не хватает специалистам в конкретной предметной области. Гораздо удобнее было бы описывать нужные ограничения на естественном языке и получать готовый формальный код. Именно такую задачу пытаются решить современные модели генерации кода, но до сих пор было непонятно, как объективно оценивать их результаты.
NL2SHACL-Bench: новый измерительный инструмент
Команда исследователей — Ю. Чжоу, Н. Бобет и М. Акоста — представила набор тестов NL2SHACL-Bench, предназначенный для перевода требований с естественного языка в шейпы SHACL. Работа принята на конференцию ISWC 2026, а на arXiv выложены две версии препринта: первая появилась в конце июля 2026 года, обновлённая — в конце августа. В статье подробно описаны структура бенчмарка и методика проведения экспериментов.
Раньше специализированного бенчмарка для таких задач попросту не существовало. Исследователям приходилось собирать собственные примеры без единого стандарта, что мешало сравнивать решения между собой. Новый набор должен закрыть этот пробел и дать сообществу общую точку отсчёта.

Почему простое сравнение строк не работает
Одна из главных проблем при оценке NL2SHACL-систем — семантическая эквивалентность. Два шейпа могут выражать одно и то же правило, но отличаться по структуре или способу сериализации. Если сравнивать только текстовое представление, одинаковые по смыслу результаты будут отбраковываться, а внешне похожие — ошибочно приниматься. Поэтому авторы бенчмарка сделали ставку на методы, которые проверяют именно смысловое соответствие, а не простую строковую совпадение.
В экспериментах участвовали четыре современные большие языковые модели. Выяснилось, что они довольно уверенно порождают синтаксически корректный SHACL, но заметно хуже справляются со сложными логическими и структурными паттернами, где требуется точное воспроизведение смысла ограничений. Это важный сигнал: код, который выглядит аккуратно, не всегда отражает то, что на самом деле имел в виду пользователь.

Что это меняет
Появление NL2SHACL-Bench — важный шаг к созданию практичных инструментов для работы с RDF-графами. Теперь разработчики и исследователи могут измерять прогресс моделей не на глаз, а с помощью единого набора тестов. Это позволит точнее определять слабые места языковых моделей и постепенно приближаться к решению, которое действительно понимает намерения человека.
Пока рано говорить, что генерация SHACL из текста полностью решена, — сложные ограничения всё ещё ставят модели в тупик. Но наличие стандартного ориентира делает дальнейшие исследования системными, а их результаты — сравнимыми друг с другом.



