Почему одного векторного поиска мало
Векторные базы данных хорошо находят смысловые совпадения, но корпоративная документация живёт по своим законам: строгая иерархия каталогов, множество тематических доменов, перекрёстные ссылки между разделами. Запрос «как уменьшить энергопотребление базовой станции» требует не просто похожих абзацев, а точного попадания в нужный подраздел с учётом смежных инструкций. Классические RAG-схемы на этом этапе начинают ошибаться: запрос уходит в неверный домен, структура документов фактически игнорируется, а поиск не подкреплён рассуждением о том, где именно стоит искать.
Авторы недавнего препринта на arXiv предложили фреймворк VDGR-RAG, который объединяет четыре подхода: векторы, каталоги, графы и рефлексию. Система работает как агент: она не просто извлекает фрагменты, а целенаправленно перемещается по базе знаний, оценивает промежуточные результаты и при необходимости меняет курс.

Ключевая идея: от каталога к графу знаний
В основе VDGR-RAG лежит построение из документов гетерогенного графа знаний (H²KG). В нём сохраняется иерархия каталогов — связи «родитель-ребёнок» между разделами и подразделами, — а также семантические отношения между смысловыми блоками. Благодаря этому система в любой момент может ответить на вопросы: «в каком разделе находится этот фрагмент?», «что ещё связано с этой темой?», «куда нужно подняться, чтобы получить общий контекст?».
Атомарные инструменты поиска
Агентская логика реализована через четыре взаимодействующих модуля.
- Directory-enhanced routing — навигация по оглавлению. Модуль сначала решает, к какому домену или графу знаний относится запрос, и только потом запускает глубокий поиск.
- Multi-route retrieval — параллельное извлечение информации сразу тремя способами: векторным, структурным (по разделам оглавления) и графовым. Это снижает риск упустить важный документ.
- Directory backtracking — если первоначальная маршрутизация оказалась неверной, агент возвращается к каталогу и меняет траекторию поиска.
- Dynamic reflection — система после каждого шага оценивает, достаточно ли накоплено фактов, и планирует следующий запрос. По сути это итеративная саморефлексия, которая не даёт «закапываться» в нерелевантных фрагментах.
Модули работают не по очереди, а как единый контур: рефлексия может запустить повторную маршрутизацию, а мультипоиск вернуть кандидатов, которых затем нужно проверить через граф. Поиск превращается в гибкий итеративный процесс, а не в разовое обращение к индексу.
Что показали тесты
Практическую ценность авторы проверили на корпоративных документах, относящихся к четырём беспроводным доменам — в том числе к энергосбережению и управлению отказами. Результаты оказались заметно лучше, чем у стандартных RAG-систем, как по полноте находимых знаний, так и по точности ответов на вопросы.

Особенно полезной стала возможность возвращаться к каталогу: именно она исправляла ситуации, в которых обычный векторный поиск уверенно выдавал не то. Для иерархической документации подобная «сверка с оглавлением» часто важнее дополнительного индекса.
Выводы
VDGR-RAG — это не просто очередной гибридный ретривер, а пример того, как агентные принципы и графовые представления закрывают проблемы реальных предприятий. Когда в базе знаний важна иерархия, а ошибка в выборе раздела может испортить весь ответ, одного векторного поиска действительно мало.



