VDGR-RAG: cuando la búsqueda vectorial sola no basta — esquema híbrido para bases de conocimiento corporativas complejas

6 septiembre 202618 vistas

Los investigadores propusieron un marco que conecta la búsqueda vectorial, la navegación por índice, los vínculos de grafo y la autorreflexión iterativa. En documentos corporativos de cuatro dominios de telecomunicaciones, este enfoque mejora notablemente la exhaustividad de la búsqueda de conocimiento y la precisión de las respuestas.

VDGR-RAG: cuando la búsqueda vectorial sola no basta — esquema híbrido para bases de conocimiento corporativas complejas

Por qué la búsqueda vectorial por sí sola no es suficiente

Las bases de datos vectoriales encuentran bien coincidencias semánticas, pero la documentación corporativa vive según sus propias reglas: una estricta jerarquía de directorios, múltiples dominios temáticos y referencias cruzadas entre secciones. Una consulta como «cómo reducir el consumo energético de la estación base» requiere no solo párrafos similares, sino un acierto preciso en la subsección correcta, teniendo en cuenta las instrucciones relacionadas. Los esquemas RAG clásicos empiezan a fallar en esta etapa: la consulta se dirige a un dominio incorrecto, la estructura de los documentos se ignora de facto y la búsqueda no se apoya en un razonamiento sobre dónde exactamente conviene buscar.

Los autores de un reciente preprint en arXiv propusieron el marco VDGR-RAG, que combina cuatro enfoques: vectores, directorios, grafos y reflexión. El sistema funciona como un agente: no solo extrae fragmentos, sino que se desplaza deliberadamente por la base de conocimiento, evalúa los resultados intermedios y, si es necesario, cambia de rumbo.

La idea clave: del directorio al grafo de conocimiento

La base de VDGR-RAG es la construcción de un grafo de conocimiento heterogéneo (H²KG) a partir de los documentos. En él se conserva la jerarquía de directorios —las relaciones «padre-hijo» entre secciones y subsecciones—, así como las relaciones semánticas entre bloques de significado. Gracias a ello, el sistema puede responder en cualquier momento a preguntas como: «¿en qué sección se encuentra este fragmento?», «¿qué más está relacionado con este tema?», «¿hasta dónde hay que subir para obtener el contexto general?».

Herramientas de búsqueda atómicas

La lógica de agente se implementa mediante cuatro módulos que interactúan entre sí.

  1. Directory-enhanced routing — navegación por el índice. El módulo primero decide a qué dominio o grafo de conocimiento pertenece la consulta, y solo después lanza la búsqueda profunda.
  2. Multi-route retrieval — extracción paralela de información de tres formas a la vez: vectorial, estructural (por secciones del índice) y mediante grafos. Esto reduce el riesgo de pasar por alto un documento importante.
  3. Directory backtracking — si el enrutamiento inicial resulta incorrecto, el agente vuelve al directorio y cambia la trayectoria de búsqueda.
  4. Dynamic reflection — tras cada paso, el sistema evalúa si se han acumulado suficientes hechos y planifica la siguiente consulta. En esencia, es una autorreflexión iterativa que impide «enterrarse» en fragmentos irrelevantes.

Los módulos no funcionan uno tras otro, sino como un único circuito: la reflexión puede lanzar un nuevo enrutamiento, y la multibúsqueda puede devolver candidatos que luego hay que verificar a través del grafo. La búsqueda se convierte en un proceso iterativo flexible, y no en una única llamada al índice.

Qué mostraron las pruebas

Los autores verificaron el valor práctico en documentos corporativos pertenecientes a cuatro dominios inalámbricos —incluidos el ahorro energético y la gestión de fallos—. Los resultados fueron notablemente mejores que los de los sistemas RAG estándar, tanto en exhaustividad del conocimiento encontrado como en precisión de las respuestas a las preguntas.

La posibilidad de volver al directorio resultó especialmente útil: era precisamente ella la que corregía situaciones en las que la búsqueda vectorial convencional daba con seguridad un resultado equivocado. Para documentación jerárquica, esta «verificación con el índice» suele ser más importante que un índice adicional.

Conclusiones

VDGR-RAG no es solo otro recuperador híbrido, sino un ejemplo de cómo los principios de agente y las representaciones mediante grafos resuelven problemas reales de las empresas. Cuando en una base de conocimiento la jerarquía es importante y un error en la elección de la sección puede arruinar toda la respuesta, la búsqueda vectorial por sí sola realmente no es suficiente.

Preguntas frecuentes

VDGR-RAG: cuando la búsqueda vectorial sola no basta — esquema híbrido para bases de conocimiento corporativas complejas