Ribbon

178 materiales

Clasificación
Noticias11 septiembre 2026

NL2SHACL-Bench: un nuevo punto de referencia para evaluar la generación de formas SHACL a partir de requisitos textuales

En un artículo para ISWC 2026, los autores presentaron una herramienta que mide la capacidad de los LLM para convertir consultas ordinarias en restricciones SHACL válidas, teniendo en cuenta que las mismas reglas pueden verse de diferentes maneras. Las pruebas en cuatro modelos mostraron que manejan fácilmente la sintaxis, pero a menudo no captan la semántica de restricciones complejas.

NL2SHACL-Bench: un nuevo punto de referencia para evaluar la generación de formas SHACL a partir de requisitos textuales
Leer
Noticias10 septiembre 2026

Estrategias cognitivas sin indicaciones: un método adaptativo mejora el razonamiento de los LLM a través de estados internos

El nuevo enfoque LRS durante la generación ajusta cuidadosamente las representaciones ocultas del modelo, guiándose por señales de calidad de los pasos intermedios. Gracias a esto, los modelos de lenguaje razonadores encuentran y corrigen sus propios errores, y los experimentos muestran un aumento estable de precisión en varios benchmarks.

Estrategias cognitivas sin indicaciones: un método adaptativo mejora el razonamiento de los LLM a través de estados internos
Leer
Noticias10 septiembre 2026

Nuevo benchmark GIM: evaluación de LLM en la intersección de distintas habilidades cognitivas

Los investigadores propusieron un enfoque que evalúa los modelos no por la cantidad de conocimiento ni de forma aislada de la realidad, sino a través de tareas que requieren simultáneamente razonamiento, control del contexto y trabajo con restricciones. El benchmark incluyó 820 tareas originales, y sus autores también estudiaron cómo afectan al resultado los ajustes de «reflexión» y otros parámetros de los modelos.

Nuevo benchmark GIM: evaluación de LLM en la intersección de distintas habilidades cognitivas
Leer