Por qué una respuesta plausible no es suficiente
Un resultado plausible no demuestra que el agente de IA haya seguido el procedimiento. Para comprobarlo, hay que verificar no solo la respuesta, sino también las evidencias de ejecución.
En el trabajo ContractEval, la conformidad procedimental se trata como un objeto de verificación independiente. En un conjunto controlado, los jueces LLM pasaron por alto muchos fallos estructurales introducidos artificialmente. Esto ocurrió tanto al evaluar solo la respuesta como al tener en cuenta la traza.
- La respuesta muestra lo que comunicó el sistema.
- La traza de ejecución contiene evidencias de las acciones.
- La verificación procedimental contrasta estas evidencias con los requisitos.
Criterio: no considerar que la respuesta sea convincente como prueba de que se siguió el procedimiento.
Cómo funciona la verificación procedimental
ContractEval representa una instrucción como un conjunto de obligaciones activas para una solicitud concreta. Luego, el sistema contrasta las obligaciones con las evidencias de la respuesta o de la traza de ejecución.

La verificación consta de tres elementos:
- Solicitud determina qué obligaciones están activas.
- Respuesta o traza sirve como fuente de evidencias.
- Contraste identifica el cumplimiento y las infracciones.
Criterio práctico: la verificación debe vincular el requisito con una evidencia concreta de la respuesta o de la traza.
Qué infracciones se pueden distinguir
ContractEval distingue tipos específicos de fallos procedimentales. Esta clasificación muestra en qué punto divergen los requisitos y la ejecución.
- Omisión — falta una acción o un requisito obligatorio.
- Rama incorrecta — la ejecución siguió una rama inadecuada del procedimiento.
- Error de orden — las acciones no están en la secuencia requerida.
- Acción adicional — la ejecución incluye una acción no prevista.
- Infracción de un invariante — no se cumple una condición que debe mantenerse.
- Incumplimiento de los requisitos de salida — el resultado no satisface los requisitos especificados de formato o contenido.
Criterio: la clasificación debe indicar el tipo de fallo, en lugar de reducir todas las infracciones a una valoración general de la respuesta.
Qué mostró el estudio
Los autores del trabajo ContractEval compararon métodos de verificación en un conjunto controlado de contratos procedimentales. Los grafos de referencia de la ejecución esperada y la observada permitieron detectar y localizar todos los fallos estructurales introducidos artificialmente.
| Método de verificación | Resultado |
|---|---|
| Los jueces LLM evalúan la respuesta o tienen en cuenta la traza | Pasaron por alto muchos de los fallos introducidos |
| Contraste de los grafos de referencia y observados | Detectó y localizó todos esos fallos |
| Extracción de datos mediante LLM | Conservó gran parte de la señal, pero dependió de la calibración |
El trabajo de Praphul Singh, Shanu Kumar, Akshat Agarwal y Ganesh Kumar se envió a arXiv el 8 de septiembre de 2026: ContractEval.
Conclusión: los resultados corresponden a un conjunto controlado; no se pueden extrapolar a cualquier escenario.
Dónde están los límites de la verificación
ContractEval no garantiza que el sistema haya seguido el procedimiento. El trabajo hace que la conformidad sea auditable, en lugar de tratarla como una cualidad implícita de la respuesta final.
Al elegir un método de verificación, hay dos condiciones importantes:
- Si existe una representación de referencia de la ejecución esperada.
- Si se puede contrastar con las evidencias de la traza o la respuesta reales.
Si se utiliza la extracción de datos mediante LLM, hay que tener en cuenta la sensibilidad de los resultados a la calibración. La respuesta final por sí sola no sustituye la verificación de las evidencias procedimentales.
Criterio práctico: considerar que la conformidad está verificada solo cuando los requisitos se han contrastado con la ejecución observada.



