Por qué los modelos mienten con tanta seguridad
Los grandes modelos de lenguaje modernos impresionan por su capacidad para responder a las preguntas más diversas. Pero detrás de esa seguridad a menudo se esconde un defecto grave: el modelo puede ofrecer una respuesta bonita y coherente basada en hechos inventados. Una de las causas clave es el llamado desajuste de conocimiento: durante la fase de preentrenamiento, el modelo absorbe enormes cantidades de datos, y durante la fase de ajuste para tareas específicas se le «incrustan» nuevas instrucciones. Como resultado, el modelo no siempre entiende dónde termina lo que realmente sabe y comienza el área de la ignorancia.
Investigadores del equipo de Joosung Lee y sus colegas propusieron un enfoque que ayuda a los modelos a decir honestamente «no lo sé» cuando la respuesta realmente queda fuera de los límites de su competencia. El trabajo fue aceptado como Findings of EMNLP 2026 y publicado en arXiv.

Evaluación del conocimiento a nivel de ejemplo concreto
La principal dificultad es entender si el modelo sabe la respuesta a una pregunta concreta, y no a un «tema» en general. El modelo puede dominar perfectamente un área y no tener ni idea de la vecina. Por eso, los autores proponen evaluar el conocimiento individualmente para cada consulta.
Para ello se utiliza la inferencia con múltiples muestras: se le hace la misma pregunta al modelo varias veces y luego se analiza cuán estables y consistentes son sus respuestas. Si las respuestas se reproducen con un alto grado de confianza y coinciden entre sí, es muy probable que el modelo realmente «conozca» el tema. Si las respuestas cambian de forma caótica o el modelo ofrece versiones diferentes, es una señal de que no hay conocimiento.
Este enfoque ofrece un indicador más fiable y de grano más fino que la confianza habitual del modelo en una sola generación. Se convierte en la base para el aprendizaje posterior.
Ajuste teniendo en cuenta lo que el modelo ya sabe
El indicador de conocimiento obtenido no se utiliza como una evaluación externa, sino como una señal de control para el ajuste. La idea es que el modelo debe aprenderse de manera diferente en distintos ejemplos:
- Si el modelo sabe la respuesta, la señal de entrenamiento se refuerza para consolidar el comportamiento correcto y no perder las habilidades ya existentes.
- Si el modelo no sabe la respuesta, la señal se escala de otra manera y se anima adicionalmente al modelo a dar una respuesta explícita de «no lo sé», en lugar de generar texto aleatorio o semiverosímil.

Este enfoque ayuda a evitar la situación en la que el ajuste con nuevos datos «borra» los límites del conocimiento del modelo y lo obliga a responder a todo, incluido aquello que no domina. En su lugar, el modelo aprende a reconocer las consultas que quedan fuera del área de su competencia y a comunicarlo honestamente.
Cómo medir que el modelo se ha vuelto más honesto
Simplemente reducir el número de alucinaciones no es suficiente: es importante que el modelo no empiece a negarse masivamente a responder preguntas que realmente sabe. Por eso, los investigadores propusieron métricas especiales para evaluar la incertidumbre. Evalúan no solo la precisión en preguntas «de la base de conocimiento», sino también la capacidad del modelo para distinguir ejemplos conocidos de desconocidos.
El resultado clave de los experimentos: el método propuesto permite al modelo expresar explícitamente la incertidumbre cuando falta conocimiento y, al mismo tiempo, no perder precisión en las preguntas que sí puede responder. La distinción precisa entre lo conocido y lo desconocido mejora de forma estable el rendimiento final, es decir, el modelo se vuelve más cuidadoso y fiable.
Conclusión
Saber decir «no lo sé» no es una debilidad, sino una parte necesaria del uso seguro de los LLM. El método de ajuste ponderado por conocimiento recuerda que, para combatir las alucinaciones, no es necesario «empollar» aún más datos. Basta con enseñar al modelo a evaluar honestamente sus propios límites y no traspasarlos. Este enfoque hace que los modelos sean más útiles en escenarios reales, donde es mejor recibir un rechazo honesto que una desinformación segura.



