La evaluación de los agentes de búsqueda suele basarse en escenarios cuidadosamente definidos: intervenciones conocidas de antemano, consultas predecibles, un único usuario «promedio». Este enfoque es cómodo de medir, pero refleja mal la realidad, donde tras una misma interfaz hay personas con ritmos, estilos y paciencia completamente distintos. El trabajo AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval (arXiv:2608.24076, aceptado en el taller Agent4IR @ KDD 2026) propone mirar la fiabilidad del agente de otra manera: a través del carácter del interlocutor y de los intentos de quebrar ese carácter.
De los guiones a las personalidades: dónde está el vacío
El benchmark clásico para la búsqueda agéntica responde a la pregunta «¿resolvió el agente la tarea?». Pero guarda silencio sobre lo que ocurre entre los pasos y casi nada dice sobre la dispersión de los resultados. Si todos los usuarios de la prueba se comportan igual y los ataques al sistema no se modelan en absoluto, las conclusiones salen estériles: con esa medición es imposible entender dónde exactamente empieza a tropezar el agente.
Precisamente ese hueco es el que intentan cerrar los autores —Gunja Agarwal, Arup Kumar Das, Arun Menon, Jitesh Chandra Mishra y Vignesh Divakaran—. Su idea clave es simple: la dispersión del comportamiento de los usuarios no debe suavizarse, sino convertirse en un instrumento de medición aparte.

Qué es AgentWorld
AgentWorld es un simulador, no un motor de búsqueda independiente. No resuelve tareas en lugar del agente, sino que crea un entorno en el que se puede someter al agente a distintos escenarios y distintos tipos de interlocutores, registrando no solo la respuesta final, sino también la trayectoria para obtenerla.
Cuatro bloques de apoyo
- Modelos de usuario según los Big Five. Las personas se definen según el modelo de cinco factores (también llamado OCEAN), y no operan en el vacío: cada usuario tiene su propio estado y su propio conjunto de herramientas disponibles, y esos estados cambian a lo largo del diálogo.
- Métrica de consistencia pass^k. No es simplemente «cuántas veces salió». Va acompañada de una clasificación estructural de fallos, una puntuación parcial por progreso incompleto pero significativo y una doble verificación de la transferencia de control, es decir, se verifica por separado si el agente cedió correctamente el turno a la persona o a otro sistema.
- Exportación de datos para reentrenamiento. El simulador puede volcar los ciclos acumulados, descartando los de evaluación débil, directamente en seis formatos aptos para el fine-tuning.
- Risk Analyser de carácter adversarial. Este módulo toma instantáneas de las «crestas» de los estados intermedios que el agente está obligado a atravesar y luego ramifica los ciclos mediante el método de Montecarlo según cuatro tipos de perturbaciones vinculadas a la tarea concreta. El riesgo final se calcula mediante la relación ΔP / ΔT, la fusión de evidencias según Dempster—Shafer y la atribución de categorías de ataque según Shapley.
Fíjate en la lógica: los tres primeros bloques tratan de medición y aprendizaje; el cuarto, de predicción de fallos. El framework se concibe desde el inicio como una herramienta no solo de diagnóstico, sino también de pruebas de estrés.

Tres ciclos: de la analítica al ataque adversarial
La parte experimental consta de tres partes con distinto grado de «carga».
- El agente analítico conversacional se ejecutó contra diez personas OCEAN. Para el etiquetado de calidad se reunieron 240 evaluaciones de jueces.
- El agente de atención al cliente se probó en cinco tareas, cada una en cuatro variantes de persona.
- La prueba de estrés adversarial de esas mismas cinco tareas: aquí se añadieron perturbaciones para ver con qué rapidez se desmoronan las trayectorias.
El tercer ciclo resultó el más revelador. Incluso en ausencia de perturbaciones, la estabilidad mínima de la trayectoria fue V_min = 0.375, es decir, ni siquiera las condiciones «limpias» ofrecen margen de resistencia. Y cuando se activaron los ataques, se descubrió que los golpes más peligrosos no son los dirigidos al contenido de la consulta, sino a las herramientas y la infraestructura: la atribución según Shapley asigna al nivel sistémico alrededor del 46% y al nivel de acciones, aproximadamente el 38%.
Es un cambio de énfasis importante. El debate sobre la seguridad de los agentes suele reducirse a las inyecciones de prompt en el texto, mientras que las cifras dicen que el riesgo principal vive en la capa que responde por las llamadas a herramientas y su estado.
El carácter como fuente de discrepancias
Lo más interesante del artículo no son las puntuaciones absolutas, sino la dispersión entre personas. En una misma tarea, la tasa de éxito variaba radicalmente: 50% frente a 100%. No es ruido de medición, sino una señal de que el agente se desenvuelve de forma distinta con diferentes estilos de comunicación.
Se enumeran aparte los modos de fallo que las pruebas unificadas simplemente no muestran:
- fugas entre dominios, cuando el contexto de una tarea se filtra a otra;
- deriva contextual, el desplazamiento gradual del tema y los objetivos a lo largo de un diálogo extenso;
- brecha de calidad entre personas de 0.27 puntos.
Los autores subrayan que el Risk Analyser sabe medir la fragilidad a nivel de trayectoria, allí donde una métrica única de pass^k es impotente, porque solo registra el hecho del éxito o el fracaso y no distingue entre «se rompió en el primer paso» y «llegó casi hasta el final, pero no mantuvo el estado».
Para qué sirve esto en la práctica
Si se toman las conclusiones como una receta, esta sería: prueba al agente no con un único usuario «promedio», sino con un conjunto de caracteres, y mira la dispersión entre ellos, no la media. La puntuación media puede ser bastante decente mientras la mitad de las personas falla el escenario de forma sistemática.
El segundo nivel práctico son los datos. Dado que el simulador puede marcar los ciclos exitosos y fallidos y exportarlos en formatos listos, las personalidades se convierten no solo en una prueba, sino también en una fuente de material de entrenamiento. El punto débil aquí es evidente: la calidad de ese dataset depende por completo de la calidad del etiquetado, y las evaluaciones de los jueces son la parte más cara y subjetiva del proceso.
Por último, el tercer nivel son las prioridades en la protección. Dado que la mayor parte del riesgo recae en el nivel sistémico y en las acciones, y no en las formulaciones, hay que reforzar en primer lugar los derechos de acceso, la verificación de llamadas y la corrección de la transferencia de control, y no solo los filtros sobre el texto de entrada.

Qué conviene tener en cuenta
Conviene recordar la escala: se trata de tres conjuntos de experimentos, diez personas en uno de ellos y cinco tareas en los otros dos. Cifras como 50% frente a 100% parecen dramáticas, pero se basan en una muestra pequeña: son más una indicación de dirección que un veredicto definitivo. Además, la simulación de usuario según los Big Five inevitablemente simplifica el carácter real: una persona viva es inconsistente, mientras que una persona en el simulador sigue después de todo un perfil dado.
Aun así, la idea metodológica parece sólida y transferible. La fiabilidad del agente no es un solo número, sino una distribución por tipos de interlocutor y por tipos de fallo. El simulador AgentWorld da el primer paso serio para que esa distribución pueda medirse en lugar de adivinarse.
La versión v1 del artículo apareció el 25 de agosto de 2026, la actual v2 es del 26 de agosto de 2026 (volumen 1,710 KB); DOI — 10.48550/arXiv.2608.24076, temática — cs.AI.



