Ribbon

12 materiales

Clasificación
Noticias6 septiembre 2026

Cuando el juez es parcial: los agentes de autoaprendizaje dejan de eliminar habilidades inútiles

Un nuevo estudio muestra que un juez LLM sesgado rompe silenciosamente el mecanismo de descarte de habilidades fallidas: si la proporción de falsos éxitos supera 0,45, el sistema deja de limpiar la biblioteca de habilidades, y esto no se detecta en las métricas agregadas. Los autores proponen una auditoría económica con inyección de defectos para verificar al juez antes del despliegue.

Cuando el juez es parcial: los agentes de autoaprendizaje dejan de eliminar habilidades inútiles
Leer
Noticias5 septiembre 2026

Por qué el enfoque GPT tropieza con la música simbólica: la compresión solo funciona en el sistema de coordenadas correcto

El éxito de los modelos de lenguaje no solo está relacionado con la reutilización de tokens, sino también con cómo está estructurada la compresión. Para la música, intentar fijar de antemano las relaciones, por ejemplo mediante el círculo de quintas, empeora las predicciones — es más importante dejar el contexto al modelo y definir correctamente el tiempo.

Por qué el enfoque GPT tropieza con la música simbólica: la compresión solo funciona en el sistema de coordenadas correcto
Leer
Noticias29 agosto 2026

¿Por qué no se pueden considerar fiables las evaluaciones de preferencias de los LLM? Una prueba a gran escala reveló contradicciones

Los autores evaluaron seis modelos de lenguaje con preguntas sobre vuelos, apartamentos y hoteles, y descubrieron que las respuestas numéricas sobre la disposición a pagar se contradicen sistemáticamente entre sí. Debido a esto, dichas estimaciones no pueden describirse mediante una única función de utilidad, por lo que confiar en ellas para la toma de decisiones resulta arriesgado.

¿Por qué no se pueden considerar fiables las evaluaciones de preferencias de los LLM? Una prueba a gran escala reveló contradicciones
Leer