Ribbon

60 materiales

Clasificación
Noticias11 septiembre 2026

SQL agéntico sin ilusiones: una escala unificada de autonomía y una comparación honesta de los benchmarks de LLM

Los investigadores proponen considerar el área de Text-to-SQL como un leaderboard consolidado, donde los resultados se distribuyen según el grado de autonomía del modelo al generar consultas SQL. Realizan mediciones en Spider y demuestran que los éxitos no siempre se trasladan a otros benchmarks, y que la autonomía aporta robustez, pero requiere recursos computacionales considerables.

SQL agéntico sin ilusiones: una escala unificada de autonomía y una comparación honesta de los benchmarks de LLM
Leer
Noticias9 septiembre 2026

FinSkillBench: en agentes de IA de inversión, las habilidades procedimentales listas a veces importan más que la elección del modelo

Un nuevo benchmark evalúa a los agentes lingüísticos en la optimización de carteras, la gestión de riesgos y el análisis fundamental. En nueve modelos, los paquetes de habilidades previamente recopilados mejoran notablemente los resultados promedio, mientras que la creación autónoma de habilidades por parte del agente casi no aporta ventajas.

FinSkillBench: en agentes de IA de inversión, las habilidades procedimentales listas a veces importan más que la elección del modelo
Leer
Noticias8 septiembre 2026

OpenAI endurece su enfoque hacia la privacidad: nuevo sistema de protección de datos en respuesta al almacenamiento de sesiones durante 30 días por parte de Anthropic

OpenAI presentó un monitoreo automatizado de abusos que no guarda los datos de los clientes, una respuesta directa a la reciente política de Anthropic de almacenar las conversaciones durante 30 días. Así, las empresas intensifican su lucha por la confianza de los usuarios corporativos en medio de una creciente competencia.

OpenAI endurece su enfoque hacia la privacidad: nuevo sistema de protección de datos en respuesta al almacenamiento de sesiones durante 30 días por parte de Anthropic
Leer
Noticias8 septiembre 2026

Modelos de IA meteorológicos probados como climáticos: qué mostraron las simulaciones plurianuales de ArchesWeather y ArchesWeatherGen

Los investigadores adaptaron dos redes neuronales para experimentos atmosféricos de largo plazo, añadiéndoles condiciones de contorno externas, y las ejecutaron siguiendo el protocolo AIMIP. Resultó que los modelos, diseñados originalmente para pronósticos de hasta diez días, producen un ciclo anual estable y reproducen de manera plausible la climatología y la variabilidad en simulaciones de varias décadas.

Modelos de IA meteorológicos probados como climáticos: qué mostraron las simulaciones plurianuales de ArchesWeather y ArchesWeatherGen
Leer
Noticias7 septiembre 2026

En lugar de BFI: el nuevo cuestionario de personalidad CSI hace que la evaluación de modelos sea más estable y predictiva

Los investigadores desarrollaron el Core Sentiment Inventory (CSI), una herramienta de evaluación de rasgos de personalidad para LLM que tiene en cuenta su naturaleza computacional. Responde de manera más estable a cambios en la redacción, funciona en inglés y chino, y predice el comportamiento real de los modelos con una correlación superior a 0,85.

En lugar de BFI: el nuevo cuestionario de personalidad CSI hace que la evaluación de modelos sea más estable y predictiva
Leer
Noticias3 septiembre 2026

Jailbreak de caja negra: por qué comparar ataques con igual número de consultas al modelo

Los investigadores propusieron el protocolo Fair-ASR, que evalúa ataques contra LLM con el mismo presupuesto de consultas al modelo objetivo, y los costos del atacante se consideran por separado. La revisión de 11 métodos conocidos mostró que su clasificación depende en gran medida del presupuesto, y que las plantillas simples no son inferiores a los enfoques complejos basados en LLM, lo que llevó a los autores a crear el nuevo ataque ReCode.

Jailbreak de caja negra: por qué comparar ataques con igual número de consultas al modelo
Leer