SQL agéntico sin ilusiones: una escala unificada de autonomía y una comparación honesta de los benchmarks de LLM
Los investigadores proponen considerar el área de Text-to-SQL como un leaderboard consolidado, donde los resultados se distribuyen según el grado de autonomía del modelo al generar consultas SQL. Realizan mediciones en Spider y demuestran que los éxitos no siempre se trasladan a otros benchmarks, y que la autonomía aporta robustez, pero requiere recursos computacionales considerables.








