SQL agêntico sem ilusões: uma escala única de autonomia e uma comparação honesta dos benchmarks de LLM
Os pesquisadores propõem considerar a área de Text-to-SQL como um leaderboard consolidado, onde os resultados são distribuídos de acordo com o grau de autonomia do modelo na geração de consultas SQL. Eles realizam medições no Spider e mostram que os sucessos nem sempre se transferem para outros benchmarks, e que a autonomia proporciona robustez, mas exige recursos computacionais significativos.








