Fita

60 materiais

Ordenação
Notícias11 setembro 2026

SQL agêntico sem ilusões: uma escala única de autonomia e uma comparação honesta dos benchmarks de LLM

Os pesquisadores propõem considerar a área de Text-to-SQL como um leaderboard consolidado, onde os resultados são distribuídos de acordo com o grau de autonomia do modelo na geração de consultas SQL. Eles realizam medições no Spider e mostram que os sucessos nem sempre se transferem para outros benchmarks, e que a autonomia proporciona robustez, mas exige recursos computacionais significativos.

SQL agêntico sem ilusões: uma escala única de autonomia e uma comparação honesta dos benchmarks de LLM
Ler
Notícias8 setembro 2026

Modelos de IA meteorológicos testados como climáticos: o que mostraram as simulações de longo prazo do ArchesWeather e do ArchesWeatherGen

Pesquisadores adaptaram duas redes neurais para experimentos atmosféricos de longo prazo, adicionando-lhes condições de contorno externas, e as executaram seguindo o protocolo AIMIP. Descobriu-se que os modelos, inicialmente projetados para previsões de até dez dias, produzem um ciclo anual estável e reproduzem de forma plausível a climatologia e a variabilidade em simulações de várias décadas.

Modelos de IA meteorológicos testados como climáticos: o que mostraram as simulações de longo prazo do ArchesWeather e do ArchesWeatherGen
Ler
Notícias3 setembro 2026

Jailbreak de caixa-preta: por que comparar ataques com igual número de consultas ao modelo

Os pesquisadores propuseram o protocolo Fair-ASR, que avalia ataques a LLMs com o mesmo orçamento de consultas ao modelo-alvo, considerando separadamente os custos do atacante. A revisão de 11 métodos conhecidos mostrou que sua classificação depende fortemente do orçamento, e padrões simples não ficam atrás de abordagens complexas baseadas em LLMs — isso levou os autores a criar o novo ataque ReCode.

Jailbreak de caixa-preta: por que comparar ataques com igual número de consultas ao modelo
Ler