Aliments pour animaux

39 matériaux

Trier par
Nouvelles11 septembre 2026

SQL agentique sans illusions : une échelle unique d’autonomie et une comparaison honnête des benchmarks LLM

Les chercheurs proposent d'envisager le domaine Text-to-SQL comme un classement consolidé, où les résultats sont répartis selon le degré d'autonomie du modèle lors de la génération de requêtes SQL. Ils effectuent des mesures sur Spider et montrent que les succès ne se transfèrent pas toujours à d'autres benchmarks, et que l'autonomie offre une certaine robustesse, mais exige des ressources de calcul considérables.

SQL agentique sans illusions : une échelle unique d’autonomie et une comparaison honnête des benchmarks LLM
Lire
Nouvelles10 septembre 2026

Nouveau benchmark GIM : test des LLM à l'intersection de différentes compétences cognitives

Les chercheurs ont proposé une approche qui évalue les modèles non pas selon le volume de connaissances ni en dehors de la réalité, mais à travers des tâches exigeant simultanément raisonnement, contrôle du contexte et travail avec des contraintes. Le benchmark comprend 820 tâches originales, et ses auteurs ont également étudié l'impact des réglages de « réflexion » et d'autres paramètres des modèles sur les résultats.

Nouveau benchmark GIM : test des LLM à l'intersection de différentes compétences cognitives
Lire
Nouvelles9 septembre 2026

Les filtres de sécurité des LLM échouent hors de l'anglais : comment les modèles renforcent les stéréotypes dans d'autres langues

Les chercheurs ont mis en évidence un sérieux déséquilibre interlinguistique dans la sécurité des grands modèles de langage : leur alignement est principalement réglé sur l'anglais, si bien que sur d'autres langues, les modèles contournent plus facilement les restrictions et reproduisent des préjugés nuisibles. Le nouveau benchmark INCLUDE, testé sur dix modèles et six langues indiennes, a montré que le niveau de partialité varie nettement selon la langue et le type de modèle.

Les filtres de sécurité des LLM échouent hors de l'anglais : comment les modèles renforcent les stéréotypes dans d'autres langues
Lire
Nouvelles9 septembre 2026

Hélices de drones sous contrôle : « l’âge artificiel » métamorphique aide à lire les journaux de vol

Les auteurs ont proposé un prototype de système d’aide à la décision qui analyse six indicateurs issus des journaux de vol et les convertit en un indice métamorphique de l’état des hélices. Dans une expérience rétrospective sur les données DronePropA, le système a correctement distingué un cas sain de trois niveaux de défaillance et a indiqué quand une inspection ou une maintenance était nécessaire.

Hélices de drones sous contrôle : « l’âge artificiel » métamorphique aide à lire les journaux de vol
Lire