Aliments pour animaux

12 matériaux

Trier par
Nouvelles6 septembre 2026

Quand un juge est partial : les agents auto-apprenants cessent d'éliminer les compétences inutiles

Une nouvelle étude montre qu'un juge LLM biaisé casse silencieusement le mécanisme d'élimination des compétences défaillantes : lorsque la proportion de faux succès dépasse 0,45, le système cesse de nettoyer la bibliothèque de compétences, et cela reste invisible dans les métriques agrégées. Les auteurs proposent un audit peu coûteux par injection de défauts pour vérifier le juge avant le déploiement.

Quand un juge est partial : les agents auto-apprenants cessent d'éliminer les compétences inutiles
Lire
Nouvelles5 septembre 2026

Pourquoi l'approche GPT bute sur la musique symbolique : la compression ne fonctionne que dans le bon système de coordonnées

Le succès des modèles de langage ne tient pas seulement à la réutilisation des tokens, mais aussi à la manière dont la compression est structurée. Pour la musique, tenter de fixer à l'avance les relations, par exemple via le cycle des quintes, dégrade les prédictions — l'important est de laisser le contexte au modèle et de bien définir le temps.

Pourquoi l'approche GPT bute sur la musique symbolique : la compression ne fonctionne que dans le bon système de coordonnées
Lire
Nouvelles2 septembre 2026

Apprendre sans superflu : comment distinguer les signes stables et trompeurs lors du réglage des prompts dans les modèles vision-langage

Les auteurs ont montré que l'ajustement contradictoire classique des invites force le modèle à s'accrocher à des caractéristiques pseudo-stables et à perdre en précision sur de nouvelles classes. La nouvelle méthode ADAPT avec des invites leurres résout ce problème en séparant les caractéristiques utiles des raccourcis généralisables.

Apprendre sans superflu : comment distinguer les signes stables et trompeurs lors du réglage des prompts dans les modèles vision-langage
Lire
Nouvelles29 août 2026

Pourquoi les évaluations de préférences des LLM ne peuvent pas être considérées comme fiables : un test à grande échelle révèle des contradictions

Les auteurs ont testé six modèles linguistiques sur des questions concernant les vols, les appartements et les hôtels, et ont constaté que les réponses numériques sur la disposition à payer se contredisent systématiquement. De ce fait, ces estimations ne peuvent pas être décrites par une seule fonction d'utilité — ce qui signifie qu'il est risqué de s'y fier pour prendre des décisions.

Pourquoi les évaluations de préférences des LLM ne peuvent pas être considérées comme fiables : un test à grande échelle révèle des contradictions
Lire