Ce que contrôle exactement RobustSGPO
RobustSGPO prolonge SGPO — l’optimisation des prompts basée sur le gradient sémantique — en utilisant les retours d’exécution. La règle locale de SGPO ne définit ni l’ampleur de la modification ni l’opération précise.
Le contrôle porte sur la demande de modification, la vérification du patch généré et le choix du point de départ pour l’étape suivante. Cela distingue le pilotage de la recherche de variantes du signal de retour lui-même.
Critère pratique : cette approche convient aux réglages où il est important de définir l’opération de modification et de vérifier les patchs, et pas seulement d’obtenir des retours.
Comment fonctionne la recherche de variantes
Le processus comprend trois actions :
- Définir la modification demandée.
- Créer un patch et le vérifier.
- Poursuivre la recherche à partir de la meilleure variante actuelle ou des instantanés conservés.

| Point de départ | D’où la recherche se poursuit |
|---|---|
| Meilleure variante actuelle, incumbent | À partir de la meilleure variante du moment |
| Instantanés conservés, retained snapshots | À partir des versions conservées |
Le choix détermine à partir de quelle version la recherche se poursuivra. Le critère est de savoir si l’on a besoin de la meilleure version actuelle ou d’autres points de départ conservés.
Comment planifier la résolution des modifications
L’étude a comparé un calendrier périodique $1\to2\to3$ à une résolution maximale fixe. Le calendrier périodique a obtenu un score de test supérieur de 0,28 point à celui de la résolution fixe.
Les auteurs ont évalué la planification des résolutions, les contraintes cumulatives et le transfert entre familles de tâches. Le résultat concerne ces évaluations et n’établit pas de supériorité universelle du calendrier.
Le critère de comparaison est le score de test obtenu avec le calendrier choisi. Dans l’étude présentée, la variation périodique de la résolution a donné de meilleurs résultats.
Ce que montre l’évaluation de la qualité
Dans le flux de travail AgentX brainstorming, 95 exécutions ont été menées sur 120 tâches, pour un total de 7 350 tentatives de candidats.
Sur 30 tâches mises de côté, le taux de complétion est passé de 60,0 % à 80,0 %. La qualité de test est passée de 3,77 à 4,14 avec un budget de 20 millions de tokens.
Ces indicateurs décrivent les résultats d’une évaluation spécifique. Pour comparer des systèmes, il est important de tenir compte de ses tâches et de son budget, plutôt que de transposer les chiffres à d’autres conditions.
Comment choisir une stratégie de conservation des variantes
La conservation des variantes entraîne des coûts supplémentaires mesurables. En parallèle, le contrôle de l’espace de recherche améliore la qualité grâce aux modifications exécutables et aux autres points de départ.
| Stratégie | Résultat après le déplacement des tâches |
|---|---|
| Conservation par catégorie | Réduit la dégradation sur les tâches d’origine |
| Conservation aléatoire | Donne un meilleur résultat sur l’ensemble cible |
Le choix dépend de la priorité : maintenir les résultats sur les tâches d’origine ou obtenir de meilleurs résultats sur l’ensemble cible. Les coûts de conservation des variantes restent, quant à eux, un élément de l’évaluation.



