Qué controla exactamente RobustSGPO
RobustSGPO amplía SGPO —optimización de prompts basada en gradientes semánticos— mediante el uso de retroalimentación de la ejecución. La regla local de SGPO no especifica la escala de edición ni la operación concreta.
El control abarca la solicitud de edición, la verificación del parche generado y la elección del punto de partida para el siguiente paso. Esto separa el control de la búsqueda de variantes de la propia señal de retroalimentación.
Criterio práctico: este enfoque es adecuado para ajustes en los que es importante especificar la operación de edición y verificar los parches, y no solo obtener retroalimentación.
Cómo funciona la búsqueda de variantes
El proceso consta de tres acciones:
- Especificar la edición solicitada.
- Crear un parche y verificarlo.
- Continuar la búsqueda desde la mejor variante actual o desde las instantáneas guardadas.

| Punto de partida | Desde dónde continúa la búsqueda |
|---|---|
| Mejor variante actual, incumbent | Desde la mejor variante del momento |
| Instantáneas guardadas, retained snapshots | Desde las versiones guardadas |
La elección determina desde qué versión continuará la búsqueda. El criterio es si se necesita la mejor versión actual o puntos de partida alternativos guardados.
Cómo planifican la resolución de edición
En el estudio se comparó una planificación periódica $1\to2\to3$ con una resolución máxima fija. La planificación periódica superó a la fija por 0,28 puntos en la puntuación de prueba.
Los autores evaluaron la planificación de las resoluciones, las restricciones acumulativas y la transferencia entre familias de tareas. El resultado corresponde a estas evaluaciones y no establece una ventaja universal de la planificación.
El criterio de comparación es la puntuación de prueba con la planificación elegida. En el estudio presentado, el cambio periódico de resolución obtuvo mejores resultados.
Qué mostró la evaluación de calidad
En el flujo de trabajo de brainstorming de AgentX se realizaron 95 ejecuciones en 120 tareas y se obtuvieron 7 350 intentos de candidatos.
En 30 tareas reservadas, la tasa de finalización pasó del 60,0 % al 80,0 %. La calidad de prueba subió de 3,77 a 4,14 con un presupuesto de 20 millones de tokens.
Estas métricas describen los resultados de una evaluación concreta. Al comparar sistemas, es importante tener en cuenta sus tareas y su presupuesto, en lugar de extrapolar las cifras a otras condiciones.
Cómo elegir una estrategia para conservar variantes
Conservar variantes genera costes medibles. Al mismo tiempo, controlar el espacio de búsqueda mejora la calidad mediante ediciones ejecutables y puntos de partida alternativos.
| Estrategia | Resultado tras el cambio de tareas |
|---|---|
| Conservación por categorías | Reduce el deterioro en las tareas originales |
| Conservación aleatoria | Ofrece un resultado más alto en el conjunto objetivo |
La elección depende de la prioridad: mantener el rendimiento en las tareas originales u obtener un resultado más alto en el conjunto objetivo. Los costes de conservar variantes siguen formando parte de la evaluación.



