De l'article au dépôt : où la chaîne se rompt
Une publication scientifique n'est pas une notice de montage. Même un texte détaillé avec formules et graphiques ne contient pas tout ce qu'il faut pour exécuter le code et obtenir les mêmes chiffres. C'est précisément ce fossé qu'explore un travail intitulé ReproAgent: Contract-Guided Paper-to-Code Reproduction — il formalise la tâche de reproduction paper-to-code : un agent IA scientifique doit transformer un article en un dépôt exécutable, où sont préservés la méthode, le protocole expérimental et les artefacts.
La raison de cette difficulté, selon les auteurs, ne réside pas dans la « faiblesse » des modèles, mais dans la fragmentation de la spécification. La partie explicite — algorithmes, métriques, composition des artefacts — est présente dans l'article, mais sur les longues trajectoires de l'agent, ces détails se perdent progressivement, se diluent hors du contexte de travail. La partie implicite — les valeurs par défaut des frameworks, les conventions héritées de travaux connexes — n'est pas mentionnée du tout dans le texte : pour les auteurs de l'article, elle est si évidente qu'elle ne nécessite pas de mots. De tels détails ne peuvent être reconstitués « par déduction générale », et sans eux, le code soit ne s'exécute pas, soit donne d'autres résultats.
Données formelles du preprint : arXiv:2608.24291, catégorie principale — cs.AI, cs.SE indiquée en supplément ; soumis le 25 août 2026. Auteurs — Xue Hu, Zewei Pan, Zhongyuan Wang, Zhou Liu, Zeli Su et Wentao Zhang, expéditeur — Xue Hu. Travail accepté dans Findings of EMNLP 2026, DOI: 10.48550/arXiv.2608.24291.

Le contrat d'implémentation comme ancrage pour l'agent
L'idée principale de ReproAgent n'est pas de laisser l'agent « simplement lire l'article et écrire du code ». À la place, on construit un contrat d'implémentation (implementation contract) permanent — un artefact qui vit tout au long du travail et survit aux longues trajectoires, contrairement au texte source dans le contexte.
Le contrat est alimenté par deux canaux indépendants :
- le canal des exigences (implementation-requirement) — transforme les fragments de l'article en obligations concrètes vis-à-vis du code : ce qui doit précisément être implémenté, quelles métriques calculer, quelles données charger ;
- le canal des preuves (reference-evidence) — extrait des indices de contenu et de structure à partir des dépôts liés, c'est-à-dire récupère ces fameuses conventions implicites absentes du texte.
Ensuite, les deux flux convergent : ils sont rattachés à des work packages — des lots de travaux — puis projetés dans des contrats au niveau de chaque fichier. Cette projection est importante, car c'est précisément au niveau des fichiers que l'agent doit agir, et c'est là que se perd habituellement le lien entre « l'intention de l'article » et « la ligne de code ».
Le sens de cette construction est que l'obligation est première et la génération secondaire. L'agent ne cherche pas à se rappeler le détail nécessaire au moment d'écrire le code — il se réfère à une exigence déjà consignée.

Quatre étapes et le rôle de la réparation
Le travail est décrit comme un pipeline de quatre étapes successives qui forment l'acronyme Prepare — Plan — Generate — Repair.
- Prepare — préparation : analyse de l'article et des matériaux liés, premier remplissage du contrat.
- Plan — planification : découpage de la tâche en lots de travaux et rattachement des obligations et des preuves à ceux-ci.
- Generate — génération du code selon les contrats au niveau des fichiers.
- Repair — réparation : le contrat est réutilisé pour comprendre ce qui précisément s'écarte de l'exigence, plutôt que de rafistoler les erreurs au hasard.
Notez l'asymétrie : le contrat est nécessaire non seulement à l'entrée, mais aussi tout à la fin — lors de la correction des erreurs. C'est sans doute la partie la plus pratique de l'idée. La plupart des pipelines agentiques sont solides au stade de l'écriture et faibles au stade du débogage, parce qu'au moment de la première erreur, la spécification initiale est déjà floue. Ici, elle reste à portée de main.
Vérification : PaperBench Code-Dev
Les auteurs ont testé l'approche sur PaperBench Code-Dev — un benchmark où l'agent doit reproduire du code à partir d'articles scientifiques. Résultat : le meilleur score moyen parmi les scaffolds avec le même backbone. Il est important que l'effet s'observe avec deux modèles de base différents — Claude Sonnet 4.5 et Gemini 3 Flash.
Ce que signifient ces termes. Backbone — le modèle de base, le « cerveau » de l'agent. Scaffold — l'enveloppe autour de celui-ci : règles, mémoire, ordre des étapes, outils. La comparaison à backbone identique est la manière correcte de montrer que le gain provient bien de l'architecture, et non d'un modèle plus puissant. ReproAgent est précisément une contribution à la classe des scaffolds.
En outre, les auteurs ont réalisé des ablations par canal : si l'on désactive le canal des exigences ou le canal des preuves, la qualité end-to-end chute. S'y ajoutent des analyses d'articles individuels, où l'on voit quelle contribution apporte chaque canal sur des exemples concrets. Ce double contrôle — mesure globale plus analyse qualitative — rend les conclusions plus convaincantes qu'un seul chiffre dans un tableau.
Le code et les artefacts expérimentaux, selon les auteurs, sont en accès libre.

Ce que cela change en pratique
La valeur du travail ne réside pas seulement dans le résultat au benchmark, mais dans la formulation même du problème. La « fragmentation de la spécification » est une heureuse explication de pourquoi les agents écrivent avec assurance du code qui semble correct mais ne reproduit pas les résultats. Les détails explicites se perdent à mesure que la trajectoire s'allonge, les implicites sont absents dès le départ.
Le contrat d'implémentation propose un contournement : sortir les obligations du contexte fragile pour les placer dans un objet distinct et stable, et s'y référer à toutes les étapes, y compris le débogage. Ce procédé semble transférable — des « exigences consignées » similaires peuvent être utiles dans d'autres tâches où l'agent doit maintenir longtemps les conditions initiales : migrations, reproduction d'infrastructure, longues tâches d'ingénierie.
Les limites sont également claires d'après la logique de la méthode : la qualité du contrat dépend directement de la qualité de l'extraction des exigences et de la pertinence des dépôts liés trouvés. Si aucun code public n'existe sur le sujet, le canal des preuves travaille à l'aveugle. Mais au moins une thèse des auteurs sonne déjà convaincante : la reproductibilité d'un travail scientifique est une question de spécification, et non de vitesse de génération de code.



