149 corrections issues de vrais laboratoires : un nouveau benchmark vérifie si les LLM savent réécrire des protocoles

15 septembre 202614 vues

BenchBench-Protocol ne propose pas aux modèles des questions abstraites, mais des épisodes reconstitués issus de la pratique : un chercheur a adapté une méthodologie publiée à son expérience — et le modèle doit reproduire le fil de sa pensée. Sur les neuf systèmes testés, le meilleur résultat atteint 59,2 % selon la grille d'évaluation, tandis que les autres se situent dans une fourchette de 34 à 47 %.

149 corrections issues de vrais laboratoires : un nouveau benchmark vérifie si les LLM savent réécrire des protocoles

Le protocole que personne ne suit à la lettre

Un protocole de laboratoire est rarement suivi à la lettre. Entre la publication et l'expérience réelle, il y a presque toujours une adaptation : une autre lignée cellulaire, un réactif remplacé, moins d'échantillons, un appareil emprunté, un budget réduit. Pour une personne à la paillasse, c'est de la routine, mais une routine perfide — chaque modification entraîne une chaîne de conséquences. On change le volume d'un réactif à une étape précoce, et il faut se rappeler ce que cela impliquera à l'étape de lavage et comment cela s'accorde avec ce qui a déjà été fait auparavant. C'est précisément cette capacité — garder en tête l'intégralité du protocole et le modifier de manière réfléchie — que met à l'épreuve ce nouvel ensemble de tâches.

L'étude a été publiée sous le nom BenchBench-Protocol dans un préprint arXiv:2608.23898v1 (cs.AI), soumis le 24 août 2026. Les auteurs sont Aditya Sivakumar, Ashu Singhal, Nicholas Larus-Stone et Nithin Parsan. Cela fait 21 pages et 15 figures, soit un matériel plutôt méthodologique que promotionnel.

Comment 149 tâches ont été assemblées à partir de brouillons de modifications

La mécanique de BenchBench-Protocol est inhabituelle. Les auteurs ne se sont pas assis pour écrire des questions — ils ont pris une trace de travail déjà existante. Chaque protocole publié avait une version que le scientifique avait modifiée pour son expérience spécifique. La différence entre ces deux documents est devenue la tâche : on montre à la modèle le protocole initial et les conditions de la nouvelle expérience, et il doit proposer une modification correcte.

De cette approche découle immédiatement un détail important : la tâche n'a pas de « bonne réponse » abstraite, mais une grille d'évaluation pondérée. Car la modification apportée par un chercheur réel est connue — on peut la décomposer en éléments et évaluer dans quelle mesure la proposition du modèle correspond à la solution réelle par le sens, et non par la formulation. Cela élimine le problème éternel des tests biomédicaux, où le modèle peut donner une réponse raisonnable mais non conforme à la référence et obtenir zéro.

La base obtenue est solide : 96 protocoles initiaux issus de neuf domaines de biologie expérimentale en laboratoire humide. Seules les tâches ayant passé une vérification par des experts avec des notes élevées ont été retenues dans l'ensemble final — le reste a été écarté. Le résultat, ce sont ces fameuses 149 tâches.

Pourquoi ce n'est pas un énième ensemble de questions d'experts

Les auteurs explicitent le contexte. Ces dernières années, les benchmarks biomédicaux se sont effectivement déplacés vers des tâches ouvertes avec évaluation par grille — c'est un progrès. Mais les tâches elles-mêmes sont encore le plus souvent inventées par des experts : ils s'assoient et écrivent des questions à partir de leur expérience. Cette approche est limitée par le fait que l'expert répond à une question qu'il a lui-même formulée, c'est-à-dire qu'il s'ajuste implicitement à sa propre représentation de la difficulté.

Ici, la logique est inverse. La tâche naît là où une personne réelle s'est déjà heurtée à un problème réel et a passé du temps à le résoudre. Cela ne garantit pas une pureté parfaite des données, mais garantit que la tâche n'a pas été inventée pour une belle formulation.

Qui s'en est sorti, et qui non

Neuf modèles ont participé aux tests — fermés comme ouverts. La dispersion s'est révélée notable, sans être dramatique.

Le meilleur résultat a été obtenu par Claude Opus 5 — 59,2 % du score normalisé selon la grille. Les autres modèles se sont situés dans une fourchette de 34,1 % à 47,1 %. Autrement dit, personne n'a atteint le leader, mais il n'y a pas non plus d'effondrement d'un facteur un et demi : tous les modèles savent faire quelque chose, simplement ils le font différemment et pas toujours jusqu'au bout.

Une ligne distincte du rapport — le test de saturation. Les auteurs ont donné aux modèles dix tentatives et ont choisi la meilleure (best-of-10). Même avec ce schéma généreux, le benchmark ne s'est pas « effondré » : le plafond n'est pas atteint. Pour l'évaluation, c'est une bonne nouvelle — cela signifie que l'ensemble de tâches ne deviendra pas obsolète après la sortie de la prochaine génération de modèles.

Ce qu'il en découle en pratique

La première conclusion est appliquée et légèrement dégrisante. On ne peut pas encore confier entièrement à un modèle de langage l'adaptation d'un protocole. Même le meilleur résultat de 59,2 % signifie que dans environ quatre cas sur dix, la proposition nécessite l'intervention d'un humain. Le modèle convient comme brouillon, comme générateur de variantes, comme moyen de vérifier rapidement ce que l'on a peut-être oublié. Mais il ne porte pas la responsabilité finale de l'éprouvette.

La deuxième conclusion est méthodologique, et elle est plus intéressante que la première. Les auteurs considèrent leur travail non seulement comme une évaluation du raisonnement en laboratoire humide, mais aussi comme la preuve d'une idée plus générale : les expériences réelles sont une source sous-estimée de tâches pour les benchmarks. Si un laboratoire dispose déjà d'un historique de modifications, alors il y a aussi de la matière pour tester les modèles — et une matière qu'il est impossible d'inventer à son bureau.

La troisième conclusion concerne la suite à donner. L'écart entre 59,2 % et 47,1 % ne ressemble pas à un gouffre au regard de la complexité de la tâche elle-même. C'est plutôt un indice que le goulot d'étranglement n'est pas dans le volume de connaissances du modèle en biologie, mais dans sa capacité à construire une chaîne : tenir compte des décisions précédentes et prédire ce qu'elles entraîneront aux étapes suivantes. C'est précisément à cette qualité, et non à la mémorisation de faits, qu'est consacré l'ensemble de 149 modifications.

Foire aux questions

Matériaux connexes

Tous matériaux
149 corrections issues de vrais laboratoires : un nouveau benchmark vérifie si les LLM savent réécrire des protocoles