Empreinte invisible : comment Claude filigrane ses textes

21 août 202611 vues

Un mécanisme intégré dans les nouveaux modèles Claude permettra de distinguer le texte généré par l'IA avec une forte probabilité. Le filigrane ne dégrade pas la qualité de la réponse, n'ajoute pas de caractères cachés et n'expose pas les données utilisateur.

Empreinte invisible : comment Claude filigrane ses textes

Les textes écrits par des modèles linguistiques sont de plus en plus difficiles à distinguer des textes écrits par des humains. Pour maintenir la transparence, les développeurs implémentent des marqueurs cachés. L'un de ces projets est celui d'Anthropic : Claude recevra un filigrane intégré qui permettra de vérifier l'origine du texte.

Pourquoi un marqueur invisible est nécessaire

Le filigrane de Claude est conçu pour fournir une estimation statistique — il est probable qu'un texte donné ait été créé par ce modèle particulier. L'impulsion a été la réglementation: depuis le 2 août, les fournisseurs d'IA sont tenus d'étiqueter le contenu synthétique. Un marqueur intégré est une façon de remplir cette obligation.

Fait important, le marquage est complètement invisible pour le lecteur. Selon la société, il n'affecte pas la qualité des réponses, de leur créativité ou de leur lisibilité. Le texte ne reçoit pas d'ajouts visibles, de caractères cachés ou de jetons supplémentaires — et n'exige donc aucun coût supplémentaire de calcul. Le marqueur ne contient pas non plus de données personnelles : il ne peut être utilisé pour associer du texte à un utilisateur, une organisation ou un chat particulier.

La technologie : comment elle fonctionne

Le principe est basé sur le fonctionnement des modèles linguistiques. Le modèle génère du texte un mot à la fois, en choisissant l'option la plus probable. Dans certains cas, le choix n'a presque aucune incidence sur le sens, par exemple lorsque des synonymes ou des variations stylistiques mineures sont acceptables. Ces « points faibles » sont ce qui porte le filigrane.

En mode normal, le modèle repose sur sa propre source de hasard. Le filigrane le remplace : le choix du mot suivant est déterminé par une clé et plusieurs mots précédents. Cela crée un modèle dans la réponse qui est invisible pour les humains mais vérifiable quand la clé est disponible — en mesurant la cohérence de la séquence avec la clé, on peut estimer la probabilité que le texte a été généré par le modèle.

Fait important, le marquage ne force pas le modèle à choisir des mots contre nature ou des synonymes rares comme « nubilous ». Le vocabulaire reste dans la plage habituelle; seule la logique de choix dans les points étroits change.

La méthode utilisée par Claude est une adaptation de l'approche SynthID-Text de Google DeepMind, publiée dans Nature en 2024. L'idée elle-même remonte à une proposition de Scott Aaronson en 2022 : ne changer que la source du hasard, sans interférer avec le reste du comportement du modèle.

Vérification et limitations

Le filigrane n'est pas une preuve absolue de la paternité. Il ne peut fournir qu'une estimation probabiliste — la cohérence du texte avec une clé connue. Il est impossible de confirmer définitivement qu'un texte a été généré par un modèle ou un autre, et il est important de garder à l'esprit dans la pratique.

Ce que vous devez savoir

  • Le marqueur n'offre pas de garantie à 100%, seulement la confiance statistique.
  • Il ne contient aucune information pouvant être utilisée pour suivre une personne ou une organisation.
  • Le mécanisme est pas unique à Claude — d'autres grands promoteurs mettent en œuvre leurs propres filigranes.

Les tests internes d'Anthropic n'ont révélé aucune dégradation de la qualité substantielle des réponses. La recherche de Google DeepMind n'a pas non plus montré de différences statistiquement significatives dans les cotes des utilisateurs : les gens n'ont pas vu de différence entre les textes avec et sans le marqueur. Ainsi, les filigranes restent un compromis entre transparence et naturel, ils permettent une vérification automatisée de l'origine du contenu sans entraver le fonctionnement du modèle ni exposer les données des utilisateurs.

Foire aux questions

Signe aqueux : Comment Anthropic tags AI textes