Anthropic a annoncé que tous les textes générés par son modèle phare Claude recevra bientôt un filigrane invisible. Cela est fait pour se conformer aux exigences réglementaires à venir. La société a également communiqué des détails techniques pour la première fois : auparavant, il était seulement connu que le filigrane ne modifie pas le contenu et n'ajoute pas de caractères cachés au texte.
Comment fonctionne le filigrane
La méthode est basée sur SynthID-Text, une technologie développée par Google DeepMind et publiée dans Nature en 2024. L'idée elle-même a été proposée par Scott Aaronson en 2022. Pendant la génération normale, le modèle choisit le mot suivant en utilisant un nombre aléatoire. Dans la version filigrane, le hasard est remplacé par une fonction déterministe : il utilise une clé secrète et plusieurs mots précédents. Par conséquent, la séquence des mots semble aléatoire, mais porte un motif qui peut être vérifié.
À chaque étape, tous les mots des candidats sont divisés en Vert et Voir la note de bas de page listes. Le modèle choisit dans la liste verte un peu plus souvent, mais les mots rouges ne sont pas interdits — ils sont tout simplement moins probables. La composition des listes dépend du contexte et de la clé, de sorte qu'il n'y a pas un ensemble fixe de mots qui pourraient être mémorisés. Quiconque détient la clé peut à tout moment déterminer quelle liste un mot particulier est tombé dans une position particulière. Sans la clé, c'est impossible.

Pour comprendre l'idée, imaginez un jeu de Monopoly où les dés sont remplacés par un livre de chiffres de pi. Pour un observateur extérieur, le rouleau semble aléatoire, mais un joueur avec ce livre connaît tous les chiffres à l'avance. De même, le filigrane ne modifie pas les règles de génération; il ne change que la source du hasard.
En substance, c'est une forme de stéganographie: l'information est cachée dans le choix des mots eux-mêmes, pas dans les étiquettes explicites. Le filigrane n'ajoute aucun jeton au texte et n'augmente pas les coûts de production. Les lecteurs ne peuvent pas distinguer le texte filigrané du texte ordinaire, ni visuellement ni auriculairement.
Comment cela affecte la qualité
Anthropique a effectué des tests internes et n'a trouvé aucun impact négatif sur le contenu, la créativité ou la lisibilité. Des résultats similaires ont été obtenus dans des expériences de Google DeepMind avec le modèle Gemini : les cotes des utilisateurs (comme et aversions) n'ont montré aucune différence statistiquement significative entre les réponses filigranes et les réponses ordinaires. Dans une étude contrôlée, les experts qui comparent des textes côte à côte n'ont pas vu de différence.

Le filigrane ne contient aucune information d'identification : il ne peut révéler qui a interagi avec le modèle, dans quel chat, ou quand. Tout au plus, il permet de calculer la probabilité que le texte ait été généré par ce modèle particulier. Pour les phrases courtes (moins de quelques dizaines de mots), la précision de détection tombe à zéro: le texte doit être suffisamment long pour que le schéma statistique devienne visible.
Notamment, le modèle n'est jamais forcé de choisir des mots rares ou contre nature. Les listes verte et rouge contiennent les mêmes mots que le modèle considère en mode normal, de sorte que le texte reste naturel.
Quoi de neuf?
Le déploiement du filigrane s'inscrit dans une tendance plus large. À compter d'août, les organismes de réglementation exigeront de tous les fournisseurs de services d'IA qu'ils étiquettent le contenu créé par leurs modèles. L'anthropie n'est pas la seule: d'autres grandes entreprises ont signé des engagements similaires sont déjà en train de travailler sur leurs propres systèmes de filigrane. L'étiquetage invisible devient ainsi une norme de l'industrie, pas une caractéristique unique de Claude.
Certes, la technologie a des limites : l'utilisation de la clé secrète ne donne qu'une estimation probabiliste de l'origine d'un texte, pas une certitude absolue. Néanmoins, cela suffit pour les régulateurs et offre aux utilisateurs une couche supplémentaire de transparence.
Conclusion : le texte de Claudes est un compromis entre transparence, réglementation et commodité. Il n'a pratiquement aucun impact sur la qualité de génération et permet de vérifier l'origine du texte sans compromettre la vie privée des utilisateurs.



