Les programmeurs ont rapidement trouvé des moyens de retirer le marquage caché de Claude

1 septembre 20269 vues

L'annonce par Anthropic de l'introduction de marqueurs invisibles pour les textes d'IA a provoqué une réaction immédiate de la communauté : dès les premières heures, des outils sont apparus pour réécrire les réponses du modèle afin que les détecteurs ne puissent pas reconnaître le marquage. Les développeurs débattent de la nécessité d'une telle protection et proposent différentes solutions de contournement.

Les programmeurs ont rapidement trouvé des moyens de retirer le marquage caché de Claude

Anthropic a annoncé l'intégration de filigranes invisibles dans les réponses de Claude la semaine dernière. L'entreprise l'a justifié par les exigences de la loi européenne sur l'IA : très bientôt, tout contenu synthétique provenant de grands modèles devra être marqué de manière lisible par machine. Cependant, les programmeurs ne se sont pas fait attendre — les premières solutions de contournement sont apparues le jour même.

Qu'est-ce que le marquage invisible et pourquoi est-il difficile à repérer

Le filigrane dans un texte n'est ni une image ni un caractère caché. Anthropic utilise la technique SynthID, développée par Google. Le modèle choisit les mots et les phrases de telle sorte que l'humain lit le texte normalement, mais qu'un algorithme spécial peut déterminer qu'il a été rédigé par un réseau de neurones. Le sens et la qualité des réponses n'en souffrent pas.

En substance, le marquage est intégré à la structure même du texte. Le supprimer manuellement est impossible — il faut modifier les formulations, l'ordre des phrases ou tout le style.

Comment les programmeurs retirent le marquage

L'exemple le plus retentissant est le code de Guillaume Meyer. Il est apparu sur GitHub quatre heures après l'annonce d'Anthropic et s'est rapidement répandu : plus de 20 000 favoris sur X, plus d'une centaine de contributeurs. L'idée est de faire passer le texte de Claude par un autre modèle de langage sans filigrane. Ce modèle réécrit le texte, remplaçant les mots par des synonymes et modifiant la structure — après cela, le motif d'origine est détruit.

D'autres développeurs utilisent des techniques similaires :

  • Eric Hughes a assemblé en 15 minutes un utilitaire basé sur Claude qui supprime les caractères invisibles, réorganise les phrases et substitue des synonymes.
  • Leon Hlon a proposé de compresser la réponse, de la traduire dans l'un des dialectes de l'arabe puis de la retraduire — ce « ping-pong de traduction » brouille également le marquage.

Ces méthodes fonctionnent parce que le filigrane réside dans le choix précis des mots. Toute réécriture substantielle détruit le motif.

Pourquoi contourner et ce qui empêche de considérer cela comme une infraction

Les motivations des développeurs sont variées. Certains sont fondamentalement en désaccord avec l'idée que chaque texte généré doive porter une étiquette cachée. D'autres veulent simplement tester leurs propres compétences. Quant aux freelances et aux créateurs de contenu, ils s'adressent directement aux auteurs de solutions de contournement — ils ne veulent pas de contraintes supplémentaires dans leur travail sur les brouillons. Par ailleurs, juridiquement, les outils indépendants échappent au champ des interdictions : les nouvelles règles européennes menacent d'amendes allant jusqu'à 3 % du chiffre d'affaires les fournisseurs qui vendent des moyens de contournement, mais ne limitent pas les passionnés.

Wayne Pan, de la société Haimaker, estime qu'aucune méthode ne peut être entièrement fiable tant que le détecteur officiel d'Anthropic n'est pas publié. Il a néanmoins intégré l'outil de Meyer dans sa plateforme, en s'appuyant sur sa compréhension du fonctionnement de SynthID. Meyer lui-même souligne que les filigranes sont une mauvaise solution en raison du risque de faux positifs et de l'impossibilité de distinguer une légère édition assistée par IA d'un texte entièrement généré. Il admet utiliser régulièrement Claude et Grammarly pour traiter ses propres textes.

Ce que dit Anthropic et à quoi s'attendre ensuite

Les représentants de l'entreprise confirment : le marquage n'affecte ni le sens ni la lisibilité, et n'est ajouté que pour se conformer à la loi européenne. Ils travaillent sur un service de détection et prévoient de publier une API afin que les développeurs puissent vérifier les textes. Anthropic reconnaît toutefois que le filigrane peut disparaître après une édition intensive, une reformulation ou une traduction. Le système de marquage continue de s'améliorer, on peut donc s'attendre à ce que les méthodes de contournement deviennent moins efficaces avec le temps.

En attendant, la situation ressemble à une course classique : Anthropic renforce le marquage, et la communauté des programmeurs répond par de nouvelles méthodes. Pour les utilisateurs, cela signifie une seule chose : masquer complètement l'utilisation de l'IA reste pour l'instant plus simple qu'il n'y paraît, mais les moyens de vérification officiels se développeront également.

Foire aux questions

Les programmeurs ont rapidement trouvé des moyens de retirer le marquage caché de Claude