Los textos escritos por los modelos lingüísticos son cada vez más difíciles de distinguir entre los escritos humanos. Para mantener la transparencia, los desarrolladores están implementando marcadores ocultos. Un proyecto de este tipo es en Antrópico: versiones futuras Claude recibirá una marca de agua integrada que permitirá verificar el origen del texto.
Por qué se necesita un marcador invisible
La marca de agua de Claude está diseñado para proporcionar una estimación estadística — cuán probable es que un texto dado fue creado por este modelo en particular. El ímpetu era la regulación: desde el 2 de agosto, los proveedores de IA tienen la obligación de etiquetar el contenido sintético. Un marcador incorporado es una manera de cumplir esta obligación.
Importantemente, la marca es completamente invisible para el lector. Según la empresa, no afecta a la calidad de respuestas, su creatividad o legibilidad. El texto no recibe adiciones visibles, caracteres ocultos o fichas extras, por lo que no requiere costes computacionales adicionales. El marcador también no contiene datos personales: no se puede utilizar para asociar texto con un usuario específico, organización o chat individual.

La tecnología: cómo funciona
El principio se basa en cómo funcionan los modelos de idioma. El modelo genera texto una palabra a la vez, eligiendo la opción más probable. En algunos casos, la elección no tiene casi ningún impacto en el significado, por ejemplo, cuando los sinónimos o variaciones estilísticas menores son aceptables. Estos puntos de "bajo consumo" son los que llevan la marca de agua.
En modo normal, el modelo se basa en su propia fuente de aleatoriedad. La marca de agua lo reemplaza: la elección de la siguiente palabra está determinada por una clave y varias palabras anteriores. Esto crea un patrón en la respuesta que es invisible para los seres humanos pero verificable cuando la clave está disponible — midiendo lo consistente que es la secuencia con la clave, se puede estimar la probabilidad de que el texto fue generado por el modelo.
Importantemente, el marcador no obliga al modelo a elegir palabras antinaturales o sinónimos raros como "nubilosos". El vocabulario permanece dentro del rango habitual; sólo la lógica de elección en puntos estrechos cambia.

El método utilizado por Claude es una adaptación del enfoque SinthID-Text de Google DeepMind, publicado en Nature en 2024. La idea se remonta a una propuesta de 2022 de Scott Aaronson: cambiar sólo la fuente de aleatoriedad, sin interferir con el resto del comportamiento del modelo.
Verificación y limitaciones
La marca de agua no es prueba absoluta de la autoría. Sólo puede proporcionar una estimación probabilística —cuán consistente es el texto con una clave conocida. Es imposible confirmar definitivamente que un texto fue generado por un modelo u otro, y esto es importante tener en cuenta en la práctica.
Lo que necesitas saber
- El marcador no ofrece una garantía del 100%, sólo confianza estadística.
- No contiene información que pueda utilizarse para rastrear a una persona u organización.
- El mecanismo es no único Claude - otros desarrolladores principales están implementando sus propias marcas de agua.
Los ensayos internos de Antrópico no encontraron degradación en la calidad sustantiva de las respuestas. La investigación de Google DeepMind tampoco mostró diferencias estadísticamente significativas en las calificaciones de los usuarios: la gente no vio diferencia entre textos con y sin el marcador. Por lo tanto, las marcas de agua siguen siendo un compromiso entre la transparencia y la naturalidad — permiten la verificación automatizada del origen del contenido sin obstaculizar el funcionamiento del modelo o exponer los datos del usuario.



