Marca de agua invisible de los textos de Claude: Antrópico explica cómo funciona

17 agosto 202612 vistas

La nueva generación de modelos incorporará un patrón invisible en las respuestas, lo que permitirá evaluar lo probable que es la participación de AI en la creación de texto. Esto no afectará la calidad, la legibilidad o el costo de generación, pero ayudará a cumplir con los requisitos regulatorios.

Marca de agua invisible de los textos de Claude: Antrópico explica cómo funciona

Antrópico ha anunciado que todos los textos generados por su modelo insignia Claude pronto recibirá una marca de agua invisible. Esto se está haciendo para cumplir con los próximos requisitos reglamentarios. La compañía también ha revelado detalles técnicos por primera vez: anteriormente, sólo se sabía que la marca de agua no altera el contenido y no añade caracteres ocultos al texto.

Cómo funciona la marca de agua

El método se basa en SynthID-Text, una tecnología desarrollada por Google DeepMind y publicada en Nature en 2024. La idea misma fue propuesta por Scott Aaronson en 2022. Durante la generación normal, el modelo elige la siguiente palabra usando un número aleatorio. En la versión Watermarked, la aleatoriedad es reemplazada por una función determinista: utiliza una clave secreta y varias palabras anteriores. Como resultado, la secuencia de palabras parece aleatoria pero lleva un patrón que se puede verificar.

En cada paso, todas las palabras candidatas se dividen en “verde” y “rojo” listas. El modelo elige de la lista verde ligeramente más a menudo, pero las palabras rojas no están prohibidas — simplemente son menos probables. La composición de las listas depende del contexto y de la clave, por lo que no hay un conjunto fijo de palabras que puedan ser memorizadas. Cualquier persona que tenga la llave puede en cualquier momento determinar cuál lista de una palabra particular cayó en una posición particular. Sin la llave, esto es imposible.

Para entender la idea, imagine un juego de Monopoly donde los dados son reemplazados por un libro de dígitos de pi. Para un observador externo, el rollo parece aleatorio, pero un jugador con ese libro conoce todos los números por adelantado. Del mismo modo, la marca de agua no cambia las reglas de generación; sólo cambia la fuente del azar.

En esencia, esta es una forma de steganography: la información se oculta en la elección de las propias palabras, no en etiquetas explícitas. La marca de agua no añade ningún tokens al texto y no aumenta el costo de generación. Los lectores no pueden distinguir el texto marcado por el agua del texto ordinario ya sea visual o por el oído.

Cómo esto afecta la calidad

Antrópico realizó pruebas internas y no encontró ningún impacto negativo en el contenido, creatividad o legibilidad. Resultados similares se obtuvieron en Google DeepMind experimentos con el modelo Gemini: las calificaciones de los usuarios (como y disgustos) no mostraron diferencias estadísticamente significativas entre las respuestas acuáticas y ordinarias. En un estudio controlado, los expertos que comparan textos lado a lado tampoco vieron ninguna diferencia.

La marca de agua no contiene información de identificación: no puede revelar quién interactuó con el modelo, en qué chat, o cuándo. Como mucho, permite calcular la probabilidad de que el texto fue generado por este modelo en particular. Para frases cortas (bajo unas pocas docenas de palabras), la precisión de detección baja a cero: el texto necesita ser lo suficientemente largo para que el patrón estadístico sea notable.

Notablemente, el modelo nunca se ve obligado a elegir palabras raras o antinaturales. Las listas verdes y rojas contienen las mismas palabras que el modelo considera en modo normal, por lo que el texto sigue siendo natural.

¿Qué sigue?

El despliegue de la marcación de agua es parte de una tendencia más amplia. A partir de agosto, los reguladores exigirán a todos los proveedores de servicios de AI etiquetar el contenido creado por sus modelos. Antrópico no está solo: otras grandes empresas han firmado compromisos de industria similares y ya están trabajando en sus propios planes de observación de agua. El etiquetado invisible se está convirtiendo así en un estándar de la industria, no una característica única Claude.

Es cierto que la tecnología tiene limitaciones: el uso de la clave secreta produce sólo una estimación probabilística del origen de un texto, no una certeza absoluta. Sin embargo, eso es suficiente para los reguladores y proporciona a los usuarios una capa adicional de transparencia.

Tema básico: marcar el texto de Claude es un compromiso entre transparencia, regulación y conveniencia. No tiene prácticamente ningún impacto en la calidad de generación y permite verificar el origen del texto sin comprometer la privacidad del usuario.

Preguntas frecuentes

Material similar

Todos los materiales
Cómo funciona la observación invisible de los textos de Claude