Así funcionará la marca de agua de IA de Claude (según Anthropic)
Anthropic ha explicado cómo funcionará la marca de agua que incorporarán los futuros modelos de Claude en los textos que generen.
El objetivo es poder estimar posteriormente si Claude ha participado en la creación de un contenido, sin añadir etiquetas visibles, caracteres ocultos ni información sobre el usuario.
La medida responde a los requisitos del AI Act de la Unión Europea y al Código de Buenas Prácticas sobre transparencia del contenido generado por IA. Anthropic no será la única empresa en hacerlo: otros grandes desarrolladores de modelos han firmado el mismo código y también tendrán que implementar mecanismos de marcado.
Lo interesante está en cómo funciona. Porque, a diferencia de lo que podemos imaginar al hablar de una marca de agua, aquí no se añade nada al texto. La señal se genera durante el propio proceso de escritura del modelo.
Las claves de la marca de agua de Claude
Antes de entrar en la parte técnica, podemos resumir lo más importante:
- No debería afectar a la calidad del contenido.
- El lector no podrá distinguir un texto marcado de uno sin marcar.
- No se añaden caracteres ocultos ni información adicional.
- No consume tokens extra.
- No encarece el uso de Claude.
- No contiene datos sobre el usuario, su empresa o una conversación concreta.
- No demuestra de forma absoluta que Claude sea el autor del texto: permite estimar la probabilidad de que haya participado en su creación.
Y esta última diferencia es importante. No estamos ante una firma digital tradicional que diga de forma inequívoca “este texto lo ha escrito Claude”, sino ante una señal estadística que permite analizar la posible intervención del modelo.
¿Cómo se puede poner una marca de agua en un texto sin añadir nada?
Para entenderlo hay que recordar cómo funciona un modelo de lenguaje. Claude genera texto tomando decisiones sucesivas sobre cuál debería ser el siguiente token o palabra de una respuesta.
Imaginemos una frase como esta:
El tiempo hoy estaba frío y…
Después de “y” podrían aparecer varias continuaciones perfectamente razonables: gris, nublado, húmedo o cualquier otra alternativa compatible con el contexto. Algunas opciones serán más probables que otras, pero en muchos casos varias palabras pueden ser igualmente válidas sin cambiar sustancialmente el significado de la frase.
Es precisamente en esas pequeñas decisiones donde entra en juego la marca de agua.
Normalmente, el modelo utiliza un componente de aleatoriedad para decidir entre varias alternativas posibles. Con el sistema de marcado, esa aleatoriedad se genera de una manera concreta utilizando una clave y parte del texto anterior.
Para el usuario, el resultado sigue siendo completamente natural. Pero si se analizan muchas de esas decisiones a lo largo del texto, aparece un patrón estadístico que puede compararse posteriormente con la clave utilizada por Claude.
Dicho de otra manera: la marca de agua no está en una palabra concreta, sino en el patrón formado por muchas decisiones lingüísticas sucesivas.
No hay caracteres invisibles
Este punto merece especial atención porque probablemente sea una de las primeras ideas que vienen a la cabeza al escuchar “marca de agua”.
Anthropic no introduce espacios especiales, caracteres Unicode invisibles, códigos secretos ni fragmentos de información escondidos dentro del texto. Tampoco existe un conjunto de palabras que Claude tenga que utilizar obligatoriamente para dejar su firma.
La técnica simplemente modifica la forma en la que se resuelven determinadas elecciones entre alternativas que el modelo ya consideraba adecuadas. Si Claude tiene que decidir entre dos palabras igualmente naturales, la marca de agua puede influir en esa decisión. Si solo existe una respuesta correcta, no debería hacerlo.
¿Afectará a la calidad de Claude?
Anthropic asegura que no ha encontrado un impacto práctico sobre la calidad, la creatividad o la legibilidad de las respuestas.
La tecnología está basada en SynthID-Text, un enfoque desarrollado por Google DeepMind y publicado en Nature en 2024. En las pruebas realizadas con esta técnica tampoco se encontraron diferencias estadísticamente significativas entre las valoraciones que recibían los textos con marca de agua y los que no la utilizaban.
Para el lector, ambos deberían resultar indistinguibles.
Tiene sentido si pensamos en qué tipo de decisiones está modificando el sistema. Si dos expresiones transmiten prácticamente lo mismo y ambas son naturales, elegir una u otra no debería afectar de forma apreciable al resultado.
La analogía del Monopoly
Anthropic utiliza una buena analogía para explicar el funcionamiento.
En una partida de Monopoly, cada jugador tira un dado para saber cuántas casillas debe avanzar. El resultado es aleatorio.
Ahora imaginemos que, en lugar de utilizar dados, usamos los decimales de π. Elegimos un punto cualquiera de la secuencia y utilizamos sucesivamente sus cifras para determinar los movimientos.
Desde el punto de vista de los jugadores, la partida seguiría pareciendo aleatoria. No notarían ninguna diferencia relevante. Sin embargo, si después conocemos toda la secuencia de movimientos y sabemos qué mecanismo se utilizó, podríamos analizar si esos resultados son compatibles con los decimales de π.
La partida estaría, de alguna forma, marcada.
Con Claude sucede algo parecido. La respuesta continúa pareciendo normal, pero existe una estructura estadística que permite comprobar posteriormente si las elecciones realizadas son compatibles con la clave empleada por el modelo.
Anthropic utilizará SynthID-Text
La implementación de Anthropic estará basada en SynthID-Text, la técnica desarrollada por Google DeepMind.
Este tipo de sistemas pertenece a una familia de mecanismos de marcado de modelos de lenguaje que llevan varios años investigándose. Su principio común consiste en no modificar directamente el contenido, sino en alterar de manera controlada la fuente de aleatoriedad utilizada para seleccionar entre posibles continuaciones.
Esto tiene una ventaja importante: el modelo no necesita introducir contenido artificial para dejar la señal.
También tiene limitaciones.
La marca de agua no demuestra que un texto sea de Claude
Que un detector encuentre la marca no significa necesariamente que Claude haya escrito absolutamente todo el contenido.
La pregunta que puede responder el sistema es más parecida a: “¿Qué probabilidad existe de que Claude haya participado en la creación de este texto?”
Esto significa que una detección positiva podría corresponder tanto a un documento escrito completamente por Claude como a un contenido humano que posteriormente haya sido reescrito de forma considerable por el modelo.
La ausencia de la marca tampoco demuestra que el texto sea humano. Otro modelo podría haberlo generado utilizando una clave diferente, una técnica distinta o incluso ningún sistema de marcado.
Por tanto, las marcas de agua no solucionan por sí solas el problema de determinar si un contenido es “humano” o “generado por IA”. Lo que aportan es una señal adicional sobre la posible procedencia.
Los textos largos serán más fáciles de detectar
El mecanismo necesita acumular suficientes decisiones para que el patrón estadístico sea significativo.
En un texto de pocas palabras hay muy poco material que analizar. En cambio, en un documento largo generado completamente por Claude existirán muchas más elecciones y, por tanto, más oportunidades para incorporar la señal.
Esto significa que la fiabilidad de la detección debería aumentar con la longitud del contenido.
También explica por qué algunos tipos de texto serán más fáciles de marcar que otros.
Los textos factuales tendrán menos señal
Hay situaciones en las que Claude no dispone realmente de varias alternativas.
Si escribimos:
La obra más famosa de Isaac Newton se titulaba Principia…
la continuación correcta de un nombre propio o de un dato factual no puede modificarse simplemente para reforzar una marca de agua.
En ese tipo de situaciones, la precisión tiene prioridad.
Por eso Anthropic explica que la marca puede ser más débil en textos muy factuales, donde existen menos oportunidades para elegir libremente entre varias palabras sin afectar a la exactitud de la respuesta.
¿Qué pasa si Claude solo corrige un texto humano?
Aquí aparece uno de los casos más interesantes.
Imaginemos que escribimos un artículo completo y le pedimos a Claude únicamente que corrija la gramática y la puntuación sin modificar el estilo. La mayoría de las palabras seguirán siendo nuestras y Claude apenas tendrá que tomar decisiones propias.
Como la marca de agua solo puede aparecer en las partes que realmente genera o modifica el modelo, es posible que en ese caso no exista suficiente señal para detectar su intervención.
La regla es bastante intuitiva: cuanto más contenido escriba Claude, más posibilidades habrá de detectar su participación.
Una revisión mínima y una reescritura completa son, desde el punto de vista de la marca de agua, situaciones muy diferentes.
¿Y el código generado por Claude?
El código presenta un problema similar.
Las marcas de agua funcionan especialmente bien cuando existen varias alternativas igualmente válidas. En programación, sin embargo, muchas decisiones tienen que ser exactas.
Si Claude escribe:
2 + 2 =
la respuesta correcta es 4. El sistema no puede modificar ese resultado únicamente para introducir una señal estadística.
Con el código ocurre lo mismo. Hay tokens, funciones, operadores y estructuras cuya elección está determinada por la sintaxis o por el comportamiento esperado del programa.
Por eso Anthropic prevé que el código tenga generalmente menos marca de agua que el lenguaje natural.
Sí puede existir señal en aquellas partes donde haya mayor libertad, como comentarios, ciertos nombres de variables o decisiones estilísticas que no afecten al funcionamiento del programa.
No habrá más tokens ni mayor coste
Desde el punto de vista del usuario, la implementación debería ser prácticamente transparente.
Anthropic afirma que el sistema tiene un impacto insignificante sobre la velocidad de generación y, como no introduce contenido adicional, no requiere tokens extra.
Esto significa que la marca de agua no debería incrementar el coste de utilizar Claude.
La marca de agua no identifica al usuario
Otra duda razonable es si esa señal podría utilizarse para identificar a la persona o empresa que generó un determinado contenido.
Anthropic afirma que no.
La marca está asociada a Claude y al mecanismo de generación, pero no contiene información sobre la cuenta del usuario, su organización, una conversación concreta o los chats mantenidos con el sistema.
Su objetivo es detectar la posible participación del modelo, no rastrear quién lo estaba utilizando.
¿Por qué lo hace Anthropic ahora?
La explicación es principalmente regulatoria.
Anthropic ha firmado, junto con otros grandes proveedores de inteligencia artificial, el Código de Buenas Prácticas europeo relacionado con la transparencia del contenido generado mediante IA.
La regulación europea establece obligaciones para identificar determinados contenidos creados mediante inteligencia artificial y Anthropic ha decidido implementar esta marca de agua como parte de su cumplimiento.
La compañía ha explicado además que aplicará inicialmente el sistema de forma global. La razón es técnica: por el momento no dispone de una manera suficientemente robusta de restringir el mecanismo únicamente a determinadas regiones.
Habrá una API para detectar la marca
Anthropic también trabaja en una API de detección de marcas de agua.
La idea es que sea posible enviar un texto y analizar si contiene una señal compatible con la generación mediante Claude.
Todavía faltan detalles importantes sobre su implementación, pero este punto será especialmente relevante. La utilidad práctica de una marca de agua no depende únicamente de poder introducirla, sino también de quién podrá comprobarla, con qué nivel de confianza y bajo qué condiciones.
Para imágenes y archivos, Anthropic utilizará C2PA
El tratamiento de imágenes y otros archivos será diferente.
Cuando Claude produzca determinados formatos compatibles, como PNG, JPG o SVG, Anthropic añadirá Content Credentials basadas en el estándar C2PA.
En este caso sí estamos hablando de información incluida en los metadatos del archivo. Se trata de una pequeña declaración firmada criptográficamente que permite indicar que Claude ha participado en su creación o procesamiento.
C2PA es un estándar abierto que también utilizan fabricantes de cámaras, herramientas de edición y otras plataformas para registrar información sobre la procedencia de los contenidos digitales.
Por tanto, hay dos mecanismos distintos:
- Texto: una señal estadística integrada en las decisiones de generación.
- Archivos compatibles: una credencial criptográfica añadida a los metadatos mediante C2PA.
En ninguno de los dos casos Anthropic pretende incluir información identificativa del usuario.
¿Se puede eliminar una marca de agua reescribiendo el texto?
Sí. Anthropic reconoce abiertamente que el sistema no es imposible de eliminar.
Una edición ligera probablemente conserve buena parte de la señal, porque muchas de las decisiones originales de Claude seguirán presentes. Pero una reescritura suficientemente profunda puede degradarla o eliminarla por completo.
Y aquí aparece una cuestión bastante interesante.
Si Claude genera un artículo y una persona posteriormente reescribe prácticamente todas sus frases y palabras, ¿seguimos hablando del mismo contenido generado por IA?
La marca de agua no intenta resolver este debate. Simplemente refleja las decisiones del modelo que siguen presentes en el texto final.
¿Las traducciones de Claude tendrán marca de agua?
Sí. Una traducción es un caso bastante diferente a una simple corrección ortográfica. Aunque el contenido original proceda de una persona, todas las palabras de la versión traducida están siendo seleccionadas nuevamente por Claude.
Eso proporciona al modelo muchas oportunidades para incorporar la señal.
Por tanto, una traducción realizada por Claude también podrá contener la marca de agua.
¿Y los modelos antiguos?
Anthropic explica que la normativa contempla un periodo de transición para los modelos publicados antes del 2 de agosto de 2026.
A fecha de hoy, 15 de agosto de 2026, Anthropic no ha lanzado ningún modelo Claude nuevo después del 2 de agosto.
El modelo más reciente que encuentro es Claude Opus 5, presentado el 24 de julio de 2026, por lo que también entra dentro de la categoría de modelos lanzados antes del 2 de agosto.
La documentación actual de Anthropic muestra como familia vigente a Claude Fable 5, Claude Opus 5, Claude Sonnet 5 y Claude Haiku 4.5. No aparece ningún modelo posterior al 2 de agosto.
Los modelos lanzados antes del 2 de agosto de 2026 cuentan con un periodo de transición y Anthropic irá incorporando el marcado progresivamente durante los próximos meses.
Una marca de agua no es lo mismo que un detector de IA
Esta distinción me parece especialmente importante.
Los detectores tradicionales de contenido generado por IA intentan descubrir si un texto parece haber sido escrito por un modelo. Para hacerlo analizan patrones estadísticos, estructuras lingüísticas, vocabulario o expresiones que suelen aparecer con más frecuencia en las respuestas de las IA.
Anthropic pone algunos ejemplos curiosos: los modelos parecen tener cierta predilección por construcciones del tipo “esto no es X, es Y” o por determinadas palabras que aparecen con una frecuencia superior a la habitual.
Ese tipo de detección intenta inferir el origen observando el estilo.
La marca de agua utiliza una aproximación completamente diferente. No busca pistas involuntarias del modelo: busca una señal introducida deliberadamente durante la generación.
Es la diferencia entre intentar reconocer una firma por sus características y comprobar una señal que el propio sistema ha dejado intencionadamente.
¿Cambia algo respecto a la propiedad o la autoría?
No.
Anthropic deja claro que detectar la marca de agua no determina quién posee el contenido ni quién debe considerarse legalmente su autor.
Tampoco modifica los derechos que los usuarios tengan sobre las respuestas de Claude según los términos del servicio.
La marca solo aporta información técnica sobre la posible participación del modelo en la generación o procesamiento del contenido.
De detectar IA a demostrar procedencia
Para mí, esta es la parte realmente interesante de todo este movimiento.
Durante los últimos años hemos intentado responder a una pregunta casi imposible: ¿podemos mirar un texto y saber si lo ha escrito una inteligencia artificial?
Los detectores tradicionales intentan resolverlo analizando patrones. Pero cuanto mejores son los modelos y más naturales resultan sus respuestas, más complicado se vuelve distinguir el origen únicamente observando el resultado.
Las marcas de agua cambian parcialmente el enfoque.
En lugar de intentar adivinar después si un contenido parece haber sido generado por IA, los propios sistemas empiezan a incorporar mecanismos que permiten demostrar su posible procedencia.
No será una solución perfecta. Las marcas pueden desaparecer con una reescritura profunda, funcionan peor con textos cortos y no permiten demostrar que un texto sea humano por el simple hecho de no encontrar una señal.
Pero el cambio de enfoque es importante.
El futuro probablemente combinará marcas de agua estadísticas para texto, Content Credentials, firmas criptográficas y estándares como C2PA. Ya no hablaremos únicamente de detectar contenido generado por IA, sino de construir mecanismos que permitan acreditar de dónde procede y qué sistemas han participado en su creación.
Y con la regulación europea empujando en esa dirección, todo apunta a que este tipo de tecnologías dejarán pronto de ser experimentos para convertirse en una característica habitual de los principales modelos de inteligencia artificial.
Información basada en la publicación How Claude’s text watermark works.
