2026-08-22 · ← Noticias
Anthropic muestra cómo planea añadir marcas de agua. La señal se oculta en el muestreo de tokens
La marca de agua se genera durante el muestreo en torneo
Anthropic planea introducir marcas de agua en el texto durante la fase de muestreo de tokens sin necesidad de reentrenar el modelo. El método funciona según el principio de muestreo en torneo (tournament sampling), donde una clave secreta controla la elección solo en aquellas posiciones del texto en las que existen varios tokens con probabilidades similarmente altas. Por lo tanto, la técnica no interfiere en lugares donde la elección de la siguiente palabra es obvia.
La puntuación de detección requiere la clave original
En un análisis posterior, el texto se evalúa utilizando la misma clave y funciones de puntuación. Sin la clave, no se puede determinar de manera fiable si el texto analizado lleva la marca de agua de Anthropic, ni tampoco extraer un patrón de él. La empresa afirmó que preparará una API de detección, pero según Raschka, aún no está claro si será totalmente pública o si estará restringida a socios seleccionados, lo que afectará a su utilidad real para terceros.
Las modificaciones del texto pueden romper la señal estadística
La marca de agua depende de mantener tokens concretos en posiciones seleccionadas. Alguien que no conozca la clave secreta no sabe qué palabras debería cambiar para eliminar la marca. Sin embargo, un número suficiente de ediciones aleatorias, reformulaciones o palabras insertadas puede empujar la puntuación general por debajo del umbral de detección fiable. Así, la resistencia de este método no reside en la inmutabilidad absoluta de la señal, sino en el hecho de que su ubicación exacta permanece oculta para un atacante.
Los reguladores siguen esperando una solución robusta
Raschka anticipa que algunos usuarios pasarán el resultado de Claude por un modelo local de postprocesamiento, borrando así la firma estadística. Sigue siendo una incógnita si este método cumplirá los estrictos requisitos de la Ley de IA europea (AI Act), cuya aplicación del artículo 50 comenzó el 2 de agosto de 2026. La ley exige que las marcas de agua sean efectivas y robustas, pero según los revisores técnicos de ACM Europe en respuesta al borrador de directrices de la Comisión en julio, hasta el momento ninguna herramienta de marcas de agua en texto cumplía todos estos parámetros.
El veredicto de Lilith
Anthropic mantiene el control central y ofrece a los demás la detección mediante una API. Una elegante supervisión de procedencia, justo hasta que el texto pasa por un segundo modelo y la firma estadística empieza a desvanecerse.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗