MODELLI AI 7 min

Come funziona il watermark di Claude

Anthropic marca ora tutto il testo generato da Claude con un watermark statistico invisibile. Come funziona davvero, cos'è la SynthID-Text, e perché la spinta è l'EU AI Act.

Qualche giorno fa mi sono fatto una domanda semplice: come si fa, tecnicamente, a mettere un watermark dentro un testo?

Non c’è un pixel invisibile. Non c’è un carattere nascosto. Non c’è un logo in filigrana.

Eppure da agosto 2026 Anthropic lo fa su tutto il testo generato da Claude. Sono andato a leggermi la documentazione tecnica ufficiale e il paper scientifico da cui deriva il meccanismo, e provo a spiegare qui come funziona davvero, cosa cambia rispetto a quello che si legge di solito in giro, e perché questa storia riguarda molto più della sola tecnologia.

Il meccanismo, in breve

Claude scrive una parola alla volta. A ogni passo ha davanti diverse parole possibili, tutte corrette.

Prendiamo la frase “il ristorante era sorprendentemente…”. Vanno bene sia “buono” che “elegante” che “tranquillo”. Nessuna cambia il senso della frase.

Normalmente il modello sceglie tra queste opzioni con un po’ di casualità. Il watermark entra esattamente in quel momento: una chiave segreta si combina con il testo già scritto e favorisce di poco una delle opzioni valide, senza aggiungere nulla di nascosto al testo.

La parola preferita cambia frase per frase, perché dipende dal contesto. Non esiste una lista fissa di “parole da AI” da cercare.

Su una singola parola questo non significa nulla: un umano avrebbe potuto scegliere la stessa cosa per puro caso. Ma su migliaia di parole, in un testo lungo, quelle piccole preferenze lasciano un pattern statistico che chi possiede la chiave può misurare. Copiare e incollare il testo non cancella il watermark, perché vive nella scelta delle parole, non in caratteri nascosti.

Cos’è davvero la “chiave segreta”

Nella pagina tecnica ufficiale, Anthropic descrive il meccanismo così: il sistema sostituisce la fonte di casualità con cui il modello sceglie il prossimo token con “la chiave e alcune parole precedenti”, in modo che le scelte restino casuali ma verificabili a posteriori con la stessa chiave.

Non è un file, non è un pezzo di crittografia a chiave pubblica: è un valore che il sistema tiene lato server e riusa a ogni generazione. Il punto più rilevante per la privacy è che né la chiave né il suo output contengono informazioni sull’utente. Anthropic lo dichiara esplicitamente: “il watermarking non porta nessuna informazione identificativa e non può essere tracciato a una persona, organizzazione o chat specifica”.

Un paio di precisazioni

  • Il metodo ha un nome, e non è un’invenzione isolata di Anthropic. È una variante di SynthID-Text, la tecnica pubblicata da Google DeepMind su Nature nel 2024, che introduce il cosiddetto Tournament Sampling: le parole candidate competono a coppie, e la chiave decide ogni confronto fino a selezionare il token finale. L’idea di fondo risale a una proposta del 2022 del crittografo Scott Aaronson, mentre lo schema “green-list / red-list” che si trova spesso spiegato online per il watermarking degli LLM è quello pubblicato da Kirchenbauer e colleghi nel 2023 - fondativo per il campo, ma tecnicamente diverso da quello che usa Claude oggi. Un approccio condiviso nel settore, non un segreto industriale.
  • Il motivo non è “trasparenza” in astratto, è una legge con una data precisa. È l’EU AI Act Transparency Code, entrato in vigore il 2 agosto 2026, che Anthropic ha firmato insieme ad altri circa 190 firmatari. Per questo il watermark si applica ai modelli Claude lanciati dopo quella data fin dal debutto, mentre per i modelli precedenti Anthropic sta lavorando a un’estensione retroattiva durante il periodo di transizione previsto dalla normativa.
  • Il watermark vale ovunque, non solo in Europa. Anthropic lo applica globalmente perché, dichiarano, non hanno ancora “un modo duraturo di limitarlo per regione” - un dettaglio che dice molto su come una normativa europea finisca per ridisegnare il comportamento di un modello per ogni utente nel mondo, non solo per chi vive in UE.
  • Tradurre porta il watermark, correggere le bozze spesso no. Una traduzione automatica lo mantiene, perché ogni parola nella lingua di arrivo è comunque una scelta fatta da Claude. Un proofreading leggero, invece, spesso lo cancella: le parole restano quasi tutte quelle originali dell’utente, e il modello ne ha toccate troppo poche per lasciare un pattern misurabile.
  • Non c’è ancora un modo pubblico per verificarlo da soli. Anthropic ha annunciato una API di rilevamento pubblica per controllare se un testo porta il marchio, ma al momento della pubblicazione di questo articolo non è ancora disponibile.
  • Per immagini e PDF si usa un altro standard. I file generati (SVG, PNG, JPG e simili) non ricevono il watermark statistico nel contenuto: ricevono metadata di provenienza firmato crittograficamente secondo lo standard C2PA (Coalition for Content Provenance and Authenticity) - leggibile con strumenti dedicati, e per natura diverso dal meccanismo testuale descritto sopra.

I limiti che Anthropic dichiara apertamente

Vale la pena essere precisi, perché sono proprio questi limiti a rendere lo strumento poco adatto come prova disciplinare:

  • Testi brevi - il rilevamento è debole quando ci sono poche scelte di parola su cui basarsi.
  • Passaggi fattuali - dove esiste una sola formulazione corretta (un nome, una data, un titolo) il modello ha meno margine per esprimere una preferenza, quindi il segnale è più debole.
  • Codice - dove è richiesto un output sintatticamente esatto, il watermark semplicemente non viene applicato.

La robustezza cresce con la lunghezza del testo: più lungo il passaggio, più affidabile la stima. Per questo il detector, quando Anthropic lo renderà disponibile pubblicamente, non restituirà mai un verdetto secco, ma una probabilità.

Perché la faccenda smette di essere solo tecnica

Con l’AI i tempi si accorciano comunque, a scuola, all’università, al lavoro. Nessun watermark cambia questo fatto.

A scuola e all’università il tema vero, per me, è ripensare l’insegnamento e la valutazione, sapendo che questi strumenti ci sono già e si usano - non inseguire una tecnologia di rilevamento che gli stessi creatori descrivono come probabilistica e aggirabile con una riscrittura.

Al lavoro il tema è lo stesso: serve la formazione, tecnica e non tecnica, per imparare a usare questi strumenti e aumentare il valore di quello che produciamo, non solo per accorciare i tempi.

Il vero metro di misura, per me, resta uno solo: il risultato finale è migliore di quello che avrei prodotto senza l’AI, restando comunque frutto del mio ragionamento?

Come funziona il watermark di Claude?

Una chiave segreta, nota solo ad Anthropic, si combina con il testo già scritto e favorisce leggermente alcune delle parole valide che Claude può scegliere a ogni passo. Su una singola parola questo non significa nulla, ma su migliaia di parole quella preferenza ripetuta lascia un pattern statistico misurabile da chi possiede la chiave.

Cos'è SynthID-Text, il metodo usato da Anthropic?

È la tecnica di watermarking pubblicata da Google DeepMind su Nature nel 2024, basata su un algoritmo chiamato Tournament Sampling che fa competere a coppie le parole candidate usando la chiave segreta. Anthropic ha dichiarato di usarne una variante; l'idea di fondo risale a una proposta del 2022 del crittografo Scott Aaronson.

Il watermark di Claude si può rimuovere?

Una riscrittura pesante, parola per parola, indebolisce o cancella il pattern. Una traduzione automatica lo mantiene, perché ogni parola nella lingua di arrivo è comunque scelta da Claude. Un proofreading leggero spesso lo rimuove, perché le parole restano quasi tutte quelle originali dell'utente.

Il watermark di Claude si applica solo in Europa?

No. Anthropic lo applica globalmente a tutti gli utenti, non solo a quelli europei, perché al momento non ha un modo affidabile di limitarlo per regione, anche se la spinta normativa che lo ha introdotto è l'EU AI Act Transparency Code.

Quali testi il watermark di Claude marca peggio?

Testi molto brevi, passaggi puramente fattuali dove esiste una sola formulazione corretta (nomi, date, titoli) e il codice sorgente, dove è richiesto un output sintatticamente esatto e il watermark non viene applicato.