Contesto normativo e obblighi dell’AI Act

L’AI Act dell’Unione europea prevede che i fornitori di intelligenza artificiale etichettino i contenuti generati in un formato leggibile da macchine. L’obiettivo è garantire trasparenza e consentire a terzi di distinguere tra testi prodotti da una macchina e quelli scritti da un umano. Per adeguarsi a questi requisiti, OpenAI ha sviluppato una soluzione basata su watermark invisibili, denominata textGrain, che si integra direttamente nei modelli di linguaggio.

La tecnologia textGrain

textGrain inserisce un segnale statistico invisibile nelle scelte lessicali del modello, modificando leggermente la probabilità di alcune parole senza alterare il significato o la qualità del testo. Il metodo è simile al watermark SynthID adottato da Claude di Anthropic, ma utilizza una tecnologia proprietaria sviluppata da OpenAI. Nei test interni, textGrain ha mostrato performance pari o superiori ad altre soluzioni, inclusa la stessa SynthID di Google, e OpenAI prevede di rilasciare il codice come open source per favorire ulteriori sviluppi.

Implementazione e opzioni per gli utenti

OpenAI attiverà il watermark per gli utenti di ChatGPT e Codex residenti nell’Unione europea nelle prossime settimane. Per quanto riguarda le API, il meccanismo sarà opt‑in, consentendo a sviluppatori di tutto il mondo di decidere se abilitare o meno il watermark. Questa scelta differisce dalla politica di Anthropic, che impone il watermark a livello globale per Claude. Inoltre, il supporto per il watermark sarà esteso ai partner cloud, come Microsoft Azure, nello stesso arco temporale.

Prestazioni e tassi di rilevamento

I risultati dei test indicano che la capacità di rilevare il watermark dipende fortemente dalla lunghezza del testo e dal contenuto trattato. Con un tasso di falsi positivi fissato all’1 %, il rilevatore ha identificato il segnale in circa il 95 % dei brani di 400 token (circa 300 parole) su temi di psicologia. Riducendo la lunghezza a 200 token, la percentuale è scesa all’80 %. I contenuti matematici, dove le scelte lessicali sono più ristrette, hanno mostrato tassi di rilevamento significativamente più bassi, intorno al 60 % per 400 token.

Limiti e vulnerabilità del watermark

Le modifiche al testo influiscono notevolmente sull’efficacia del rilevatore. Sostituire il 10 % delle parole con sinonimi riduce la capacità di rilevamento da circa il 92 % al 66 % per testi di 400 token; una sostituzione del 25 % porta la percentuale sotto il 20 %. Questo rende il watermark vulnerabile a semplici operazioni di editing, ma al contempo offre agli utenti la possibilità di rimuovere il segnale se desiderano mantenere la privacy dei propri contenuti.

Accesso al rilevatore e policy di utilizzo

Per ora, l’accesso al rilevatore textGrain è limitato a ricercatori selezionati e a organizzazioni specializzate, che possono fare domanda tramite un modulo online. OpenAI valuterà le richieste caso per caso, in conformità con il Codice di Pratica dell’UE. Il rilevatore segnala esclusivamente la presenza di un watermark OpenAI, senza rivelare l’identità dell’utente, i prompt o le conversazioni associate. La restrizione è motivata dal rischio di falsi positivi o di segnalazioni su contenuti non marcati, e l’azienda prevede di ampliare l’accesso “quando riterremo che i risultati possano essere interpretati in modo responsabile”.

Prospettive future e confronti con la concorrenza

OpenAI afferma che l’introduzione del watermark non influisce sulla qualità dell’output, citando test sul modello di frontiera Astra che hanno mostrato performance comparabili con e senza watermark su otto benchmark, tra cui GPQA Diamond, BrowseComp e DeepSWE. Tuttavia, gli osservatori rimangono cauti, poiché la qualità percepita può dipendere da fattori non coperti dai test standard. Anthropic, d’altro canto, non ha pubblicato dati di rilevamento per il watermark di Claude, ma sostiene che il proprio sistema resista bene alle modifiche. Gli strumenti di verifica per immagini e audio di OpenAI, come openai.com/verify e la Content Provenance API, rimangono disponibili al pubblico, contribuendo a creare un ecosistema di tracciabilità più ampio.