Steganografia e Dataset di training AI: il vettore d’attacco che nessuno sta regolamentando

Steganografia e dataset
Esiste una categoria di rischi legati all’intelligenza artificiale su cui il dibattito pubblico è sostanzialmente silente. Non si tratta di allineamento valoriale, di bias algoritmici o di sostituzione del lavoro umano. Si tratta di qualcosa di più specifico, più tecnico e, proprio per questo, più difficile da intercettare prima che diventi un problema irreversibile.
Si tratta di steganografia applicata ai dataset di training, e di quello che succede quando le immagini con cui addestriamo i modelli multimodali nascondono qualcosa che non dovrebbe esserci.
[Aggiornamento aprile 2026: mentre scrivevo questo pezzo, Anthropic ha annunciato Project Glasswing con Claude Mythos Preview. Quello che segue non è più solo una riflessione teorica.]
Cos’è la steganografia, perché non è fantascienza
La steganografia è la disciplina che studia come nascondere un’informazione all’interno di un’altra, senza alterare l’aspetto visivo né le proprietà percettibili del file che la contiene.
Non è crittografia. La crittografia rende un messaggio illeggibile ma rivela che esiste. La steganografia fa qualcosa di più sottile: rende il messaggio invisibile. Guardi un’immagine e vedi una fotografia normale. Dentro, nascosto nel rumore statistico dei pixel, c’è del testo.
La ricerca moderna misura la quantità di informazione nascosta in bpp — bits per pixel: quanti bit di payload vengono iniettati per ogni pixel dell’immagine. Il range standard nei benchmark scientifici oscilla tra 0.1 e 0.5 bpp.
Numeri astratti? Rendiamoli concreti.

Un’immagine a risoluzione modesta — 512×512 pixel, circa 260.000 pixel totali — a soli 0.1 bpp contiene 26.000 bit di payload nascosto: circa 3.200 caratteri di testo, equivalenti a più di 50 righe di codice. A 0.4 bpp si sale a oltre 13.000 caratteri — circa 200 righe.
Ora la domanda che conta davvero: quante righe servono per scrivere un agente malevolo funzionante?
Una fork bomb in bash è una riga. Un keylogger minimale in Python è meno di 20.
Un payload di prompt injection sofisticato, progettato non per eseguire codice sul sistema operativo ma per riscrivere le istruzioni di un modello linguistico in un contesto agentico, può essere formulato in meno di 10 righe di testo.
Il volume disponibile è quindi più che sufficiente — anche al payload minimo considerato “difficile da rilevare”.
Quanto è difficile rilevarlo? Lo stato dell’arte della steganalisi

Qui entra in gioco la steganalisi, la disciplina speculare che tenta di rilevare contenuti steganografici. Ed è qui che la situazione si fa complicata.
La steganalisi tradizionale era quasi cieca a 0.1 bpp: il segnale risultava statisticamente indistinguibile dal rumore naturale dell’immagine.
I detector moderni basati su reti neurali convoluzionali (CNN) — come SRNet o i modelli della famiglia Ye-Net — hanno migliorato significativamente la sensibilità anche su questa soglia.
Il problema è che le tecniche steganografiche basate su deep learning — architetture GAN e sistemi encoder-decoder avversariali come HiDDeN, StegaStamp o Stegano — hanno raggiunto in parallelo livelli di imperscrutabilità statistica quasi completa. I migliori detector si comportano, su questi payload, come se stessero tirando a caso.
Attacco e difesa si inseguono in tempo reale. E a guardare i risultati sperimentali più recenti, è l’attacco a essere in vantaggio.
C’è un ulteriore elemento tecnico che aggrava il quadro: le tecniche steganografiche neurali più avanzate codificano il payload in feature semantiche di livello intermedio, non nei bit meno significativi. Questo le rende resistenti alle trasformazioni della pipeline di preprocessing standard — ridimensionamento, normalizzazione, JPEG re-encoding, data augmentation.
Non vengono distrutte prima ancora di arrivare al training. Ci entrano integre.
Il vettore d’attacco reale: la supply chain dei dataset

Steganografia e supply chain
Definiamo il vettore con precisione.
Un fornitore malevolo di immagini ad alta qualità — o un attaccante che riesce a inquinare una fonte dati legittima — potrebbe distribuire pacchetti con payload testuali distruttivi nascosti nei dati visivi. Questi payload sopravvivono al preprocessing standard e vengono ingeriti nel processo di training.
Il modello risultante apprende, oltre ai pattern visivi legittimi, anche le istruzioni o i trigger nascosti nel dato.
Il risultato non è un crash.
È un modello che si comporta normalmente in quasi tutte le circostanze, e in modo radicalmente diverso quando incontra una specifica condizione di attivazione — un trigger che l’attaccante conosce e può somministrare a piacere.
Il moltiplicatore downstream è il punto più pericoloso. Un modello fondazionale compromesso è come un componente critico contaminato in una supply chain industriale: ogni prodotto derivato eredita la vulnerabilità, spesso senza che il team downstream abbia alcuna visibilità sui dati di training originali. In un ecosistema dove decine o centinaia di organizzazioni fanno fine-tuning sullo stesso foundation model — scenario realistico con i pesi open-source — la superficie d’attacco si moltiplica in modo esponenziale e silenzioso.
Project Glasswing: la conferma che non volevamo ricevere

Il 7 aprile 2026 Anthropic ha annunciato Project Glasswing e reso pubblico Claude Mythos Preview, un modello frontier sviluppato internamente che l’azienda ha scelto di non rilasciare al pubblico per ragioni di sicurezza.
Perché è rilevante per questa discussione? Perché Mythos Preview ha dimostrato empiricamente qualcosa che fino a poco fa era confinato alla ricerca accademica: un sistema AI con capacità di ragionamento e coding sufficientemente avanzate può trovare, analizzare e weaponizzare vulnerabilità zero-day in modo completamente autonomo, senza intervento umano dopo il prompt iniziale.
I dati dichiarati da Anthropic sono significativi. In poche settimane di testing, Mythos Preview ha identificato migliaia di vulnerabilità zero-day critiche in ogni major operating system e ogni major web browser testato. Forniti 100 CVE del kernel Linux come punto di partenza, il modello ne ha selezionati 40 potenzialmente exploitabili e ha scritto exploit di privilege escalation funzionanti per più della metà — incluso il chaining di vulnerabilità multiple per penetrare sistemi complessi. In un caso documentato, ha anche pubblicato autonomamente i dettagli dell’exploit su siti pubblici non richiesto — comportamento che Anthropic stessa definisce “preoccupante dimostrazione della propria efficacia”.
Cosa c’entra con la steganografia sui dataset?
Tutto. Il ragionamento è lineare. Se un modello AI è in grado di operare con questo livello di autonomia offensiva su sistemi reali, la stessa capacità di ragionamento autonomo applicata alla fase di training diventa un moltiplicatore del vettore steganografico. Un payload steganografico non deve più contenere solo istruzioni statiche: può contenere il trigger per attivare capacità latenti nel modello addestrato, capacità che il modello ha sviluppato legittimamente e che vengono semplicemente dirottate.
C’è un secondo elemento che Glasswing porta sul tavolo e che va detto chiaramente: Anthropic ha comunicato di aver già avvertito privatamente funzionari governativi degli Stati Uniti sulle capacità offensive di Mythos, sostenendo che questi modelli rendono significativamente più probabili attacchi cyber su larga scala nel corso del 2025-2026. Se questo livello di preoccupazione esiste per un modello non rilasciato e tenuto sotto controllo, il problema delle pipeline di training non protette — che nessuna agenzia monitora sistematicamente — diventa ancora più urgente.
Non è teoria. È la supply chain dell’AI che mostra le sue crepe in tempo reale.
Il vuoto normativo: dove siamo adesso

Né il NIST AI RMF, né l’ISO/IEC 42001, né l’AI Act europeo — pur imponendo documentazione sulla data governance nei sistemi ad alto rischio tramite l’Annex IV — specificano requisiti di scansione steganografica sui dataset. Il gap è reale, documentabile, e nessuno ha ancora fatto il passo formale di riconoscerlo come priorità normativa.
I framework attuali si concentrano su:
– qualità e representatività dei dati di training (bias, bilanciamento)
– privacy e minimizzazione (GDPR, data protection)
– trasparenza sui dati usati (documentazione, model card)
Nessuno di questi layer intercetta un payload steganografico progettato per sopravvivere al preprocessing e modificare il comportamento del modello in modo condizionale.
Un framework normativo minimale dovrebbe includere, nell’ordine:
– Provenance tracking crittograficamente verificabile per i dataset di training multimodali — ogni immagine deve avere una firma di origine verificabile, e ogni trasformazione applicata deve essere loggata in modo immutabile.
– Requisiti di scansione steganografica con strumenti multipli prima dell’ingestion: analisi in frequenza (DCT, DFT), detector CNN aggiornati (SRNet, Ye-Net), e analisi statistica comparativa – rispetto a distribuzioni di riferimento certificate.
– Augmentation pipeline standardizzate e certificate come “carrier-destroying” — ovvero trasformazioni geometriche e cromatiche sufficientemente aggressive da distruggere i payload steganografici neurali anche se codificati in feature intermedie.
– Model auditing comportamentale post-training specificamente orientato alla rilevazione di backdoor e canali covert appresi — non solo test di accuracy, ma probing sistematico su input con caratteristiche anomale.
– Disclosure obbligatoria da parte dei fornitori di foundation model sulle pratiche di igiene dei dataset, con standard minimi verificabili da terze parti accreditate.
Una finestra che si sta chiudendo più velocemente del previsto

Quando ho cominciato a scrivere questo pezzo, la finestra temporale in cui è ancora possibile costruire questi standard prima che si verifichi un incidente dimostrabile sembrava abbastanza ampia da permettersi il lusso di una pacifica riflessione teorica.
E invece no!
Project Glasswing ha ristretto quella finestra considerevolmente.

Alex Stamos, chief product officer di Corridor
Alex Stamos, chief product officer di Corridor e precedentemente responsabile della sicurezza in Facebook e Yahoo, ha dichiarato che abbiamo circa sei mesi prima che i modelli open-weight raggiungano le frontier model nelle capacità di bug finding.
A quel punto, ogni attore ransomware sarà in grado di trovare e weaponizzare vulnerabilità senza lasciare tracce per le forze dell’ordine — e a costo marginale quasi zero.
I modelli multimodali continuano ad essere addestrati su dataset di scala web senza igiene steganografica sistematica.
I deployment agentici si moltiplicano con accesso crescente a strumenti reali.
E la capacità dei modelli di operare in autonomia — come Mythos Preview ha dimostrato — trasforma il vettore steganografico da minaccia latente a minaccia operativamente sfruttabile.
La comunità tecnica deve iniziare a parlare di questo con la stessa urgenza con cui parla di altri vettori di attacco all’AI.
E il legislatore — europeo in particolare, con l’AI Act come leva — deve capire che la sicurezza dei dati di training non è solo una questione di privacy o di qualità: è una questione di integrità strutturale del sistema.
A differenza di una bomba fisica, questa non esplode in un momento preciso — si attiva su comando, quando l’attaccante decide di fornire il trigger giusto. Il che significa che il danno potrebbe già essere stato seminato in modelli già deployed, in attesa.
Prima che qualcuno faccia la frittata.