Nickname smascherati: l’IA può scoprire chi scrive davvero online

Intelligenza Artificiale anonimato

Per molto tempo abbiamo coltivato una certezza rassicurante: sul web ci si può nascondere. Un soprannome inventato, un avatar generico, qualche dato falso qua e là, e la copertura sembra perfetta. Questa illusione di poter esprimersi liberamente senza che nessuno colleghi le parole scritte alla vera identità è diventata un pilastro fondamentale della nostra esperienza digitale.

Tuttavia, questa sicurezza rischia di sgretolarsi molto più rapidamente di quanto pensiamo. Una ricerca recente dimostra infatti che l’intelligenza artificiale è già capace di risalire all’identità reale delle persone dietro gli account anonimi, semplicemente studiando ciò che pubblicano in rete.

Non occorre una foto del viso, né dati personali dichiarati apertamente. Sono sufficienti commenti, frasi ironiche, tic linguistici e piccoli particolari disseminati nei post. Elementi che, presi da soli, appaiono del tutto innocui: messaggi quotidiani, scritti quasi d’istinto. Eppure, sommati tra loro, questi frammenti rivelano molto più di quanto immaginiamo.

Come l’ia esamina scrittura e piccoli indizi

La ricerca, pubblicata sulla piattaforma scientifica arXiv, dimostra come i modelli linguistici di grandi dimensioni (LLM) siano in grado di svolgere il ruolo di un vero detective digitale. Il funzionamento non dipende da una prova schiacciante isolata, bensì da un insieme di dettagli minimi che emergono dallo stile con cui ciascuno si esprime e racconta di sé online.

Il sistema messo a punto dai ricercatori parte da un’operazione elementare: scandagliare tutto ciò che un utente ha pubblicato su piattaforme come Reddit o Hacker News. Commenti, battute, citazioni culturali, espressioni tipiche, gusti tecnici, persino piccole abitudini nel modo di scrivere. Ogni elemento diventa materia prima per costruire una specie di ritratto digitale nascosto.

Questi dati vengono convertiti in una rappresentazione matematica dell’individuo. A quel punto, l’intelligenza artificiale svolge il compito in cui eccelle: mettere a confronto quantità enormi di informazioni. Il sistema va così alla ricerca di eventuali coincidenze tra quel ritratto e milioni di altri contenuti reperibili sul web pubblico o su piattaforme professionali come LinkedIn.

La procedura si articola in diverse fasi. Inizialmente l’AI seleziona gli aspetti utili per l’identificazione. Successivamente ricorre a tecniche di embedding semantico, cioè strumenti capaci di cogliere affinità di senso tra testi differenti. Infine interviene la capacità di ragionamento dell’LLM, che soppesa le possibili coincidenze e attribuisce a ognuna un indice di attendibilità.

Quando il grado di certezza non è sufficientemente alto, il sistema evita deliberatamente di fornire un esito. Una decisione precisa presa dagli studiosi per scongiurare identificazioni azzardate o errate.

Legare identità reali e profili pseudonimi diventa sempre più semplice

Per testare l’efficacia concreta di questo metodo, gli studiosi hanno realizzato un esperimento su quasi mille profili LinkedIn, tentando di ricollegarli agli account degli stessi individui presenti su Hacker News. Per garantire un test il più aderente possibile alla realtà, i ricercatori hanno rimosso dai profili qualunque riferimento identificativo diretto: nomi, link personali, indizi evidenti. Sono rimaste solo le descrizioni generiche e le informazioni standard contenute nei profili.

Nonostante questi vincoli, il sistema fondato sull’intelligenza artificiale ha raggiunto risultati sorprendenti. Il framework è riuscito a riconoscere correttamente gli utenti con una precisione del 90% e un’accuratezza che arriva fino al 67%, superando nettamente le tecniche convenzionali finora impiegate nei tentativi di de-anonimizzazione.

Il risultato più eclatante riguarda però un altro elemento. L’AI è riuscita a riconoscere la medesima persona anche quando questa gestiva più account su Reddit, sparsi in comunità diverse e attivi in periodi temporali distanti tra loro. In sostanza, il sistema ha dimostrato di saper cogliere schemi ricorrenti nello stile di scrittura e nel genere di contenuti condivisi.

E tutto questo con un dispendio economico irrisorio. Secondo lo studio, riconoscere un account richiede tra uno e quattro dollari di risorse computazionali. Una cifra quasi trascurabile, se si pensa alla portata che tecnologie del genere potrebbero raggiungere su larga scala. Gli stessi autori della ricerca parlano apertamente della fine di quella che chiamano “oscurità pratica”, cioè quella tutela implicita che per anni ha protetto gli utenti pseudonimi grazie unicamente alla complessità tecnica nel collegare i loro profili alla vita reale.

Ogni contenuto pubblicato online, in effetti, aggiunge un tassello a questo mosaico invisibile. Ogni commento, ogni informazione personale, ogni riferimento culturale arricchisce ulteriormente il profilo digitale di chi scrive. Il risultato finale è uno scenario in cui l’anonimato online diventa sempre più vulnerabile.

Da una parte, questa tecnologia potrebbe rivelarsi uno strumento efficace per la sicurezza informatica, utile a smascherare truffatori, reti di disinformazione o gruppi criminali organizzati. Dall’altra parte, però, solleva questioni delicate riguardo la privacy e la libertà di espressione. Numerose persone scelgono di utilizzare pseudonimi proprio per tutelarsi: attivisti, informatori, lavoratori che segnalano irregolarità sul posto di lavoro, cittadini che vogliono discutere argomenti sensibili senza esporre la propria identità pubblica.

Se l’intelligenza artificiale proseguirà nella sua evoluzione con il ritmo che stiamo osservando, un interrogativo diventerà sempre più pressante: quanto è realmente anonimo ciò che pubblichiamo in rete?

Fonte: arXiv