Deepfake: come riconoscere foto e video falsi IA
09/10/2026
Distinguere un'immagine generata da un modello diffusivo da una fotografia autentica era, fino a pochi anni fa, un esercizio relativamente agevole per chiunque avesse qualche dimestichezza con la grafica digitale: le mani storpiate, i riflessi incongruenti negli occhi, le orecchie asimmetriche erano segnali quasi sempre leggibili. Nel 2026, quella soglia percettiva si è spostata in modo radicale, e i sistemi di generazione visiva — tanto per le immagini fisse quanto per i video sintetici — producono output che ingannano osservatori attenti, giornalisti esperti, e persino alcuni software di analisi forense. Riconoscere un deepfake oggi richiede un metodo, non soltanto un occhio allenato.
Il termine "deepfake" è entrato nel lessico comune con una connotazione prevalentemente legata alla manipolazione del volto in video pornografici o politici, ma la categoria tecnica è molto più ampia: comprende immagini sintetiche generate integralmente da modelli come Stable Diffusion, Midjourney o Firefly, video face-swapped prodotti con architetture encoder-decoder, cloni vocali abbinati a lip-sync artificiale, e ibridi in cui una ripresa reale viene alterata solo parzialmente — spesso la modifica più difficile da individuare. Capire con quale tipo di contenuto si ha a che fare è il primo passo per applicare la strategia di analisi corretta.
La diffusione di questi strumenti ha reso il problema strutturale: non si tratta di episodi isolati legati ad attori sofisticati, ma di un ecosistema in cui chiunque disponga di una connessione e di pochi dollari può produrre contenuti visivi falsi di qualità professionale. Le implicazioni toccano la disinformazione politica, le frodi finanziarie, il revenge porn, la manipolazione probatoria in sede legale, e la semplice erosione della fiducia nelle immagini come categoria epistemica. Riconoscere i falsi non è quindi una competenza accessoria, ma una forma di alfabetizzazione visiva ormai necessaria per chiunque lavori con contenuti digitali.
Artefatti visivi e anomalie strutturali nelle immagini sintetiche
Nonostante i progressi notevoli dei modelli generativi, l'analisi ravvicinata di un'immagine sintetica rivela ancora oggi una serie di incongruenze che derivano dal modo in cui questi sistemi apprendono la distribuzione statistica dei pixel, piuttosto che la fisica del mondo reale. Le superfici riflettenti — specchi, occhiali, occhi umani, superfici metalliche — tendono a mostrare riflessi che non corrispondono alla scena circostante: un errore che emerge perché il modello non "vede" la geometria dello spazio, ma interpola pattern appresi da milioni di immagini. La coerenza delle fonti luminose è un altro punto critico: in un'immagine autentica, le ombre rispettano la direzione della luce con precisione geometrica; nelle immagini sintetiche è frequente trovare ombre multiple, morbide in modo innaturale, o assenti in zone dove dovrebbero essere presenti.
Le texture ripetute — stoffe, pavimenti, sfondi architettonici — mostrano spesso pattern che si ripetono con una cadenza innaturale o, al contrario, che presentano variazioni casuali dove ci si aspetterebbe regolarità strutturale. Il testo all'interno delle immagini rimane uno degli indicatori più affidabili: insegne, etichette, scritte su magliette o targhe automobilistiche tendono a essere semanticamente incoerenti, con lettere deformate o sequenze illeggibili che assomigliano a testo ma non lo sono. Questa limitazione è intrinseca all'architettura dei modelli diffusivi, che non hanno un modulo linguistico integrato nella pipeline di rendering visivo, e si manifesta anche nei casi in cui la qualità generale dell'immagine è molto alta.
Indicatori specifici per i video deepfake
Nei video sintetici o manipolati con tecniche di face-swap, la coerenza temporale — cioè la continuità tra un fotogramma e l'altro — è il piano su cui i sistemi generativi mostrano le maggiori fragilità. Un volto autentico si muove nello spazio tridimensionale in modo che il modello di illuminazione cambia in modo continuo e fisicamente coerente; nei deepfake, è comune osservare una sorta di "stabilizzazione" artificiale del volto rispetto al corpo, con micromovimenti che non seguono la dinamica cranica naturale. Il bordo del volto — la linea di giunzione tra il volto sintetico e il collo o i capelli reali — è spesso l'area in cui la manipolazione è più visibile, specialmente nelle riprese con movimento rapido o in condizioni di illuminazione laterale intensa.
Il battito delle palpebre è stato a lungo citato come segnale diagnostico nei deepfake di prima generazione; i modelli attuali hanno in larga parte corretto questo difetto, ma permangono anomalie nei movimenti oculari più sottili: la saccade — il movimento rapido e scattante dell'occhio durante la lettura o la conversazione — è raramente replicata con fedeltà, e il punto di fissazione dello sguardo risulta spesso scollegato dal contesto narrativo della scena. Un ulteriore indicatore riguarda la sincronia audio-video: anche nei sistemi di lip-sync più avanzati, la corrispondenza tra il movimento labiale e il segnale acustico mostra latenze o imprecisioni articolatorie, specialmente nelle consonanti occlusive e nelle fricative, che richiedono movimenti facciali precisi e difficilmente interpolabili.
Strumenti di analisi forense e loro limiti operativi
L'analisi dell'Error Level Analysis (ELA) — tecnica che rileva differenze nei livelli di compressione JPEG all'interno di una stessa immagine — conserva una certa utilità per individuare montaggi fotografici tradizionali, ma si rivela sostanzialmente inefficace contro le immagini generate integralmente da modelli diffusivi, le quali non presentano discontinuità di compressione perché non derivano da una manipolazione di un file preesistente. Strumenti specializzati come FakeCatcher di Intel, basato sull'analisi del flusso sanguigno attraverso la fotopletismografia remota, o i classificatori neurali di Hive Moderation e Microsoft Video Authenticator, offrono risultati interessanti in condizioni controllate, ma la loro accuratezza degrada significativamente su contenuti compressi, ricodificati, o distribuiti attraverso piattaforme social che applicano ulteriori livelli di transcodifica.
Un problema metodologico rilevante è quello della corsa agli armamenti tra generatori e rilevatori: ogni nuovo classificatore addestrato su un dataset di deepfake spinge i ricercatori — e i malintenzionati — a raffinare i generatori per eludere quella specifica firma. I modelli di rilevamento addestrati su deepfake prodotti con architettura A mostrano tassi di errore elevati su deepfake prodotti con architettura B, anche quando la qualità percettiva è analoga. Per questo motivo, l'approccio più robusto non è quello di affidarsi a un singolo strumento, ma di combinare l'analisi algoritmica con la verifica contestuale: chi ha prodotto il contenuto, su quale piattaforma è apparso per la prima volta, esistono versioni precedenti dell'immagine indicizzate da motori di ricerca visiva come Google Lens o TinEye.
Metadati, provenienza e standard C2PA
La Coalition for Content Provenance and Authenticity (C2PA) ha definito uno standard tecnico — adottato nel 2026 da Adobe, Microsoft, Sony e diversi produttori di fotocamere — che incorpora nei file multimediali un manifest firmato crittograficamente, contenente informazioni sull'origine del contenuto, sulle modifiche applicate e sugli strumenti utilizzati. Quando un'immagine porta un manifest C2PA integro, è possibile verificare la catena di custodia del file con una precisione che nessuna analisi visiva potrà mai eguagliare; il problema è che la stragrande maggioranza dei contenuti che circolano sui social non porta questa firma, sia perché prodotti con strumenti che non la implementano, sia perché i metadati vengono sistematicamente rimossi dalle piattaforme durante il processo di upload e ottimizzazione.
L'analisi dei metadati EXIF rimane comunque un passaggio utile nella catena di verifica: un'immagine autentica scattata con una fotocamera digitale porta informazioni sul modello del dispositivo, sulle impostazioni di esposizione, sulla geolocalizzazione (se abilitata) e sul timestamp. Un'immagine generata con Midjourney o Dall-E non ha questi dati, o li ha in forma anomala — ad esempio con date di creazione che precedono l'esistenza del modello dichiarato, o con valori di esposizione fisicamente impossibili. La loro assenza non è di per sé prova di falsità — molte piattaforme rimuovono i metadati per ragioni di privacy — ma la loro presenza incoerente è un segnale da approfondire.
Approccio critico alla verifica: protocollo operativo
Prima di applicare qualsiasi strumento automatico, l'analisi di un contenuto sospetto dovrebbe partire dalla verifica contestuale: da dove proviene il contenuto, chi lo ha condiviso per primo, in quale momento è apparso rispetto agli eventi che pretende di documentare. La ricerca per immagine inversa — effettuata su Google Images, Bing Visual Search e Yandex, che spesso indicizza fonti non coperte dai competitor anglosassoni — permette di stabilire se l'immagine ha una storia documentabile o se è apparsa dal nulla in coincidenza con un evento specifico. Questo tipo di verifica, che non richiede competenze tecniche avanzate, elimina una quota significativa dei falsi più grossolani prima ancora di aprire qualsiasi strumento di analisi forense.
Per i contenuti che superano il primo livello di screening contestuale, il protocollo operativo prevede l'esportazione del file originale — non dello screenshot, che introduce ulteriori artefatti di compressione — e la sua analisi con almeno due strumenti indipendenti, confrontando i risultati e trattando come segnale rilevante solo le anomalie segnalate da entrambi. L'ingrandimento selettivo delle aree ad alto rischio — bordi del volto, occhi, mani, testo, superfici riflettenti — dovrebbe precedere qualsiasi lettura automatica, perché addestrare la percezione visiva su questi elementi aumenta la capacità di formulare ipotesi prima di delegare il giudizio all'algoritmo. Il risultato finale non è mai una certezza assoluta, ma una stima di probabilità che deve essere comunicata come tale, soprattutto in contesti editoriali o legali dove la certezza apparente può fare più danno del dubbio esplicito.
Articolo Precedente
Come creare GIF da video in pochi passaggi
Articolo Successivo
Installare un SSD nel PC: guida completa 2026
Autrice di articoli per blog, laureata in Psicologia con la passione per la scrittura e le guide How to