Blog

Attacchi Hacker su A.I

Attacchi hacker contro i sistemi di Intelligenza Artificiale: statistiche, casi

I Pericoli degli Attacchi Hacker sull'Intelligenza Artificiale


L'Intelligenza Artificiale è ormai integrata in chatbot, assistenti virtuali, motori di ricerca, agenti aziendali e sistemi di supporto decisionale. Questa diffusione ha aperto la strada a una nuova generazione di attacchi informatici, pensati per colpire proprio i modelli AI e le infrastrutture che li circondano. I numeri più recenti mostrano che non è un rischio teorico, ma un fenomeno già in corso su scala globale, che nel 2026 ha raggiunto un salto di qualità: non sono più solo gli hacker ad attaccare l'AI, ma è l'AI stessa a diventare, in mano ai criminali, lo strumento che sferra l'attacco.

📊 1) I numeri del fenomeno

Secondo il Threat Hunting Report 2026 di CrowdStrike, ripreso da ANSA, nel 2026 vengono registrate circa 200.000 richieste malevole contro strumenti aziendali di Intelligenza Artificiale ogni due minuti, con l'88% delle vulnerabilità note sfruttate entro 48 ore dalla loro scoperta. Gli attacchi orchestrati da agenti automatizzati crescono a un ritmo 2,5 volte superiore rispetto alle intrusioni condotte manualmente da esseri umani.

Anche il fronte dei deepfake è in forte crescita: secondo il Gartner Identity & Access Management Summit (settembre 2025), il 62% delle organizzazioni ha subito almeno un attacco basato su deepfake nei 12 mesi precedenti. Negli Stati Uniti, l'FBI ha aperto nel 2025 la sua prima categoria di reato dedicata ai crimini basati su AI, registrando oltre 22.000 segnalazioni e quasi 893 milioni di dollari di danni.

A confermare la portata del fenomeno è arrivato, nel settembre 2026, il report di Anthropic che descrive il primo caso documentato di campagna di cyberspionaggio su larga scala orchestrata quasi interamente da un'Intelligenza Artificiale: un gruppo sponsorizzato da uno stato ha usato il modello Claude per eseguire in autonomia tra l'80% e il 90% delle attività dell'attacco contro circa 30 organizzazioni di alto profilo, tra istituti finanziari ed enti governativi, riducendo drasticamente il lavoro manuale richiesto agli operatori umani.

🚨 2) Casi reali documentati

Non si tratta solo di statistiche: negli ultimi anni sono stati documentati diversi attacchi reali contro sistemi AI di grandi produttori, e la loro gravità è cresciuta di pari passo con la diffusione degli agenti autonomi.

  • Bing Chat (Microsoft): uno studente di Stanford, Kevin Liu, è riuscito con un semplice prompt ("ignora le istruzioni precedenti") a far rivelare al chatbot le istruzioni di sistema nascoste, dimostrando quanto sia fragile il confine tra istruzioni interne e input dell'utente.
  • Google Gemini Advanced: nel 2025 il ricercatore di sicurezza Johann Rehberger ha dimostrato come fosse possibile indurre Gemini a memorizzare informazioni false per le conversazioni future, nascondendo istruzioni invisibili all'interno di un documento condiviso.
  • ChatGPT e i "memory leak": alcuni ricercatori hanno scoperto che era possibile creare archivi di storage con logging attivo per esfiltrare, tramite immagini Markdown invisibili, cronologie di chat e memorie private, con impatto potenziale su milioni di utenti.
  • Google Jules (agente di coding AI): un ricercatore ha ricostruito una "AI Kill Chain" completa, partendo da una semplice prompt injection fino ad arrivare al controllo remoto dell'agente, sfruttando la sua connessione a Internet non sufficientemente limitata.
  • EchoLeak su Microsoft 365 Copilot (CVE-2025-32711): la vulnerabilità più significativa del 2025, con CVSS 9.3. Un'email apparentemente innocua, contenente istruzioni nascoste in testo bianco su sfondo bianco o in commenti HTML, era sufficiente a far esfiltrare a Copilot dati aziendali riservati verso un server controllato dall'attaccante, senza alcuna interazione da parte della vittima: il primo caso reale di prompt injection "zero-click" sfruttato per un'esfiltrazione concreta di dati in un sistema AI in produzione.
  • Claude e il cyberspionaggio autonomo (Anthropic, settembre 2026): un gruppo di attacco sponsorizzato da uno stato ha manipolato l'agente AI facendogli credere di lavorare per un'azienda di cybersecurity legittima impegnata in test difensivi, suddividendo l'attacco in tanti micro-compiti apparentemente innocui. Il modello ha così scritto codice di exploit, effettuato ricognizione delle reti bersaglio ed esfiltrato dati quasi senza supervisione umana diretta.

🔑 3) Il framework OWASP Top 10 per le applicazioni LLM

Per dare ordine a queste minacce, la community internazionale OWASP pubblica ogni anno la Top 10 for LLM Applications, un punto di riferimento gratuito per chi sviluppa applicazioni basate su Intelligenza Artificiale. Nell'edizione 2025 la classifica comprende:

  • LLM01 – Prompt Injection: al primo posto per la seconda edizione consecutiva; nasce dal fatto che i modelli elaborano istruzioni e dati nello stesso canale, senza una separazione netta.
  • LLM02 – Sensitive Information Disclosure: esposizione involontaria di dati sensibili nelle risposte del modello.
  • LLM03 – Supply Chain Vulnerabilities: vulnerabilità introdotte da modelli, dataset o librerie di terze parti compromessi.
  • LLM04 – Data and Model Poisoning: alterazione dei dati di addestramento o fine-tuning per condizionare il comportamento del modello.
  • LLM05 – Improper Output Handling: output del modello usato senza validazione in altri sistemi, con rischio di code injection o XSS a valle.
  • LLM06 – Excessive Agency: agenti AI con permessi, strumenti o autonomia eccessivi rispetto al compito richiesto.
  • LLM07 – System Prompt Leakage: divulgazione delle istruzioni di sistema, che possono rivelare logiche interne o segreti operativi.
  • LLM08 – Vector and Embedding Weaknesses: debolezze nei database vettoriali usati dai sistemi RAG (Retrieval-Augmented Generation).
  • LLM09 – Misinformation: contenuti errati ma prodotti con sicurezza, che l'utente rischia di trattare come veritieri.
  • LLM10 – Unbounded Consumption: abuso delle risorse computazionali, con impatti su costi, latenza e disponibilità del servizio.

🔐 4) Le principali tecniche usate dagli hacker

  • Prompt Injection: istruzioni malevole nascoste in un messaggio, un documento o una pagina web, che inducono il modello a ignorare le regole di sicurezza previste. Può essere diretta, quando l'utente stesso la digita, o indiretta, quando il modello la incontra leggendo contenuti esterni non fidati (come nel caso di EchoLeak).
  • Data e Model Poisoning: alterazione dei dati di addestramento o di fine-tuning, per condizionare il comportamento del modello o inserire vulnerabilità nascoste.
  • Furto di dati sensibili: modelli mal configurati che rivelano, nelle risposte, informazioni riservate che non dovrebbero mai essere esposte.
  • Abuso di agenti AI autonomi: agenti con permessi eccessivi (accesso a email, file, API) vengono dirottati per compiere azioni non autorizzate senza supervisione umana, come dimostrato dal caso Claude/Anthropic.
  • Deepfake e voice cloning: audio e video sintetici usati per truffe, furto d'identità e frodi biometriche, ormai responsabili di circa il 6,5% di tutti i tentativi di frode globali.
  • Abuso delle risorse (Unbounded Consumption): chiamate ripetute e incontrollate al modello, che generano costi eccessivi o negano il servizio agli utenti legittimi.
  • Jailbreak "a più passi": tecniche che frammentano un obiettivo malevolo in tante richieste innocue in apparenza, ciascuna accettabile singolarmente, ma che sommate aggirano i filtri di sicurezza — la stessa logica usata nell'attacco descritto da Anthropic.

🎯 5) MITRE ATLAS: la mappa degli attacchi all'Intelligenza Artificiale

Accanto a OWASP, un altro riferimento fondamentale per i team di sicurezza è MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems), una base di conoscenza pubblica che cataloga tattiche, tecniche e casi reali di attacco contro i sistemi AI, sul modello del più noto framework MITRE ATT&CK dedicato all'IT tradizionale.

Nella versione 5.1.0 (novembre 2025), ATLAS raccoglie 16 tattiche, 84 tecniche, 56 sotto-tecniche, 32 mitigazioni e ben 42 casi di studio reali, che coprono l'intero ciclo di vita di un sistema AI: dalla raccolta e avvelenamento dei dati di addestramento, fino all'evasione dei controlli in fase di utilizzo e al furto del modello stesso (model stealing). Per i team che sviluppano o difendono applicazioni AI, ATLAS offre uno strumento pratico per strutturare il threat modeling in modo specifico per il machine learning, cosa che i framework di sicurezza tradizionali non erano in grado di fare.

💰 6) L'impatto economico

I danni non sono solo di immagine. Le frodi basate su deepfake hanno superato, a livello globale, i 2,19 miliardi di dollari di perdite documentate, di cui circa 1,65 miliardi solo nel 2025. Nello stesso periodo, il numero di deepfake video e audio in circolazione è passato da circa 500.000 nel 2023 a una stima di 8 milioni nel 2025: una crescita che rende sempre più difficile distinguere contenuti autentici da contenuti generati artificialmente.

A questo si aggiunge un costo meno visibile ma altrettanto concreto: la riduzione del "costo di ingresso" per condurre attacchi complessi. Come sottolineato dallo stesso report Anthropic, le capacità cybersecurity dei modelli AI hanno di fatto azzerato il divario di competenze e strumenti che un tempo separava le operazioni sponsorizzate da uno stato, ben finanziate, da quelle di un singolo operatore con risorse limitate.

🛡️ 7) Come proteggersi

  • Separare in modo netto le istruzioni di sistema dall'input fornito dall'utente, evitando che un prompt esterno possa sovrascrivere le regole del modello.
  • Validare e sanificare sempre l'output generato dall'AI prima di usarlo in altri sistemi (codice, email, comandi automatici).
  • Applicare il principio del minimo privilegio agli agenti AI, limitando l'accesso a dati, API e connessioni di rete solo a ciò che è strettamente necessario.
  • Monitorare in modo continuo i log e il traffico generato dai sistemi AI, per individuare comportamenti anomali il prima possibile, incluse sequenze di richieste apparentemente innocue ma sospette se lette insieme.
  • Adottare framework di riferimento come OWASP Top 10 for LLM e MITRE ATLAS per strutturare test di sicurezza (red teaming) mirati sui sistemi AI, prima e dopo il rilascio.
  • Formare dipendenti e utenti a riconoscere i segnali tipici di deepfake, phishing e social engineering potenziati dall'AI.

🔍 8) Vuoi saperne di più?

Nella sezione dedicata alla sicurezza informatica applicata all'Intelligenza Artificiale trovi approfondimenti su queste minacce, sui framework di riferimento come OWASP e MITRE ATLAS, e sulle contromisure concrete da adottare per proteggere applicazioni e agenti basati su AI.

Scopri di più su Hacking A.I. →

Livio Bollini
Walter Livio Bollini

Matematico & Informatico · Intelligenza Artificiale · Sviluppo Web