AI Hacking
Risorse per la sicurezza AI

OWASP Top 10 for LLM Applications 2025/2026

The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes

73%
Le distribuzioni di intelligenza artificiale presentano vulnerabilità critiche
(OWASP State of AI Security, 2025)
41%
L'AI aziendale ha API non autenticate
(CodeWall Research, 2025)
Virtually 100%
Iniezione rapida sfruttabile nelle distribuzioni LLM
(OWASP LLM Top 10, 2025)
⚠

Consapevolezza del rischio critico

Il Prompt Injection rimane la vulnerabilità n. 1. Consulta la nostra guida completa al prompt injection →

🔮

OWASP LLM Top 10 2026: What's Changing

The 2025 version is still the active standard, but the 2026 draft introduces significant changes:

  • NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
  • NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
  • NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
  • Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
  • Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks

Track OWASP LLM Top 10 2026 progress →

LLM01

Prompt Injection

Critical

Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.

Tipi di attacchi
  • Iniezione diretta: richieste di utenti malintenzionati che sovrascrivono le istruzioni del sistema
  • Indirect Injection: Hidden instructions in external documents, web content, or API responses
  • Manipolazione del contesto: sfruttare il contesto della conversazione per alterare il comportamento
  • Attacchi jailbreak: bypassare i filtri di sicurezza tramite suggerimenti creativi
Esempi di attacco
  • Ignore previous instructions and...
  • Testo incorporato in caratteri Unicode invisibili
  • Inserimento rapido tramite XSS archiviato nel contenuto web
  • DAN (Do Anything Now) style jailbreaks
Strategie di mitigazione
  • Implementa una rigorosa convalida e sanificazione dell'input
  • Utilizzare la separazione dei privilegi tra gli input dell'utente e il sistema suggerimenti
  • Applica il filtraggio dell'output prima di visualizzare i risultati
  • Monitoraggio dei modelli di iniezione nei log
  • Implementa una difesa approfondita con più livelli di sicurezza
LLM02

Divulgazione di informazioni sensibili

Critical

LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.

Tipi di attacchi
  • Estrazione dei dati di addestramento: recupero di dati sensibili dalla memoria del modello
  • Perdita di PII: esposizione di informazioni di identificazione personale
  • Esposizione chiave API/credenziali: rivelare segreti nelle risposte
  • Divulgazione della logica aziendale: esposizione di algoritmi o processi proprietari
Esempi di attacco
  • Estrazione di indirizzi email tramite prompt specifici
  • Rivelazione delle credenziali SQL nei messaggi di errore
  • Divulgazione delle informazioni personali del cliente dai dati di addestramento
  • Esporre i prompt del sistema interno
Strategie di mitigazione
  • Implementa filtri di input/output robusti
  • Applica pipeline di sanificazione dei dati
  • Applicare policy di disattivazione dell'utente per l'utilizzo dei dati
  • Utilizzare tecniche di privacy differenziali
  • Limitare l'accesso e la visibilità dei prompt del sistema
LLM03

Vulnerabilità della catena di fornitura

High

Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.

Tipi di attacchi
  • Tampering dei modelli: modelli preaddestrati compromessi
  • Vulnerabilità delle dipendenze PyPI/npm: librerie non sicure
  • Dati di ottimizzazione dannosi: set di dati di addestramento avvelenati
  • Fornitori API compromessi: servizi LLM non attendibili
Esempi di attacco
  • Pesi dei modelli backdoor da fonti non attendibili
  • Sfruttamento delle librerie di trasformatori vulnerabili
  • Dati di addestramento avvelenati con trigger nascosti
  • Archivio documenti RAG compromesso
Strategie di mitigazione
  • Verificare l'integrità del modello tramite checksum e firme
  • Mantieni SBOM (distinta materiali software)
  • Utilizza hub di modelli attendibili e verifica la provenienza
  • Scansiona le dipendenze per individuare vulnerabilità note
  • Implementare la gestione del ciclo di vita del modello
LLM04

Data and Model Poisoning

High

Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.

Tipi di attacchi
  • Training Data Poisoning: danneggiamento dei dati di training del modello
  • Perfezionamento dell'avvelenamento: inserimento di backdoor tramite perfezionamento
  • RAG Poisoning: contaminazione delle basi di conoscenza di recupero
  • Manipolazione di incorporamento: danneggiamento dei database vettoriali
Esempi di attacco
  • Inserimento di esempi distorti per alterare il comportamento del modello
  • Creazione di trigger backdoor nei dati di training
  • Avvelenamento di set di dati pubblici utilizzati per la formazione
  • Iniezione di informazioni false nei documenti RAG
Strategie di mitigazione
  • Verificare la provenienza dei dati e l'integrità della catena di fornitura
  • Implementa la convalida dei dati e il rilevamento delle anomalie
  • Utilizza pipeline di sanificazione dei dati
  • Applicare robuste misure di protezione ottimizzate
  • Monitorare la deviazione del comportamento del modello
LLM05

Gestione impropria dell'output

High

Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.

Tipi di attacchi
  • XSS tramite LLM Output: scripting cross-site dalle risposte del modello
  • SQL Injection: query dannose generate da LLM
  • Iniezione di comandi: LLM che genera comandi di sistema non sicuri
  • Path Traversal: LLM rivela o accesso a percorsi non autorizzati
Esempi di attacco
  • LLM che genera JavaScript che viene eseguito nel browser
  • Modello che genera query SQL dannose
  • Generazione di codice comprese chiamate di sistema non sicure
  • Divulgazione del percorso del file nelle risposte
Strategie di mitigazione
  • Implementa la convalida e la sanificazione dell'output
  • Utilizza il filtro dei contenuti sensibile al contesto
  • Applica gli stessi controlli di sicurezza degli input dell'utente
  • Output LLM sandbox prima dell'uso a valle
  • Abilita modalità di codifica sicure nella generazione del codice
LLM06

Agenzia eccessiva

High

Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.

Tipi di attacchi
  • Accesso illimitato alle funzioni: autorizzazioni API eccessive
  • Azione autonoma: esecuzione di azioni senza l'approvazione umana
  • Abuso di strumenti: sfruttamento di strumenti esterni integrati
  • Manipolazione della catena di pensiero: alterazione dei processi di ragionamento
Esempi di attacco
  • LLM con accesso API amministratore che esegue modifiche non autorizzate
  • Transazioni finanziarie con esecuzione automatica
  • Eliminazione di risorse senza conferma
  • Manipolazione dei dati utente senza consenso
Strategie di mitigazione
  • Implementare controlli di accesso con privilegi minimi
  • Richiedere l'intervento umano per azioni critiche
  • Applica la limitazione della velocità a operazioni sensibili
  • Registra e monitora tutte le azioni autonome
  • Utilizza limitazioni di ambito per l'accesso allo strumento
LLM07

Perdite di prompt del sistema

Medium

Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.

Tipi di attacchi
  • Estrazione diretta dei prompt: ingegneria sociale per rivelare i prompt
  • Overflow del contesto: tecniche di overflow per esporre i messaggi di sistema
  • Sfruttamento del gioco di ruolo: ingannare LLM per rivelare istruzioni
  • Perdite di log: esposizione di prompt in log o errori
Esempi di attacco
  • Chiedere a LLM di ripetere il "testo precedente" per estrarre il prompt del sistema
  • Utilizzo dell'overflow della finestra di contesto per ignorare l'analisi delle istruzioni
  • Inserimento rapido per sovrascrivere il ruolo di sistema
  • Trovare richieste nei registri dell'applicazione
Strategie di mitigazione
  • Offuscare i prompt di sistema ove possibile
  • Implementare tecniche di isolamento tempestivo
  • Utilizzare un'elaborazione separata per istruzioni sensibili
  • Monitora i tentativi di estrazione dei prompt
  • Applica un rigoroso filtraggio dei log
LLM08

Debolezze di vettori e incorporamento

Medium

Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.

Tipi di attacchi
  • RAG Injection: contenuti dannosi nei documenti recuperati
  • Compromesso DB vettoriale: attacco allo storage vettoriale
  • Estrazione dell'incorporamento: furto di rappresentazioni di incorporamento
  • Manipolazione del contesto: risultati di recupero danneggiati
Esempi di attacco
  • Documenti avvelenati recuperati come risultati principali
  • Accesso non autorizzato al database vettoriale
  • Estrazione dei dati di addestramento dagli incorporamenti
  • Manipolazione del recupero tramite attacchi di incorporamento
Strategie di mitigazione
  • Convalida e disinfetta tutti i documenti di input RAG
  • Implementare controlli di accesso al database vettoriale
  • Utilizza la crittografia incorporata ove disponibile
  • Applica riclassificazione con filtri di sicurezza
  • Monitora il recupero per anomalie
LLM09

Disinformazione

Medium

LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.

Tipi di attacchi
  • Allucinazioni: Risultati certi ma falsi
  • Errori reali: informazioni errate presentate come fatti
  • Amplificazione dei bias: rafforzamento dei bias esistenti
  • Manipolazione: output deliberatamente fuorvianti
Esempi di attacco
  • Citazione di documenti di ricerca inesistenti
  • Fornire consulenza medica errata
  • Generazione di raccomandazioni di assunzione distorte
  • Creazione di notizie o recensioni false
Strategie di mitigazione
  • Implementare pipeline di verifica dei fatti
  • Utilizza punteggio di confidenza e stima dell'incertezza
  • Applica la verifica della fonte per output critici
  • Aggiungi provenienza e attribuzione dei contenuti
  • Etichetta chiaramente i contenuti generati dall'intelligenza artificiale
LLM10

Consumo illimitato

Medium

Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.

Tipi di attacchi
  • Abuso del tasso API: chiamate API eccessive che esauriscono le quote
  • Esaurimento delle risorse: massimizzare le risorse di elaborazione
  • Sfruttamento dei costi: abuso del pagamento per token che comporta addebiti
  • Attacchi di inferenza: estrazione del modello tramite query eccessive
Esempi di attacco
  • Attacchi automatizzati che consumano l'intera quota API
  • Spam di prompt di lunghezza massima che causa l'esaurimento del calcolo
  • Estrazione del modello tramite milioni di query
  • I prompt ricorsivi eseguono loop che consumano risorse
Strategie di mitigazione
  • Implementazione di limiti e quote rigorosi
  • Aggiungi limiti token di input/output
  • Monitora i modelli di utilizzo per individuare anomalie
  • Utilizzare controlli sui costi e avvisi di budget
  • Applica controlli di timeout su operazioni di lunga durata

OWASP Testing Framework

Segui questo approccio strutturato per testare ciascuna vulnerabilità:

1. Ricognizione

  • Mappatura dell'architettura del sistema e del flusso di dati
  • Identificazione dei punti di input e delle interfacce API
  • Strumenti e plugin integrati nei documenti
  • Esamina i prompt e la configurazione del sistema

2. Mappatura delle vulnerabilità

  • Testare ogni categoria OWASP sistematicamente
  • Superficie di attacco dei documenti e punti di ingresso
  • Identificare i meccanismi di difesa in atto
  • Mappa dipendenze e servizi di terze parti

3. Sfruttamento

  • Condurre attacchi proof-of-concept
  • Sfruttabilità e impatto dei documenti
  • Concatenamento multiplo di test vulnerabilità
  • Valutare la fattibilità di un attacco nel mondo reale

4. Segnalazione

  • Dare priorità ai risultati in base al livello di rischio
  • Fornire consigli di risoluzione
  • Includi codice proof-of-concept
  • Suggerisci miglioramenti difensivi

Risorse ufficiali

Sorgenti e statistiche

AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.