AI Hacking
Risorse per la sicurezza AI

AI Red Teaming: guida metodologica completa

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • Tempo di lettura: ~15 minuti

Cos'è AI Red Teaming?

Il red teaming dell'AI è la pratica of Attacchi deliberati e sistematici ai sistemi di intelligenza artificiale to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

Prompt Injection

Manipulating AI behavior through malicious inputs that override system instructions

Jailbreak

Aggirare le misure di sicurezza per generare contenuti vietati

Estrazione dei dati

Estrazione di informazioni sensibili da dati o output di addestramento

Manipolazione del modello

Alterazione del comportamento del modello tramite avvelenamento o attacchi di messa a punto

Perché il Red Teaming dell'intelligenza artificiale è importante nel 2026

  • 180% increase in LLM-related security incidents (2025)
  • Il team rosso AI di Microsoft ha valutato Più di 100 prodotti GenAI e ho scoperto che molti errori di grande impatto provengono da tecniche semplici
  • I sistemi di intelligenza artificiale gestiscono sempre più Dati sensibili e decisioni critiche
  • Mandato relativo ai requisiti normativi (legge sull'intelligenza artificiale dell'UE) Test di sicurezza dell'intelligenza artificiale per sistemi ad alto rischio

Creazione di un Red Team AI

Competenze richieste

Competenze tecniche

  • Comprensione dell'architettura LLM
  • Conoscenza ingegneristica tempestiva
  • Sicurezza delle applicazioni Web
  • Test di sicurezza API
  • Scripting (Python, bash)

Capacità antagoniste

  • Risoluzione dei problemi creativi
  • Consapevolezza dell'ingegneria sociale
  • Pensamento di attacco multimodale
  • Ricerca e ricognizione
  • Documentazione e reporting

Conoscenza del dominio

  • OWASP LLM Top 10
  • Framework MITRE ATLAS
  • Fondamenti di AI/ML
  • Etica e divulgazione responsabile
  • Rischi specifici del settore

Modelli di coinvolgimento

Modello Descrizione Pro Contro
Team interno Squadra rossa interna dedicata Conoscenza approfondita del prodotto, test continui Potrebbe perdere la prospettiva esterna
Consulente esterno Società di sicurezza di terze parti Nuova prospettiva, competenze specializzate Costi più elevati, curva di apprendimento
Ibrido Collaborazione interna + esterna Il meglio di entrambi i mondi Carico di coordinamento
Automatizzato Test integrati CI/CD Continua, scalabile Limitata a modelli noti

Fase 1: ricognizione e scoperta

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 Mappatura del sistema

  • Revisione dell'architettura: Comprendi come l'intelligenza artificiale si integra con altri sistemi
  • Flusso di dati: Mappa il modo in cui i dati si spostano nel sistema
  • Endpoint API: Identifica tutte le interfacce esposte
  • Integrazioni di terze parti: Documenta i servizi esterni
  • Ruoli utente: Comprendi i diversi livelli di accesso

1.2 Sondaggio delle capacità

  • Funzionalità del modello: Cosa può fare l'intelligenza artificiale?
  • Accesso agli strumenti: Quali funzioni può invocare?
  • Accesso ai dati: Quali informazioni può recuperare?
  • Canali di output: Come comunica?
  • Gestione dello stato: Come gestisce le sessioni?

Tecniche chiave

  • Estrazione del prompt del sistema: Tentativo di rivelare istruzioni di sistema attraverso un'attenta richiesta
  • Model Fingerprinting: Identifica il modello sottostante attraverso modelli di comportamento
  • Rilevamento API: Trova endpoint nascosti o non documentati
  • Revisione della documentazione: Analizza documenti pubblici per i dettagli di implementazione

Fase 2: mappatura delle vulnerabilità

Identify and categorize potential attack vectors based on the discovered attack surface.

Tassonomia degli attacchi

Prompt Injection

  • Iniezione diretta
  • Iniezione indiretta
  • Manipolazione multi-turno
  • Overflow del contesto

Attacchi jailbreak

  • Role-playing (DAN)
  • Fonsonazione dei caratteri
  • Framing di autorizzazione
  • Bypass della codifica

Estrazione dei dati

  • Training data recovery
  • Perdita di prompt del sistema
  • Accesso alla cronologia delle conversazioni
  • Esposizione della chiave API

Denial of Service

  • Esaurimento delle risorse
  • Overflow del contesto
  • Manipolazione dei modelli
  • Blocco/arresto anomalo del sistema

Abuso di strumenti/funzioni

  • Chiamate API non autorizzate
  • Manipolazione dei parametri
  • Concatenamento di funzioni
  • Escalation di privilegi

Attacchi multimodali

  • Iniezione basata su immagini
  • Manipolazione dell'audio
  • Exploit intermodali
  • Contenuto incorporato

Attacchi modello

  • Esempi contraddittori
  • Inversione del modello
  • Inferenza dell'appartenenza
  • Estrazione di modelli

Catena di fornitura

  • Avvelenamento da dipendenze
  • Compromissione dell'hub del modello
  • Dati di addestramento avvelenati
  • Rischi di terze parti

Fase 3: sfruttamento

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

Metodologia di sfruttamento

  1. Assegnazione prioritaria: Classifica le vulnerabilità in base alla gravità e alla sfruttabilità
  2. Prova di concetto: Sviluppa exploit funzionanti per ogni vulnerabilità
  3. Valutazione dell'impatto: Determinare le conseguenze nel mondo reale di uno sfruttamento riuscito
  4. Concatenamento: Verifica se è possibile combinare più vulnerabilità per ottenere un impatto maggiore
  5. Documentazione: Registra tutti i tentativi di sfruttamento, i successi e i fallimenti

Lezioni di Microsoft Red Team

Sulla base del test di oltre 100 prodotti GenAI, il team rosso AI di Microsoft ha scoperto:

  • Tecniche semplici funzionano: Molti errori di grande impatto derivano dalle richieste di jailbreak di base
  • Il pensiero a livello di sistema è importante: Le vulnerabilità spesso si estendono su più componenti
  • La creatività umana vince: Gli strumenti automatizzati trovano modelli noti; gli esseri umani trovano nuovi attacchi
  • Il test continuo è essenziale: Le nuove funzionalità introducono nuove superfici di attacco

Fase 4: test di persistenza

Test whether attack effects persist beyond the initial interaction and can survive system resets.

Persistenza della sessione

  • La manipolazione sopravvive all'aggiornamento della sessione?
  • Lo stato può essere precaricato in nuove sessioni?
  • Ci sono effetti persistenti dai prompt precedenti?

Persistenza del modello

  • Gli attacchi possono influenzare i futuri aggiornamenti dei modelli?
  • L'ottimizzazione preserva le vulnerabilità?
  • Gli attacchi velenosi sono permanenti?

Persistenza del sistema

  • Le vulnerabilità possono sopravvivere agli aggiornamenti?
  • Esistono meccanismi backdoor?
  • Gli attacchi persistono tra le distribuzioni?

Approfondimento sugli strumenti

Garak

Lo scanner di vulnerabilità LLM open source di NVIDIA

  • Sonda per oltre 40 tipi di vulnerabilità
  • Valutazione continua del modello
  • Aggiornamenti regolari del database delle vulnerabilità
  • Integrazione con pipeline CI/CD
Visualizza su GitHub →

PyRIT

Strumento di identificazione dei rischi Python di Microsoft

  • Framework completo del Red Team
  • Supporto per superfici di attacco multiple
  • Generazione di attacchi automatizzata
  • Punteggio e valutazione
Visualizza su GitHub →

Promptfoo

Piattaforma di test e valutazione LLM

  • Framework di test rapidi
  • Valutazione della sicurezza
  • Benchmark delle prestazioni
  • Confronto delle versioni
Visualizza il sito web →

Rebuff

SDK di rilevamento rapido dell'iniezione

  • Rilevamento dei tentativi di injection
  • Difesa multilivello
  • Basso tasso di falsi positivi
  • Integrazione semplice
Visualizza su GitHub →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

Punti di integrazione della pipeline

1. Pre-impegno

  • Convalida prompt locale
  • Rilevamento di injection basato su pattern
  • Test della workstation dello sviluppatore

2. Pull Request

  • Scansione automatizzata delle vulnerabilità
  • Confronto di base
  • Applicazione del gate di sicurezza

3. Pre-produzione

  • Valutazione completa del team rosso
  • Test di regressione
  • Benchmark delle prestazioni

4. Produzione

  • Monitoraggio continuo
  • Rilevamento di anomalie
  • Integrazione della risposta agli incidenti

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

Quadro di valutazione della gravità

Gravità Criteri Esempio
Critico Esecuzione di codice in remoto, violazione dei dati, compromissione del sistema Iniezione completa tempestiva che porta a RCE
Alto Accesso non autorizzato, esposizione di dati sensibili Estrazione dei prompt del sistema
Media Aggiramento delle policy, accesso limitato ai dati Bypassare il filtro dei contenuti
Basso Violazioni minori delle policy, informative Formato di output non intenzionale

Metodi di valutazione

LLM-as-Judge

Utilizzare l'intelligenza artificiale per valutare i risultati dell'intelligenza artificiale per la sicurezza e la conformità alle policy

Valutazione umana

Revisione esperta degli output per una valutazione della sicurezza articolata

Punteggio automatizzato

Corrispondenza di modelli e valutazione basata su regole

Metriche del Red Team

Traccia tasso di successo di sfruttamento, tasso di falsi positivi

Architettura di riparazione

Livelli di difesa

1. Filtraggio dell'input

  • Rilevamento rapido dei pattern
  • Riconoscimento della codifica
  • Limiti di lunghezza
  • Limitazione della velocità

2. Guardrail

  • Convalida dell'output
  • Filtraggio dei contenuti
  • Politiche di utilizzo degli strumenti
  • Controlli di accesso

3. Potenziamento del modello

  • Ottimizzazione per la sicurezza
  • Miglioramenti RLHF
  • Ingegneria del prompt del sistema
  • Ottimizzazione della temperatura/top-p

4. Progettazione del sistema

  • Separazione dei privilegi
  • Human-in-the-loop
  • Logging e monitoraggio
  • Risposta agli incidenti

Test di convalida

Dopo aver implementato le correzioni, ripetere il test per verificare:

  • Le vulnerabilità originali non sono più sfruttabili
  • Le correzioni non introducono nuove vulnerabilità
  • La funzionalità del sistema rimane intatta
  • Le prestazioni sono accettabili
  • I tassi di falsi positivi sono gestibili

Modello di reporting

Riepilogo esecutivo

  • Ambito e obiettivi
  • Panoramica dei risultati principali
  • Riepilogo della valutazione del rischio
  • Consigli prioritari

Dettagli tecnici

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • Screenshot e registri
  • Diagrammi della catena di attacco
  • Frammenti di codice

Consigli

  • Correzioni a breve termine (vittorie rapide)
  • Miglioramenti a medio termine
  • Modifiche all'architettura a lungo termine
  • Requisiti di risorse
  • Cronologia

Appendici

  • Output dello strumento
  • Casi di test utilizzati
  • Riferimenti
  • Glossario

Considerazioni etiche

Autorizzazione

Always obtain explicit written permission before testing. Document scope boundaries.

Confini dell'ambito

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

Gestione dei dati

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

Divulgazione responsabile

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

Pronto per saperne di più?

Continua a esplorare gli argomenti relativi alla sicurezza dell'intelligenza artificiale.

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.