AI Red Teaming: guida metodologica completa
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • Tempo di lettura: ~15 minuti
Cos'è AI Red Teaming?
Il red teaming dell'AI è la pratica of Attacchi deliberati e sistematici ai sistemi di intelligenza artificiale to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
Prompt Injection
Manipulating AI behavior through malicious inputs that override system instructions
Jailbreak
Aggirare le misure di sicurezza per generare contenuti vietati
Estrazione dei dati
Estrazione di informazioni sensibili da dati o output di addestramento
Manipolazione del modello
Alterazione del comportamento del modello tramite avvelenamento o attacchi di messa a punto
Perché il Red Teaming dell'intelligenza artificiale è importante nel 2026
- 180% increase in LLM-related security incidents (2025)
- Il team rosso AI di Microsoft ha valutato Più di 100 prodotti GenAI e ho scoperto che molti errori di grande impatto provengono da tecniche semplici
- I sistemi di intelligenza artificiale gestiscono sempre più Dati sensibili e decisioni critiche
- Mandato relativo ai requisiti normativi (legge sull'intelligenza artificiale dell'UE) Test di sicurezza dell'intelligenza artificiale per sistemi ad alto rischio
Creazione di un Red Team AI
Competenze richieste
Competenze tecniche
- Comprensione dell'architettura LLM
- Conoscenza ingegneristica tempestiva
- Sicurezza delle applicazioni Web
- Test di sicurezza API
- Scripting (Python, bash)
Capacità antagoniste
- Risoluzione dei problemi creativi
- Consapevolezza dell'ingegneria sociale
- Pensamento di attacco multimodale
- Ricerca e ricognizione
- Documentazione e reporting
Conoscenza del dominio
- OWASP LLM Top 10
- Framework MITRE ATLAS
- Fondamenti di AI/ML
- Etica e divulgazione responsabile
- Rischi specifici del settore
Modelli di coinvolgimento
| Modello | Descrizione | Pro | Contro |
|---|---|---|---|
| Team interno | Squadra rossa interna dedicata | Conoscenza approfondita del prodotto, test continui | Potrebbe perdere la prospettiva esterna |
| Consulente esterno | Società di sicurezza di terze parti | Nuova prospettiva, competenze specializzate | Costi più elevati, curva di apprendimento |
| Ibrido | Collaborazione interna + esterna | Il meglio di entrambi i mondi | Carico di coordinamento |
| Automatizzato | Test integrati CI/CD | Continua, scalabile | Limitata a modelli noti |
Fase 1: ricognizione e scoperta
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 Mappatura del sistema
- Revisione dell'architettura: Comprendi come l'intelligenza artificiale si integra con altri sistemi
- Flusso di dati: Mappa il modo in cui i dati si spostano nel sistema
- Endpoint API: Identifica tutte le interfacce esposte
- Integrazioni di terze parti: Documenta i servizi esterni
- Ruoli utente: Comprendi i diversi livelli di accesso
1.2 Sondaggio delle capacità
- Funzionalità del modello: Cosa può fare l'intelligenza artificiale?
- Accesso agli strumenti: Quali funzioni può invocare?
- Accesso ai dati: Quali informazioni può recuperare?
- Canali di output: Come comunica?
- Gestione dello stato: Come gestisce le sessioni?
Tecniche chiave
- Estrazione del prompt del sistema: Tentativo di rivelare istruzioni di sistema attraverso un'attenta richiesta
- Model Fingerprinting: Identifica il modello sottostante attraverso modelli di comportamento
- Rilevamento API: Trova endpoint nascosti o non documentati
- Revisione della documentazione: Analizza documenti pubblici per i dettagli di implementazione
Fase 2: mappatura delle vulnerabilità
Identify and categorize potential attack vectors based on the discovered attack surface.
Tassonomia degli attacchi
Prompt Injection
- Iniezione diretta
- Iniezione indiretta
- Manipolazione multi-turno
- Overflow del contesto
Attacchi jailbreak
- Role-playing (DAN)
- Fonsonazione dei caratteri
- Framing di autorizzazione
- Bypass della codifica
Estrazione dei dati
- Training data recovery
- Perdita di prompt del sistema
- Accesso alla cronologia delle conversazioni
- Esposizione della chiave API
Denial of Service
- Esaurimento delle risorse
- Overflow del contesto
- Manipolazione dei modelli
- Blocco/arresto anomalo del sistema
Abuso di strumenti/funzioni
- Chiamate API non autorizzate
- Manipolazione dei parametri
- Concatenamento di funzioni
- Escalation di privilegi
Attacchi multimodali
- Iniezione basata su immagini
- Manipolazione dell'audio
- Exploit intermodali
- Contenuto incorporato
Attacchi modello
- Esempi contraddittori
- Inversione del modello
- Inferenza dell'appartenenza
- Estrazione di modelli
Catena di fornitura
- Avvelenamento da dipendenze
- Compromissione dell'hub del modello
- Dati di addestramento avvelenati
- Rischi di terze parti
Fase 3: sfruttamento
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
Metodologia di sfruttamento
- Assegnazione prioritaria: Classifica le vulnerabilità in base alla gravità e alla sfruttabilità
- Prova di concetto: Sviluppa exploit funzionanti per ogni vulnerabilità
- Valutazione dell'impatto: Determinare le conseguenze nel mondo reale di uno sfruttamento riuscito
- Concatenamento: Verifica se è possibile combinare più vulnerabilità per ottenere un impatto maggiore
- Documentazione: Registra tutti i tentativi di sfruttamento, i successi e i fallimenti
Lezioni di Microsoft Red Team
Sulla base del test di oltre 100 prodotti GenAI, il team rosso AI di Microsoft ha scoperto:
- Tecniche semplici funzionano: Molti errori di grande impatto derivano dalle richieste di jailbreak di base
- Il pensiero a livello di sistema è importante: Le vulnerabilità spesso si estendono su più componenti
- La creatività umana vince: Gli strumenti automatizzati trovano modelli noti; gli esseri umani trovano nuovi attacchi
- Il test continuo è essenziale: Le nuove funzionalità introducono nuove superfici di attacco
Fase 4: test di persistenza
Test whether attack effects persist beyond the initial interaction and can survive system resets.
Persistenza della sessione
- La manipolazione sopravvive all'aggiornamento della sessione?
- Lo stato può essere precaricato in nuove sessioni?
- Ci sono effetti persistenti dai prompt precedenti?
Persistenza del modello
- Gli attacchi possono influenzare i futuri aggiornamenti dei modelli?
- L'ottimizzazione preserva le vulnerabilità?
- Gli attacchi velenosi sono permanenti?
Persistenza del sistema
- Le vulnerabilità possono sopravvivere agli aggiornamenti?
- Esistono meccanismi backdoor?
- Gli attacchi persistono tra le distribuzioni?
Approfondimento sugli strumenti
Garak
Lo scanner di vulnerabilità LLM open source di NVIDIA
- Sonda per oltre 40 tipi di vulnerabilità
- Valutazione continua del modello
- Aggiornamenti regolari del database delle vulnerabilità
- Integrazione con pipeline CI/CD
PyRIT
Strumento di identificazione dei rischi Python di Microsoft
- Framework completo del Red Team
- Supporto per superfici di attacco multiple
- Generazione di attacchi automatizzata
- Punteggio e valutazione
Promptfoo
Piattaforma di test e valutazione LLM
- Framework di test rapidi
- Valutazione della sicurezza
- Benchmark delle prestazioni
- Confronto delle versioni
Rebuff
SDK di rilevamento rapido dell'iniezione
- Rilevamento dei tentativi di injection
- Difesa multilivello
- Basso tasso di falsi positivi
- Integrazione semplice
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
Punti di integrazione della pipeline
1. Pre-impegno
- Convalida prompt locale
- Rilevamento di injection basato su pattern
- Test della workstation dello sviluppatore
2. Pull Request
- Scansione automatizzata delle vulnerabilità
- Confronto di base
- Applicazione del gate di sicurezza
3. Pre-produzione
- Valutazione completa del team rosso
- Test di regressione
- Benchmark delle prestazioni
4. Produzione
- Monitoraggio continuo
- Rilevamento di anomalie
- Integrazione della risposta agli incidenti
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
Quadro di valutazione della gravità
| Gravità | Criteri | Esempio |
|---|---|---|
| Critico | Esecuzione di codice in remoto, violazione dei dati, compromissione del sistema | Iniezione completa tempestiva che porta a RCE |
| Alto | Accesso non autorizzato, esposizione di dati sensibili | Estrazione dei prompt del sistema |
| Media | Aggiramento delle policy, accesso limitato ai dati | Bypassare il filtro dei contenuti |
| Basso | Violazioni minori delle policy, informative | Formato di output non intenzionale |
Metodi di valutazione
LLM-as-Judge
Utilizzare l'intelligenza artificiale per valutare i risultati dell'intelligenza artificiale per la sicurezza e la conformità alle policy
Valutazione umana
Revisione esperta degli output per una valutazione della sicurezza articolata
Punteggio automatizzato
Corrispondenza di modelli e valutazione basata su regole
Metriche del Red Team
Traccia tasso di successo di sfruttamento, tasso di falsi positivi
Architettura di riparazione
Livelli di difesa
1. Filtraggio dell'input
- Rilevamento rapido dei pattern
- Riconoscimento della codifica
- Limiti di lunghezza
- Limitazione della velocità
2. Guardrail
- Convalida dell'output
- Filtraggio dei contenuti
- Politiche di utilizzo degli strumenti
- Controlli di accesso
3. Potenziamento del modello
- Ottimizzazione per la sicurezza
- Miglioramenti RLHF
- Ingegneria del prompt del sistema
- Ottimizzazione della temperatura/top-p
4. Progettazione del sistema
- Separazione dei privilegi
- Human-in-the-loop
- Logging e monitoraggio
- Risposta agli incidenti
Test di convalida
Dopo aver implementato le correzioni, ripetere il test per verificare:
- Le vulnerabilità originali non sono più sfruttabili
- Le correzioni non introducono nuove vulnerabilità
- La funzionalità del sistema rimane intatta
- Le prestazioni sono accettabili
- I tassi di falsi positivi sono gestibili
Modello di reporting
Riepilogo esecutivo
- Ambito e obiettivi
- Panoramica dei risultati principali
- Riepilogo della valutazione del rischio
- Consigli prioritari
Dettagli tecnici
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- Screenshot e registri
- Diagrammi della catena di attacco
- Frammenti di codice
Consigli
- Correzioni a breve termine (vittorie rapide)
- Miglioramenti a medio termine
- Modifiche all'architettura a lungo termine
- Requisiti di risorse
- Cronologia
Appendici
- Output dello strumento
- Casi di test utilizzati
- Riferimenti
- Glossario
Considerazioni etiche
Autorizzazione
Always obtain explicit written permission before testing. Document scope boundaries.
Confini dell'ambito
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
Gestione dei dati
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
Divulgazione responsabile
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
Risorse correlate
Pronto per saperne di più?
Continua a esplorare gli argomenti relativi alla sicurezza dell'intelligenza artificiale.