AI Red Teaming: Volledige Methodologiegids
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • Leestijd: ~15 min
Wat is AI Red Teaming?
AI red teaming is de praktijk van opzettelijke, systematische aanvallen op AI-systemen to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
Prompt Injection
Manipulating AI behavior through malicious inputs that override system instructions
Jailbreaking
Het omzeilen van veiligheidsmaatregelen om verboden inhoud te genereren
Gegevensextractie
Het extraheren van gevoelige informatie uit trainingsgegevens of -uitvoer
Modelmanipulatie
Modelgedrag wijzigen via vergiftigings- of verfijningsaanvallen
Waarom AI Red Teaming belangrijk is in 2026
- 180% increase in LLM-related security incidents (2025)
- Microsoft's AI Red Team heeft beoordeeld 100+ GenAI-producten en ontdekte dat veel impactvolle fouten voortkomen uit eenvoudige technieken
- AI-systemen kunnen steeds beter omgaan gevoelige gegevens en kritieke beslissingen
- Reguleringsvereisten (EU AI Act) mandaat AI-beveiligingstests voor systemen met een hoog risico
Een AI Red Team bouwen
Vereiste vaardigheden
Technische vaardigheden
- Inzicht in de LLM-architectuur
- Snelle technische kennis
- Beveiliging van webapplicaties
- API-beveiligingstests
- Scripting (Python, bashen)
Vaardigheidsvaardigheden
- Creatieve probleemoplossing
- Bewustzijn van sociale engineering
- Multimodaal aanvalsdenken
- Onderzoek en verkenning
- Documentatie en rapportage
Domeinkennis
- OWASP LLM Top 10
- MITRE ATLAS-framework
- Grondbeginselen van AI/ML
- Ethiek en verantwoorde openbaarmaking
- Branchespecifieke risico's
Engagementmodellen
| Model | Beschrijving | Voordelen | Nadelen |
|---|---|---|---|
| Intern team | Speciaal intern rood team | Diepe productkennis, voortdurend testen | Mist mogelijk een extern perspectief |
| Externe consultant | Beveiligingsbedrijf van derden | Nieuw perspectief, gespecialiseerde vaardigheden | Hogere kosten, leercurve |
| Hybride | Interne + externe samenwerking | Het beste van twee werelden | Coördinatieoverhead |
| Geautomatiseerd | Geïntegreerde CI/CD-testen | Continu, schaalbaar | Beperkt tot bekende patronen |
Fase 1: verkenning en ontdekking
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 Systeem in kaart brengen
- Architectuurbeoordeling: Begrijp hoe de AI integreert met andere systemen
- Gegevensstroom: In kaart brengen hoe gegevens door het systeem bewegen
- API-eindpunten: Identificeer alle blootgestelde interfaces
- Integraties van derden: Documenteer externe services
- Gebruikersrollen: Verschillende toegangsniveaus begrijpen
1.2 Capability Probing
- Modelmogelijkheden: Wat kan de AI doen?
- Toegang tot tools: Welke functies kan het aanroepen?
- Gegevenstoegang: Welke informatie kan het ophalen?
- Uitvoerkanalen: Hoe communiceert het?
- State management: Hoe gaat het om met sessies?
Belangrijke technieken
- Extractie van systeemprompts: Probeer systeeminstructies te onthullen via zorgvuldige aanwijzingen
- Modelvingerafdrukken: Identificeer het onderliggende model via gedragspatronen
- API-detectie: Vind verborgen of ongedocumenteerde eindpunten
- Documentatiebeoordeling: Analyseer openbare documenten op implementatiedetails
Fase 2: Kwetsbaarheid in kaart brengen
Identify and categorize potential attack vectors based on the discovered attack surface.
Aanvaltaxonomie
Prompt Injection
- Directe injectie
- Indirecte injectie
- Multi-turn manipulatie
- Contextoverflow
Jailbreak-aanvallen
- Rollenspel (DAN)
- Karakterimitatie
- Authorisatieframing
- Codering bypass
Gegevensextractie
- Trainingsgegevensherstel
- Lekkage van systeemprompts
- Toegang tot gespreksgeschiedenis
- Blootstelling van API-sleutels
Denial of Service
- Uitputting van hulpbronnen
- Contextoverflow
- Modelmanipulatie
- Systeem loopt vast/crash
Misbruik van tools/functies
- Ongeautoriseerde API-aanroepen
- Parametermanipulatie
- Functieketening
- Escalatie van bevoegdheden
Multi-modale aanvallen
- Injectie op basis van afbeeldingen
- Audiomanipulatie
- Cross-modale exploits
- Ingebedde inhoud
Modelaanvallen
- Tegenstrijdige voorbeelden
- Modelinversie
- Inferentie over lidmaatschap
- Modelextractie
Supply Chain
- Vergiftiging van afhankelijkheid
- Compromis van modelhub
- Vergiftiging van trainingsgegevens
- Risico's van derden
Fase 3: Exploitatie
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
Exploitatiemethodologie
- Prioriteitstoewijzing: Rangschik kwetsbaarheden op basis van ernst en exploiteerbaarheid
- Proof of Concept: Ontwikkel werkende exploits voor elke kwetsbaarheid
- Impactbeoordeling: Bepaal de reële gevolgen van succesvolle exploitatie
- Chaining: Test of meerdere kwetsbaarheden kunnen worden gecombineerd voor een grotere impact
- Documentatie: Registreer alle pogingen tot misbruik, successen en mislukkingen
Microsoft Red Team-lessen
Gebaseerd op het testen van meer dan 100 GenAI-producten heeft het AI Red Team van Microsoft het volgende gevonden:
- Eenvoudige technieken werken: Veel impactvolle fouten komen van standaard jailbreakprompts
- Het denken op systeemniveau is belangrijk: Kwetsbaarheden omvatten vaak meerdere componenten
- Menselijke creativiteit wint: Geautomatiseerde tools vinden bekende patronen; mensen vinden nieuwe aanvallen
- Continu testen is essentieel: Nieuwe functies introduceren nieuwe aanvalsoppervlakken
Fase 4: persistentietesten
Test whether attack effects persist beyond the initial interaction and can survive system resets.
Sessiepersistentie
- Overleeft manipulatie de sessievernieuwing?
- Kan status vooraf worden geladen in nieuwe sessies?
- Zijn er aanhoudende effecten van eerdere prompts?
Modelpersistentie
- Kunnen aanvallen toekomstige modelupdates beïnvloeden?
- Behoudt de fijnafstemming kwetsbaarheden?
- Zijn gifaanvallen permanent?
Systeempersistentie
- Kunnen kwetsbaarheden updates overleven?
- Zijn er achterdeurmechanismen?
- Blijven aanvallen bestaan in alle implementaties?
Tooling Deep Dive
Garak
NVIDIA's open-source LLM-kwetsbaarheidsscanner
- Probes voor Meer dan 40 soorten kwetsbaarheden
- Continue modelbeoordeling
- Regelmatige updates van de database voor kwetsbaarheden
- Integratie met CI/CD-pijplijnen
PyRIT
Microsoft's Python Risk Identification Tool
- Uitgebreid Red Team-framework
- Ondersteuning van meerdere aanvalsoppervlakken
- Geautomatiseerde aanvalsgeneratie
- Scores en evaluatie
Promptfoo
LLM-test- en evaluatieplatform
- Framework voor snelle tests
- Veiligheidsevaluatie
- Prestatiebenchmarking
- Versievergelijking
Rebuff
SDK voor snelle injectiedetectie
- Detectie van injectiepogingen
- Meerlaagse verdediging
- Laag percentage valse positieven
- Eenvoudige integratie
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
Pipeline-integratiepunten
1. Pre-Commit
- Lokale promptvalidatie
- Patroongebaseerde injectiedetectie
- Test van werkstations voor ontwikkelaars
2. Pull Request
- Geautomatiseerd scannen op kwetsbaarheden
- Basislijnvergelijking
- Afdwinging van beveiligingspoorten
3. Pre-productie
- Volledige Red Team-beoordeling
- Regressietests
- Prestatiebenchmarking
4. Productie
- Continu toezicht
- Anomaliedetectie
- Incidentresponsintegratie
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
Severity Rating Framework
| Ernst | Criteria | Voorbeeld |
|---|---|---|
| Kritisch | Uitvoering van code op afstand, datalek, systeemcompromis | Volledige prompte injectie leidend tot RCE |
| Hoog | Ongeautoriseerde toegang, blootstelling aan gevoelige gegevens | Extractie van systeemprompts |
| Medium | Beleid omzeilen, beperkte toegang tot gegevens | Omzeilen van inhoudsfilter |
| Laag | Kleine beleidsschendingen, informatief | Onbedoeld uitvoerformaat |
Evaluatiemethoden
LLM-as-Judge
Gebruik AI om AI-outputs te evalueren voor veiligheid en naleving van beleid
Menselijke evaluatie
Deskundige beoordeling van uitvoer voor genuanceerde beveiligingsbeoordeling
Geautomatiseerde scores
Patroonmatching en op regels gebaseerde evaluatie
Red Team Metrics
Slaagpercentage van exploitatie bijhouden, percentage valse positieven
Herstelarchitectuur
Defensielagen
1. Invoerfilters
- Promptpatroondetectie
- Coderingherkenning
- Lengtelimieten
- Snelheidsbeperking
2. Gangrails
- Uitvoervalidatie
- Inhoudsfiltering
- Beleid voor gebruik van tools
- Toegangscontroles
3. Modelverharding
- Verfijning voor veiligheid
- RLHF-verbeteringen
- Systeemprompt-engineering
- Temperatuur/top-p-afstemming
4. Systeemontwerp
- Gescheiden rechten
- Mens-in-the-loop
- Logboekregistratie en monitoring
- Reactie op incidenten
Validatietesten
Na het implementeren van oplossingen, test u opnieuw om te verifiëren:
- Oorspronkelijke kwetsbaarheden kunnen niet langer worden misbruikt
- Oplossingen introduceren geen nieuwe kwetsbaarheden
- Systeemfunctionaliteit blijft intact
- Prestaties zijn acceptabel
- False-positieve percentages zijn beheersbaar
Rapportagesjabloon
Samenvatting
- Reikwijdte en doelstellingen
- Overzicht van de belangrijkste bevindingen
- Samenvatting van de risicobeoordeling
- Prioriteitsaanbevelingen
Technische details
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- Screenshots en logs
- Aanvalsketendiagrammen
- Codefragmenten
Aanbevelingen
- Oplossingen op korte termijn (quick wins)
- Verbeteringen op middellange termijn
- Architectuurwijzigingen op lange termijn
- Resourcevereisten
- Tijdlijn
Bijlagen
- Hulpprogramma-uitvoer
- Gebruikte testcases
- Referenties
- Woordenlijst
Ethische overwegingen
Autorisatie
Always obtain explicit written permission before testing. Document scope boundaries.
Reikwijdtegrenzen
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
Gegevensverwerking
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
Responsible Disclosure
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
Gerelateerde bronnen
Klaar voor meer informatie?
Ga door met het verkennen van AI-beveiligingsonderwerpen.