AI Hacking
AI-beveiligingsbronnen

AI Red Teaming: Volledige Methodologiegids

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • Leestijd: ~15 min

Wat is AI Red Teaming?

AI red teaming is de praktijk van opzettelijke, systematische aanvallen op AI-systemen to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

Prompt Injection

Manipulating AI behavior through malicious inputs that override system instructions

Jailbreaking

Het omzeilen van veiligheidsmaatregelen om verboden inhoud te genereren

Gegevensextractie

Het extraheren van gevoelige informatie uit trainingsgegevens of -uitvoer

Modelmanipulatie

Modelgedrag wijzigen via vergiftigings- of verfijningsaanvallen

Waarom AI Red Teaming belangrijk is in 2026

  • 180% increase in LLM-related security incidents (2025)
  • Microsoft's AI Red Team heeft beoordeeld 100+ GenAI-producten en ontdekte dat veel impactvolle fouten voortkomen uit eenvoudige technieken
  • AI-systemen kunnen steeds beter omgaan gevoelige gegevens en kritieke beslissingen
  • Reguleringsvereisten (EU AI Act) mandaat AI-beveiligingstests voor systemen met een hoog risico

Een AI Red Team bouwen

Vereiste vaardigheden

Technische vaardigheden

  • Inzicht in de LLM-architectuur
  • Snelle technische kennis
  • Beveiliging van webapplicaties
  • API-beveiligingstests
  • Scripting (Python, bashen)

Vaardigheidsvaardigheden

  • Creatieve probleemoplossing
  • Bewustzijn van sociale engineering
  • Multimodaal aanvalsdenken
  • Onderzoek en verkenning
  • Documentatie en rapportage

Domeinkennis

  • OWASP LLM Top 10
  • MITRE ATLAS-framework
  • Grondbeginselen van AI/ML
  • Ethiek en verantwoorde openbaarmaking
  • Branchespecifieke risico's

Engagementmodellen

Model Beschrijving Voordelen Nadelen
Intern team Speciaal intern rood team Diepe productkennis, voortdurend testen Mist mogelijk een extern perspectief
Externe consultant Beveiligingsbedrijf van derden Nieuw perspectief, gespecialiseerde vaardigheden Hogere kosten, leercurve
Hybride Interne + externe samenwerking Het beste van twee werelden Coördinatieoverhead
Geautomatiseerd Geïntegreerde CI/CD-testen Continu, schaalbaar Beperkt tot bekende patronen

Fase 1: verkenning en ontdekking

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 Systeem in kaart brengen

  • Architectuurbeoordeling: Begrijp hoe de AI integreert met andere systemen
  • Gegevensstroom: In kaart brengen hoe gegevens door het systeem bewegen
  • API-eindpunten: Identificeer alle blootgestelde interfaces
  • Integraties van derden: Documenteer externe services
  • Gebruikersrollen: Verschillende toegangsniveaus begrijpen

1.2 Capability Probing

  • Modelmogelijkheden: Wat kan de AI doen?
  • Toegang tot tools: Welke functies kan het aanroepen?
  • Gegevenstoegang: Welke informatie kan het ophalen?
  • Uitvoerkanalen: Hoe communiceert het?
  • State management: Hoe gaat het om met sessies?

Belangrijke technieken

  • Extractie van systeemprompts: Probeer systeeminstructies te onthullen via zorgvuldige aanwijzingen
  • Modelvingerafdrukken: Identificeer het onderliggende model via gedragspatronen
  • API-detectie: Vind verborgen of ongedocumenteerde eindpunten
  • Documentatiebeoordeling: Analyseer openbare documenten op implementatiedetails

Fase 2: Kwetsbaarheid in kaart brengen

Identify and categorize potential attack vectors based on the discovered attack surface.

Aanvaltaxonomie

Prompt Injection

  • Directe injectie
  • Indirecte injectie
  • Multi-turn manipulatie
  • Contextoverflow

Jailbreak-aanvallen

  • Rollenspel (DAN)
  • Karakterimitatie
  • Authorisatieframing
  • Codering bypass

Gegevensextractie

  • Trainingsgegevensherstel
  • Lekkage van systeemprompts
  • Toegang tot gespreksgeschiedenis
  • Blootstelling van API-sleutels

Denial of Service

  • Uitputting van hulpbronnen
  • Contextoverflow
  • Modelmanipulatie
  • Systeem loopt vast/crash

Misbruik van tools/functies

  • Ongeautoriseerde API-aanroepen
  • Parametermanipulatie
  • Functieketening
  • Escalatie van bevoegdheden

Multi-modale aanvallen

  • Injectie op basis van afbeeldingen
  • Audiomanipulatie
  • Cross-modale exploits
  • Ingebedde inhoud

Modelaanvallen

  • Tegenstrijdige voorbeelden
  • Modelinversie
  • Inferentie over lidmaatschap
  • Modelextractie

Supply Chain

  • Vergiftiging van afhankelijkheid
  • Compromis van modelhub
  • Vergiftiging van trainingsgegevens
  • Risico's van derden

Fase 3: Exploitatie

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

Exploitatiemethodologie

  1. Prioriteitstoewijzing: Rangschik kwetsbaarheden op basis van ernst en exploiteerbaarheid
  2. Proof of Concept: Ontwikkel werkende exploits voor elke kwetsbaarheid
  3. Impactbeoordeling: Bepaal de reële gevolgen van succesvolle exploitatie
  4. Chaining: Test of meerdere kwetsbaarheden kunnen worden gecombineerd voor een grotere impact
  5. Documentatie: Registreer alle pogingen tot misbruik, successen en mislukkingen

Microsoft Red Team-lessen

Gebaseerd op het testen van meer dan 100 GenAI-producten heeft het AI Red Team van Microsoft het volgende gevonden:

  • Eenvoudige technieken werken: Veel impactvolle fouten komen van standaard jailbreakprompts
  • Het denken op systeemniveau is belangrijk: Kwetsbaarheden omvatten vaak meerdere componenten
  • Menselijke creativiteit wint: Geautomatiseerde tools vinden bekende patronen; mensen vinden nieuwe aanvallen
  • Continu testen is essentieel: Nieuwe functies introduceren nieuwe aanvalsoppervlakken

Fase 4: persistentietesten

Test whether attack effects persist beyond the initial interaction and can survive system resets.

Sessiepersistentie

  • Overleeft manipulatie de sessievernieuwing?
  • Kan status vooraf worden geladen in nieuwe sessies?
  • Zijn er aanhoudende effecten van eerdere prompts?

Modelpersistentie

  • Kunnen aanvallen toekomstige modelupdates beïnvloeden?
  • Behoudt de fijnafstemming kwetsbaarheden?
  • Zijn gifaanvallen permanent?

Systeempersistentie

  • Kunnen kwetsbaarheden updates overleven?
  • Zijn er achterdeurmechanismen?
  • Blijven aanvallen bestaan ​​in alle implementaties?

Tooling Deep Dive

Garak

NVIDIA's open-source LLM-kwetsbaarheidsscanner

  • Probes voor Meer dan 40 soorten kwetsbaarheden
  • Continue modelbeoordeling
  • Regelmatige updates van de database voor kwetsbaarheden
  • Integratie met CI/CD-pijplijnen
Bekijken op GitHub →

PyRIT

Microsoft's Python Risk Identification Tool

  • Uitgebreid Red Team-framework
  • Ondersteuning van meerdere aanvalsoppervlakken
  • Geautomatiseerde aanvalsgeneratie
  • Scores en evaluatie
Bekijken op GitHub →

Promptfoo

LLM-test- en evaluatieplatform

  • Framework voor snelle tests
  • Veiligheidsevaluatie
  • Prestatiebenchmarking
  • Versievergelijking
Bekijk website →

Rebuff

SDK voor snelle injectiedetectie

  • Detectie van injectiepogingen
  • Meerlaagse verdediging
  • Laag percentage valse positieven
  • Eenvoudige integratie
Bekijken op GitHub →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

Pipeline-integratiepunten

1. Pre-Commit

  • Lokale promptvalidatie
  • Patroongebaseerde injectiedetectie
  • Test van werkstations voor ontwikkelaars

2. Pull Request

  • Geautomatiseerd scannen op kwetsbaarheden
  • Basislijnvergelijking
  • Afdwinging van beveiligingspoorten

3. Pre-productie

  • Volledige Red Team-beoordeling
  • Regressietests
  • Prestatiebenchmarking

4. Productie

  • Continu toezicht
  • Anomaliedetectie
  • Incidentresponsintegratie

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

Severity Rating Framework

Ernst Criteria Voorbeeld
Kritisch Uitvoering van code op afstand, datalek, systeemcompromis Volledige prompte injectie leidend tot RCE
Hoog Ongeautoriseerde toegang, blootstelling aan gevoelige gegevens Extractie van systeemprompts
Medium Beleid omzeilen, beperkte toegang tot gegevens Omzeilen van inhoudsfilter
Laag Kleine beleidsschendingen, informatief Onbedoeld uitvoerformaat

Evaluatiemethoden

LLM-as-Judge

Gebruik AI om AI-outputs te evalueren voor veiligheid en naleving van beleid

Menselijke evaluatie

Deskundige beoordeling van uitvoer voor genuanceerde beveiligingsbeoordeling

Geautomatiseerde scores

Patroonmatching en op regels gebaseerde evaluatie

Red Team Metrics

Slaagpercentage van exploitatie bijhouden, percentage valse positieven

Herstelarchitectuur

Defensielagen

1. Invoerfilters

  • Promptpatroondetectie
  • Coderingherkenning
  • Lengtelimieten
  • Snelheidsbeperking

2. Gangrails

  • Uitvoervalidatie
  • Inhoudsfiltering
  • Beleid voor gebruik van tools
  • Toegangscontroles

3. Modelverharding

  • Verfijning voor veiligheid
  • RLHF-verbeteringen
  • Systeemprompt-engineering
  • Temperatuur/top-p-afstemming

4. Systeemontwerp

  • Gescheiden rechten
  • Mens-in-the-loop
  • Logboekregistratie en monitoring
  • Reactie op incidenten

Validatietesten

Na het implementeren van oplossingen, test u opnieuw om te verifiëren:

  • Oorspronkelijke kwetsbaarheden kunnen niet langer worden misbruikt
  • Oplossingen introduceren geen nieuwe kwetsbaarheden
  • Systeemfunctionaliteit blijft intact
  • Prestaties zijn acceptabel
  • False-positieve percentages zijn beheersbaar

Rapportagesjabloon

Samenvatting

  • Reikwijdte en doelstellingen
  • Overzicht van de belangrijkste bevindingen
  • Samenvatting van de risicobeoordeling
  • Prioriteitsaanbevelingen

Technische details

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • Screenshots en logs
  • Aanvalsketendiagrammen
  • Codefragmenten

Aanbevelingen

  • Oplossingen op korte termijn (quick wins)
  • Verbeteringen op middellange termijn
  • Architectuurwijzigingen op lange termijn
  • Resourcevereisten
  • Tijdlijn

Bijlagen

  • Hulpprogramma-uitvoer
  • Gebruikte testcases
  • Referenties
  • Woordenlijst

Ethische overwegingen

Autorisatie

Always obtain explicit written permission before testing. Document scope boundaries.

Reikwijdtegrenzen

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

Gegevensverwerking

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

Responsible Disclosure

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

Klaar voor meer informatie?

Ga door met het verkennen van AI-beveiligingsonderwerpen.

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.