Ich hacke
I Sicherheitsressourcen

I Red Teaming: Vollständiger Leitfaden zur Methodik

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • Lesezeit: ~15 Min

Was ist AI Red Teaming?

Ich red Teaming ist die Praxis von gezielte, systematische Angriffe auf KI-Systeme to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

rompt Injektion

Manipulating AI behavior through malicious inputs that override system instructions

bahnbrechend

Sicherheitsmaßnahmen umgehen, um verbotene Inhalte zu generieren

ata-Extraktion

Extrahieren vertraulicher Informationen aus Trainingsdaten oder -ausgaben

odell-Manipulation

Filtern des Modellverhaltens durch Poisoning- oder Fine-Tuning-Angriffe

hy AI Red Teaming Matters im Jahr 2026

  • 180% increase in LLM-related security incidents (2025)
  • Das AI Red Team von Microsoft hat eine Bewertung vorgenommen Über 00 GenAI-Produkte nd stellte fest, dass viele schwerwiegende Fehler auf Folgendes zurückzuführen sind einfache Techniken
  • Ich beherrsche zunehmend Systeme sensible Daten und kritische Entscheidungen
  • regulatorische Vorgaben (EU-KI-Gesetz) Auftrag I Sicherheitstests oder Hochrisikosysteme

Zusammenstellung eines KI-Roten Teams

erforderliche Fähigkeiten

Technische Fähigkeiten

  • Verständnis der LLM-Architektur
  • umfassendes technisches Wissen
  • eb-Anwendungssicherheit
  • PI-Sicherheitstests
  • Skripten (Python, Bash)

Gegensätzliche Fähigkeiten

  • reative Problemlösung
  • Bewusstsein für soziales Engineering
  • ultimodales Angriffsdenken
  • Forschung und Aufklärung
  • Dokumentation und Berichterstattung

omain Wissen

  • WASP LLM Top 10
  • ITRE ATLAS-Framework
  • I/ML-Grundlagen
  • Verhalten und verantwortungsvolle Offenlegung
  • Branchenspezifische Risiken

Engagement-Modelle

odel Beschreibung ros Ons
internes Team engagiertes internes rotes Team Tiefe Produktkenntnisse, kontinuierliche Tests Ja, ich vermisse die Außenperspektive
Externer Berater externes Sicherheitsunternehmen Neue Perspektive, spezielle Fähigkeiten Höhere Kosten, Lernkurve
ybrid interne + externe Zusammenarbeit das Beste aus beiden Welten Koordination über Kopf
automatisiert I/CD-integriertes Testen kontinuierlich, skalierbar bekannte Muster nachgeahmt

Hase 1: Aufklärung und Entdeckung

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 Systemzuordnung

  • Architekturrezension: Verstehen Sie, wie sich die KI in andere Systeme integriert
  • Ata-Flow: ap wie sich Daten durch das System bewegen
  • PI-Endpunkte: Identifizieren Sie alle exponierten Schnittstellen
  • Drittanbieter-Integrationen: Dokumentieren Sie externe Dienstleistungen
  • Ser-Rollen: Verschiedene Zugriffsebenen verstehen

1.2 Fähigkeit Sondieren

  • Odel-Fähigkeiten: Was kann die KI?
  • ool-Zugang: Welche Funktionen kann es aufrufen?
  • ata-Zugang: Welche Informationen kann es abrufen?
  • Ausgangskanäle: Wie kommuniziert es?
  • Staatsleitung: Wie geht es mit Sitzungen um?

ey Techniken

  • System-Prompt-Extraktion: Versuchen Sie, Systemanweisungen durch sorgfältige Eingabeaufforderung preiszugeben
  • odell-Fingerabdrücke: Identifizieren Sie das zugrunde liegende Modell anhand von Verhaltensmustern
  • PI-Erkennung: Suchen Sie nach versteckten oder undokumentierten Endpunkten
  • Dokumentationsbericht: Analysieren Sie öffentliche Dokumente für Implementierungsdetails

Abschnitt 2: Schwachstellenkartierung

Identify and categorize potential attack vectors based on the discovered attack surface.

Angriffs-Taxonomie

rompt Injektion

  • direkte Injektion
  • Direkteinspritzung
  • Ultra-Turn-Manipulation
  • Ontext-Überlauf

Ailbreak-Angriffe

  • Altes Spiel (DAN)
  • Nachahmung eines Charakters
  • Autorisierungsrahmen
  • Codierungsbypass

ata-Extraktion

  • Regen Datenwiederherstellung
  • Systemleckage
  • Zugriff auf den Gesprächsverlauf
  • PI-Schlüsselexposition

Dienstantritt

  • Ressourcenerschöpfung
  • Ontext-Überlauf
  • Modellmanipulation
  • System hängt/stürzt ab

ool/Funktionsmissbrauch

  • Nicht autorisierte API-Aufrufe
  • Parametermanipulation
  • Salbungsverkettung
  • Eskalation von Rivilegien

ultimodale Angriffe

  • Magierbasierte Injektion
  • Audiomanipulation
  • Rossmodale Exploits
  • eingebetteter Inhalt

odell-Angriffe

  • Gegensätzliche Beispiele
  • odelle Umkehrung
  • Glutschluss
  • Odel-Extraktion

Lieferkette

  • Abhängigkeitsvergiftung
  • Odel-Naben-Kompromiss
  • Es regnet Datenvergiftung
  • Risiken Dritter

Abschnitt 3: Ausbeutung

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

Xploitation-Methodik

  1. Prioritätsaufgabe: Ank-Schwachstellen nach Schweregrad und Ausnutzbarkeit
  2. Dach des Konzepts: Entwickeln Sie funktionierende Exploits für jede Schwachstelle
  3. Folgenabschätzung: Bestimmen Sie die realen Konsequenzen einer erfolgreichen Ausbeutung
  4. haining: Es ist sinnvoll, wenn mehrere Schwachstellen kombiniert werden können, um eine größere Wirkung zu erzielen
  5. Dokumentation: Zeichnen Sie alle Ausbeutungsversuche, Erfolge und Misserfolge auf

Microsoft Red Team-Lektionen

Beim Testen von über 100 GenAI-Produkten stellte das AI Red Team von Microsoft fest:

  • Einfache Techniken funktionieren: Alle schwerwiegenden Fehler sind auf grundlegende Jailbreak-Eingabeaufforderungen zurückzuführen
  • Denken auf Systemebene ist wichtig: Schwachstellen erstrecken sich oft über mehrere Komponenten
  • menschliche Kreativität gewinnt: Automatisierte Werkzeuge finden bekannte Muster; Menschen finden neuartige Angriffe
  • Kontinuierliche Tests sind unerlässlich: Neue Funktionen eröffnen neue Angriffsflächen

Abschnitt 4: Persistenztests

Test whether attack effects persist beyond the initial interaction and can survive system resets.

sitzung Persistenz

  • OES-Manipulation überlebt Sitzungsaktualisierung?
  • ein Zustand in neue Sitzungen vorgeladen werden?
  • Gibt es Nachwirkungen früherer Eingabeaufforderungen?

odel Persistenz

  • Beeinflussen Angriffe zukünftige Modellaktualisierungen?
  • OES-Feinabstimmung, um Schwachstellen zu bewahren?
  • Sind Giftangriffe dauerhaft?

Systempersistenz

  • Überlebt eine Schwachstelle Updates?
  • Gibt es Hintertürmechanismen?
  • o Angriffe bleiben über Bereitstellungen hinweg bestehen?

Cooles Deep Dive

Garak

VIDIAs Open-Source-LLM-Schwachstellenscanner

  • Roben für über 40 Verwundbarkeitstypen
  • Kontinuierliche Modellbewertung
  • Regelmäßige Updates der Schwachstellendatenbank
  • Integration mit CI/CD-Pipelines
Ansicht auf GitHub →

PyRIT

Das Python-Risikoidentifizierungstool von Microsoft

  • umfassendes Red-Team-Framework
  • Unterstützung mehrerer Angriffsflächen
  • Automatisierte Angriffsgenerierung
  • Entkernung und Bewertung
Ansicht auf GitHub →

Promptfoo

LM-Test- und Evaluierungsplattform

  • Rompt-Test-Framework
  • Sicherheitsbewertung
  • Leistungsbenchmarking
  • Versionsvergleich
iew Website →

Rebuff

Rompt-Injektionserkennungs-SDK

  • Erkennung von Injektionsversuchen
  • mehrschichtige Verteidigung
  • Wie hoch ist die Falsch-Positiv-Rate?
  • Einfache Integration
Ansicht auf GitHub →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

IP-Integrationspunkte

1. erneut festlegen

  • lokale Prompt-Validierung
  • Musterbasierte Injektionserkennung
  • Testen von Entwickler-Workstations

2. ull Anfrage

  • Automatisiertes Schwachstellen-Scanning
  • Aseline-Vergleich
  • Durchsetzung von Sicherheitstoren

3. Reproduktion

  • Bewertung des gesamten roten Teams
  • Egressionstests
  • Leistungsbenchmarking

4. Produktion

  • Kontinuierliche Überwachung
  • Normale Erkennung
  • Integration der Reaktion auf Vorfälle

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

everity Rating Framework

aller Zeiten riterium Beispiel
kritisch Emote-Code-Ausführung, Datenschutzverletzung, Systemkompromittierung Ull-Prompt-Injektion, die zu RCE führt
oh Unbefugter Zugriff, Offenlegung sensibler Daten System-Prompt-Extraktion
edium Richtlinienumgehung, eingeschränkter Datenzugriff Inhaltsfilter-Bypass
Niedrig Kleinere Richtlinienverstöße, informativ beabsichtigtes Ausgabeformat

Bewertungsmethoden

LM-als-Richter

Nutzen Sie KI, um die KI-Ergebnisse auf Sicherheit und Einhaltung von Richtlinien hin zu bewerten

uman-Bewertung

Expertenüberprüfung der Ergebnisse für eine differenzierte Sicherheitsbewertung

Automatisierte Wertung

Musterabgleich und regelbasierte Auswertung

ed Team Metrics

Erfolgsquote bei Rack-Ausnutzung, Falsch-Positiv-Rate

Sanierungsarchitektur

Verteidigungsschichten

1. Eingabefilterung

  • Einfache Mustererkennung
  • nkodierungserkennung
  • Längengrenzen
  • aß einschränkend

2. Geländer

  • Ausgabevalidierung
  • Inhaltsfilterung
  • ool-Nutzungsrichtlinien
  • Zugangskontrollen

3. odell Härten

  • Feinabstimmung für Sicherheit
  • LHF-Verbesserungen
  • System-Prompt-Engineering
  • Temperatur/Top-P-Abstimmung

4. Systemdesign

  • rivilegale Trennung
  • uman-in-the-loop
  • Oggen und Überwachen
  • zufällige Reaktion

Alidationstests

Führen Sie nach der Implementierung der Korrekturen einen erneuten Test durch, um Folgendes zu überprüfen:

  • Ursprüngliche Schwachstellen sind nicht mehr ausnutzbar
  • ixes führen nicht zu neuen Schwachstellen
  • Die Funktionalität des Systems bleibt erhalten
  • Die Leistung ist akzeptabel
  • Auch positive Raten sind beherrschbar

Eporting-Vorlage

Zusammenfassung

  • Bewältigung und Ziele
  • Übersicht über die Ergebnisse
  • Zusammenfassung der ISK-Bewertung
  • Prioritätsempfehlungen

Technische Details

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • Creenshots und Protokolle
  • Angriffskettendiagramme
  • Ode-Schnipsel

Empfehlungen

  • Kurzfristige Lösungen (schnelle Erfolge)
  • mittelfristige Verbesserungen
  • langfristige architektonische Veränderungen
  • Ressourcenanforderungen
  • imeline

Anhänge

  • ool-Ausgänge
  • Es werden die meisten Fälle verwendet
  • Referenzen
  • Verlustar

thische Überlegungen

Autorisierung

Always obtain explicit written permission before testing. Document scope boundaries.

Grenzen bewältigen

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

ata Handhabung

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

verantwortungsvolle Offenlegung

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

Sind Sie bereit, mehr zu erfahren?

Erkunden Sie weiterhin Themen zur KI-Sicherheit.

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.