I Red Teaming: Vollständiger Leitfaden zur Methodik
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • Lesezeit: ~15 Min
Was ist AI Red Teaming?
Ich red Teaming ist die Praxis von gezielte, systematische Angriffe auf KI-Systeme to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
rompt Injektion
Manipulating AI behavior through malicious inputs that override system instructions
bahnbrechend
Sicherheitsmaßnahmen umgehen, um verbotene Inhalte zu generieren
ata-Extraktion
Extrahieren vertraulicher Informationen aus Trainingsdaten oder -ausgaben
odell-Manipulation
Filtern des Modellverhaltens durch Poisoning- oder Fine-Tuning-Angriffe
hy AI Red Teaming Matters im Jahr 2026
- 180% increase in LLM-related security incidents (2025)
- Das AI Red Team von Microsoft hat eine Bewertung vorgenommen Über 00 GenAI-Produkte nd stellte fest, dass viele schwerwiegende Fehler auf Folgendes zurückzuführen sind einfache Techniken
- Ich beherrsche zunehmend Systeme sensible Daten und kritische Entscheidungen
- regulatorische Vorgaben (EU-KI-Gesetz) Auftrag I Sicherheitstests oder Hochrisikosysteme
Zusammenstellung eines KI-Roten Teams
erforderliche Fähigkeiten
Technische Fähigkeiten
- Verständnis der LLM-Architektur
- umfassendes technisches Wissen
- eb-Anwendungssicherheit
- PI-Sicherheitstests
- Skripten (Python, Bash)
Gegensätzliche Fähigkeiten
- reative Problemlösung
- Bewusstsein für soziales Engineering
- ultimodales Angriffsdenken
- Forschung und Aufklärung
- Dokumentation und Berichterstattung
omain Wissen
- WASP LLM Top 10
- ITRE ATLAS-Framework
- I/ML-Grundlagen
- Verhalten und verantwortungsvolle Offenlegung
- Branchenspezifische Risiken
Engagement-Modelle
| odel | Beschreibung | ros | Ons |
|---|---|---|---|
| internes Team | engagiertes internes rotes Team | Tiefe Produktkenntnisse, kontinuierliche Tests | Ja, ich vermisse die Außenperspektive |
| Externer Berater | externes Sicherheitsunternehmen | Neue Perspektive, spezielle Fähigkeiten | Höhere Kosten, Lernkurve |
| ybrid | interne + externe Zusammenarbeit | das Beste aus beiden Welten | Koordination über Kopf |
| automatisiert | I/CD-integriertes Testen | kontinuierlich, skalierbar | bekannte Muster nachgeahmt |
Hase 1: Aufklärung und Entdeckung
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 Systemzuordnung
- Architekturrezension: Verstehen Sie, wie sich die KI in andere Systeme integriert
- Ata-Flow: ap wie sich Daten durch das System bewegen
- PI-Endpunkte: Identifizieren Sie alle exponierten Schnittstellen
- Drittanbieter-Integrationen: Dokumentieren Sie externe Dienstleistungen
- Ser-Rollen: Verschiedene Zugriffsebenen verstehen
1.2 Fähigkeit Sondieren
- Odel-Fähigkeiten: Was kann die KI?
- ool-Zugang: Welche Funktionen kann es aufrufen?
- ata-Zugang: Welche Informationen kann es abrufen?
- Ausgangskanäle: Wie kommuniziert es?
- Staatsleitung: Wie geht es mit Sitzungen um?
ey Techniken
- System-Prompt-Extraktion: Versuchen Sie, Systemanweisungen durch sorgfältige Eingabeaufforderung preiszugeben
- odell-Fingerabdrücke: Identifizieren Sie das zugrunde liegende Modell anhand von Verhaltensmustern
- PI-Erkennung: Suchen Sie nach versteckten oder undokumentierten Endpunkten
- Dokumentationsbericht: Analysieren Sie öffentliche Dokumente für Implementierungsdetails
Abschnitt 2: Schwachstellenkartierung
Identify and categorize potential attack vectors based on the discovered attack surface.
Angriffs-Taxonomie
rompt Injektion
- direkte Injektion
- Direkteinspritzung
- Ultra-Turn-Manipulation
- Ontext-Überlauf
Ailbreak-Angriffe
- Altes Spiel (DAN)
- Nachahmung eines Charakters
- Autorisierungsrahmen
- Codierungsbypass
ata-Extraktion
- Regen Datenwiederherstellung
- Systemleckage
- Zugriff auf den Gesprächsverlauf
- PI-Schlüsselexposition
Dienstantritt
- Ressourcenerschöpfung
- Ontext-Überlauf
- Modellmanipulation
- System hängt/stürzt ab
ool/Funktionsmissbrauch
- Nicht autorisierte API-Aufrufe
- Parametermanipulation
- Salbungsverkettung
- Eskalation von Rivilegien
ultimodale Angriffe
- Magierbasierte Injektion
- Audiomanipulation
- Rossmodale Exploits
- eingebetteter Inhalt
odell-Angriffe
- Gegensätzliche Beispiele
- odelle Umkehrung
- Glutschluss
- Odel-Extraktion
Lieferkette
- Abhängigkeitsvergiftung
- Odel-Naben-Kompromiss
- Es regnet Datenvergiftung
- Risiken Dritter
Abschnitt 3: Ausbeutung
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
Xploitation-Methodik
- Prioritätsaufgabe: Ank-Schwachstellen nach Schweregrad und Ausnutzbarkeit
- Dach des Konzepts: Entwickeln Sie funktionierende Exploits für jede Schwachstelle
- Folgenabschätzung: Bestimmen Sie die realen Konsequenzen einer erfolgreichen Ausbeutung
- haining: Es ist sinnvoll, wenn mehrere Schwachstellen kombiniert werden können, um eine größere Wirkung zu erzielen
- Dokumentation: Zeichnen Sie alle Ausbeutungsversuche, Erfolge und Misserfolge auf
Microsoft Red Team-Lektionen
Beim Testen von über 100 GenAI-Produkten stellte das AI Red Team von Microsoft fest:
- Einfache Techniken funktionieren: Alle schwerwiegenden Fehler sind auf grundlegende Jailbreak-Eingabeaufforderungen zurückzuführen
- Denken auf Systemebene ist wichtig: Schwachstellen erstrecken sich oft über mehrere Komponenten
- menschliche Kreativität gewinnt: Automatisierte Werkzeuge finden bekannte Muster; Menschen finden neuartige Angriffe
- Kontinuierliche Tests sind unerlässlich: Neue Funktionen eröffnen neue Angriffsflächen
Abschnitt 4: Persistenztests
Test whether attack effects persist beyond the initial interaction and can survive system resets.
sitzung Persistenz
- OES-Manipulation überlebt Sitzungsaktualisierung?
- ein Zustand in neue Sitzungen vorgeladen werden?
- Gibt es Nachwirkungen früherer Eingabeaufforderungen?
odel Persistenz
- Beeinflussen Angriffe zukünftige Modellaktualisierungen?
- OES-Feinabstimmung, um Schwachstellen zu bewahren?
- Sind Giftangriffe dauerhaft?
Systempersistenz
- Überlebt eine Schwachstelle Updates?
- Gibt es Hintertürmechanismen?
- o Angriffe bleiben über Bereitstellungen hinweg bestehen?
Cooles Deep Dive
Garak
VIDIAs Open-Source-LLM-Schwachstellenscanner
- Roben für über 40 Verwundbarkeitstypen
- Kontinuierliche Modellbewertung
- Regelmäßige Updates der Schwachstellendatenbank
- Integration mit CI/CD-Pipelines
PyRIT
Das Python-Risikoidentifizierungstool von Microsoft
- umfassendes Red-Team-Framework
- Unterstützung mehrerer Angriffsflächen
- Automatisierte Angriffsgenerierung
- Entkernung und Bewertung
Promptfoo
LM-Test- und Evaluierungsplattform
- Rompt-Test-Framework
- Sicherheitsbewertung
- Leistungsbenchmarking
- Versionsvergleich
Rebuff
Rompt-Injektionserkennungs-SDK
- Erkennung von Injektionsversuchen
- mehrschichtige Verteidigung
- Wie hoch ist die Falsch-Positiv-Rate?
- Einfache Integration
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
IP-Integrationspunkte
1. erneut festlegen
- lokale Prompt-Validierung
- Musterbasierte Injektionserkennung
- Testen von Entwickler-Workstations
2. ull Anfrage
- Automatisiertes Schwachstellen-Scanning
- Aseline-Vergleich
- Durchsetzung von Sicherheitstoren
3. Reproduktion
- Bewertung des gesamten roten Teams
- Egressionstests
- Leistungsbenchmarking
4. Produktion
- Kontinuierliche Überwachung
- Normale Erkennung
- Integration der Reaktion auf Vorfälle
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
everity Rating Framework
| aller Zeiten | riterium | Beispiel |
|---|---|---|
| kritisch | Emote-Code-Ausführung, Datenschutzverletzung, Systemkompromittierung | Ull-Prompt-Injektion, die zu RCE führt |
| oh | Unbefugter Zugriff, Offenlegung sensibler Daten | System-Prompt-Extraktion |
| edium | Richtlinienumgehung, eingeschränkter Datenzugriff | Inhaltsfilter-Bypass |
| Niedrig | Kleinere Richtlinienverstöße, informativ | beabsichtigtes Ausgabeformat |
Bewertungsmethoden
LM-als-Richter
Nutzen Sie KI, um die KI-Ergebnisse auf Sicherheit und Einhaltung von Richtlinien hin zu bewerten
uman-Bewertung
Expertenüberprüfung der Ergebnisse für eine differenzierte Sicherheitsbewertung
Automatisierte Wertung
Musterabgleich und regelbasierte Auswertung
ed Team Metrics
Erfolgsquote bei Rack-Ausnutzung, Falsch-Positiv-Rate
Sanierungsarchitektur
Verteidigungsschichten
1. Eingabefilterung
- Einfache Mustererkennung
- nkodierungserkennung
- Längengrenzen
- aß einschränkend
2. Geländer
- Ausgabevalidierung
- Inhaltsfilterung
- ool-Nutzungsrichtlinien
- Zugangskontrollen
3. odell Härten
- Feinabstimmung für Sicherheit
- LHF-Verbesserungen
- System-Prompt-Engineering
- Temperatur/Top-P-Abstimmung
4. Systemdesign
- rivilegale Trennung
- uman-in-the-loop
- Oggen und Überwachen
- zufällige Reaktion
Alidationstests
Führen Sie nach der Implementierung der Korrekturen einen erneuten Test durch, um Folgendes zu überprüfen:
- Ursprüngliche Schwachstellen sind nicht mehr ausnutzbar
- ixes führen nicht zu neuen Schwachstellen
- Die Funktionalität des Systems bleibt erhalten
- Die Leistung ist akzeptabel
- Auch positive Raten sind beherrschbar
Eporting-Vorlage
Zusammenfassung
- Bewältigung und Ziele
- Übersicht über die Ergebnisse
- Zusammenfassung der ISK-Bewertung
- Prioritätsempfehlungen
Technische Details
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- Creenshots und Protokolle
- Angriffskettendiagramme
- Ode-Schnipsel
Empfehlungen
- Kurzfristige Lösungen (schnelle Erfolge)
- mittelfristige Verbesserungen
- langfristige architektonische Veränderungen
- Ressourcenanforderungen
- imeline
Anhänge
- ool-Ausgänge
- Es werden die meisten Fälle verwendet
- Referenzen
- Verlustar
thische Überlegungen
Autorisierung
Always obtain explicit written permission before testing. Document scope boundaries.
Grenzen bewältigen
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
ata Handhabung
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
verantwortungsvolle Offenlegung
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
Hochgeschätzte Ressourcen
Sind Sie bereit, mehr zu erfahren?
Erkunden Sie weiterhin Themen zur KI-Sicherheit.