AI Red Teaming: Kompletny przewodnik metodologiczny
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • Czas czytania: ~15 min
Co to jest AI Red Teaming?
Czerwone zespoły AI to praktyka z celowe, systematyczne ataki na systemy AI to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
Prompt Injection
Manipulating AI behavior through malicious inputs that override system instructions
Jailbreaking
Omijanie środków bezpieczeństwa w celu generowania zabronionych treści
Wydobywanie danych
Wyodrębnianie wrażliwych informacji z danych szkoleniowych lub wyników
Manipulacja modelem
Zmienianie zachowania modelu poprzez zatruwanie lub ataki dostrajające
Dlaczego AI Red Teaming ma znaczenie w 2026 r.
- 180% increase in LLM-related security incidents (2025)
- Zespół AI Red firmy Microsoft ocenił Ponad 100 produktów GenAI i odkryłem, że wiele istotnych niepowodzeń ma swoje źródło w proste techniki
- Systemy AI coraz częściej sobie radzą wrażliwe dane i krytyczne decyzje
- Wymogi regulacyjne (ustawa UE dotycząca sztucznej inteligencji) Testowanie bezpieczeństwa AI dla systemów wysokiego ryzyka
Budowanie zespołu AI Red
Wymagane umiejętności
Umiejętności techniczne
- Zrozumienie architektury LLM
- Szybka wiedza inżynierska
- Bezpieczeństwo aplikacji internetowych
- Testowanie bezpieczeństwa API
- Skrypty (Python, bash)
Umiejętności kontradyktoryjne
- Kreatywne rozwiązywanie problemów
- Świadomość inżynierii społecznej
- Multimodalne myślenie o atakach
- Badania i rozpoznanie
- Dokumentacja i raportowanie
Wiedza domeny
- OWASP LLM Top 10
- Framework MITRE ATLAS
- Podstawy AI/ML
- Etyka i odpowiedzialność ujawnienie
- Ryzyka specyficzne dla branży
Modele zaangażowania
| Model | Opis | Plusy | Wady |
|---|---|---|---|
| Zespół wewnętrzny | Dedykowany wewnętrzny zespół red team | Głęboka wiedza o produkcie, ciągłe testowanie | Może pomijać perspektywę zewnętrzną |
| Konsultant zewnętrzny | Zewnętrzna firma zajmująca się bezpieczeństwem | Świeża perspektywa, specjalistyczne umiejętności | Wyższe koszty, krzywa uczenia się |
| Hybrydowe | Współpraca wewnętrzna i zewnętrzna | Najlepsze z obu światów | Narzut koordynacyjny |
| Automatycznie | Zintegrowane testowanie CI/CD | Ciągłe, skalowalne | Ograniczone do znanych wzorców |
Faza 1: Rozpoznanie i odkrywanie
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 Mapowanie systemów
- Przegląd architektury: Dowiedz się, w jaki sposób sztuczna inteligencja integruje się z innymi systemami
- Przepływ danych: Mapuj sposób przesyłania danych przez system
- Punkty końcowe API: Identyfikacja wszystkich odsłoniętych interfejsów
- Integracje z firmami zewnętrznymi: Udokumentuj usługi zewnętrzne
- Role użytkowników: Poznaj różne poziomy dostępu
1.2 Badanie możliwości
- Możliwości modelu: Co może zrobić sztuczna inteligencja?
- Dostęp do narzędzi: Jakie funkcje może wywołać?
- Dostęp do danych: Jakie informacje może pobrać?
- Kanały wyjściowe: Jak się komunikuje?
- Zarządzanie stanem: Jak radzi sobie z sesjami?
Kluczowe techniki
- Wyodrębnianie podpowiedzi systemowych: Próba ujawnienia instrukcji systemowych poprzez ostrożne podpowiadanie
- Model Fingerprinting: Zidentyfikuj podstawowy model na podstawie wzorców zachowań
- Wykrywanie API: Znajdź ukryte lub nieudokumentowane punkty końcowe
- Przegląd dokumentacji: Analizuj publiczne dokumenty pod kątem szczegółów implementacji
Faza 2: Mapowanie luk w zabezpieczeniach
Identify and categorize potential attack vectors based on the discovered attack surface.
Taksonomia ataków
Prompt Injection
- Bezpośrednie wstrzykiwanie
- Wstrzyknięcie pośrednie
- Manipulacja wieloobrotowa
- Przepełnienie kontekstu
Ataki jailbreak
- Odgrywanie ról (DAN)
- Podszywanie się pod postacie
- Formowanie autoryzacji
- Obejście kodowania
Wydobywanie danych
- Odzyskiwanie danych szkoleniowych
- Wyciek monitów systemowych
- Dostęp do historii rozmów
- Narażenie klucza API
Odmowa usługi
- Wyczerpanie zasobów
- Przepełnienie kontekstu
- Manipulacja modelami
- Zawieszenie/awaria systemu
Nadużycia narzędzi/funkcji
- Nieautoryzowane wywołania API
- Manipulacja parametrami
- Łączenie funkcji
- Eskalacja uprawnień
Ataki wielomodalne
- Wstrzykiwanie na podstawie obrazu
- Manipulacja dźwiękiem
- Exploity międzymodalne
- Zawartość osadzona
Ataki modelowe
- Przykłady kontradyktoryjne
- Inwersja modelu
- Wnioskowanie o członkostwie
- Ekstrakcja modelu
Łańcuch dostaw
- Zatrucie zależności
- Kompromis w centrum modeli
- Zatruwanie danych szkoleniowych
- Ryzyko osób trzecich
Faza 3: Eksploatacja
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
Metodologia wykorzystania
- Priorytet: Uszereguj luki według ważności i możliwości wykorzystania
- Weryfikacja koncepcji: Opracuj działające exploity dla każdej luki
- Ocena wpływu: Określ rzeczywiste konsekwencje udanego wykorzystania luki w zabezpieczeniach
- Łączenie: Sprawdź, czy można połączyć wiele luk w zabezpieczeniach w celu uzyskania większego efektu
- Dokumentacja: Rejestruj wszystkie próby wykorzystania, sukcesy i niepowodzenia
Lekcje Microsoft Red Team
Na podstawie testów ponad 100 produktów GenAI zespół AI Red firmy Microsoft odkrył:
- Działają proste techniki: Wiele istotnych błędów wynika z podstawowych monitów o jailbreak
- Liczy się myślenie na poziomie systemu: Luki często obejmują wiele komponentów
- Kreatywność człowieka wygrywa: Zautomatyzowane narzędzia znajdują znane wzorce; ludzie znajdują nowe ataki
- Niezbędne jest ciągłe testowanie: Nowe funkcje wprowadzają nowe powierzchnie ataku
Faza 4: Testowanie trwałości
Test whether attack effects persist beyond the initial interaction and can survive system resets.
Trwałość sesji
- Czy manipulacja przetrwa odświeżenie sesji?
- Czy stan może być wstępnie ładowany do nowych sesji?
- Czy występują utrzymujące się efekty z poprzednich monitów?
Trwałość modelu
- Czy ataki mogą mieć wpływ na przyszłe aktualizacje modeli?
- Czy dostrajanie pozwala zachować luki w zabezpieczeniach?
- Czy ataki trujące są trwałe?
Trwałość systemu
- Czy luki w zabezpieczeniach mogą przetrwać aktualizacje?
- Czy istnieją mechanizmy backdoora?
- Czy ataki utrzymują się w różnych wdrożeniach?
Dogłębne zapoznanie się z narzędziami
Garak
Skaner podatności LLM typu open source firmy NVIDIA
- Sondy pod kątem ponad 40 typów luk w zabezpieczeniach
- Ciągła ocena modelu
- Regularne aktualizacje bazy danych o lukach w zabezpieczeniach
- Integracja z potokami CI/CD
PyRIT
Narzędzie do identyfikacji ryzyka w języku Python firmy Microsoft
- Kompleksowe środowisko Red Team
- Obsługa wielu powierzchni ataku
- Automatyczne generowanie ataków
- Ocena i ocena
Promptfoo
Platforma testowa i ewaluacyjna LLM
- Szybkie środowisko testowania
- Ocena bezpieczeństwa
- Porównanie wydajności
- Porównanie wersji
Rebuff
Szybkie wykrywanie pakietu SDK do wykrywania iniekcji
- Wykrywanie prób wstrzyknięć
- Wielowarstwowa obrona
- Niski odsetek fałszywych alarmów
- Łatwa integracja
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
Punkty integracji potoku
1. Przed zatwierdzeniem
- Weryfikacja lokalnego monitu
- Wykrywanie wstrzykiwania na podstawie wzorców
- Testowanie stacji roboczych dla programistów
2. Pull Request
- Automatyczne skanowanie podatności na ataki
- Porównanie bazowe
- Egzekwowanie bramek bezpieczeństwa
3. Produkcja przedprodukcyjna
- Pełna ocena zespołu czerwonego
- Testowanie regresyjne
- Porównanie wydajności
4. Produkcja
- Ciągłe monitorowanie
- Wykrywanie anomalii
- Integracja reakcji na incydenty
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
Ramy oceny istotności
| Ważność | Kryteria | Przykład |
|---|---|---|
| Krytyczne | Zdalne wykonanie kodu, naruszenie danych, naruszenie bezpieczeństwa systemu | Pełne natychmiastowe wstrzyknięcie prowadzące do RCE |
| Wysokie | Nieautoryzowany dostęp, ujawnienie wrażliwych danych | Wyodrębnianie podpowiedzi systemowych |
| Średnia | Ominięcie zasad, ograniczony dostęp do danych | Omijanie filtra treści |
| Niski | Drobne naruszenia zasad, informacyjne | Niezamierzony format wyjściowy |
Metody oceny
LLM-as-Judge
Wykorzystanie sztucznej inteligencji do oceny wyników AI pod kątem bezpieczeństwa i zgodności z polityką
Ocena przez człowieka
Ekspercki przegląd wyników w celu szczegółowej oceny bezpieczeństwa
Automatyczna punktacja
Dopasowywanie wzorców i ocena oparta na regułach
Metryki Red Team
Śledzenie wskaźnika powodzenia wykorzystania, współczynnika fałszywych alarmów
Architektura naprawcza
Warstwy obrony
1. Filtrowanie danych wejściowych
- Wykrywanie wzorców podpowiedzi
- Rozpoznawanie kodowania
- Limity długości
- Ograniczanie szybkości
2. Poręcze
- Weryfikacja wyników
- Filtrowanie treści
- Zasady korzystania z narzędzi
- Kontrola dostępu
3. Trenowanie modelu
- Dostrajanie pod kątem bezpieczeństwa
- Ulepszenia RLHF
- Inżynieria podpowiedzi systemu
- Temperatura/dostrajanie od góry
4. Projekt systemu
- Oddzielenie uprawnień
- Human-in-the-loop
- Logowanie i monitorowanie
- Reakcja na incydenty
Testowanie weryfikacyjne
Po wdrożeniu poprawek przetestuj ponownie, aby zweryfikować:
- Oryginalnych luk nie można już wykorzystać
- Poprawki nie wprowadzają nowych luk w zabezpieczeniach
- Funkcjonalność systemu pozostaje nienaruszona
- Wydajność jest akceptowalna
- Możliwość zarządzania wskaźnikami wyników fałszywie dodatnich
Szablon raportowania
Streszczenie dla kadry kierowniczej
- Zakres i cele
- Omówienie kluczowych ustaleń
- Podsumowanie oceny ryzyka
- Zalecenia dotyczące priorytetów
Szczegóły techniczne
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- Zrzuty ekranu i dzienniki
- Schematy łańcuchów ataków
- Fragmenty kodu
Zalecenia
- Krótkoterminowe poprawki (szybkie wygrane)
- Średnioterminowe ulepszenia
- Długoterminowe zmiany w architekturze
- Wymagania dotyczące zasobów
- Oś czasu
Dodatki
- Dane wyjściowe narzędzia
- Wykorzystane przypadki testowe
- Referencje
- Słownik
Względy etyczne
Autoryzacja
Always obtain explicit written permission before testing. Document scope boundaries.
Granice zakresu
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
Obsługa danych
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
Odpowiedzialne ujawnianie danych
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
Powiązane zasoby
Chcesz dowiedzieć się więcej?
Kontynuuj eksplorację tematów związanych z bezpieczeństwem sztucznej inteligencji.