Hakowanie AI
Zasoby bezpieczeństwa AI

AI Red Teaming: Kompletny przewodnik metodologiczny

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • Czas czytania: ~15 min

Co to jest AI Red Teaming?

Czerwone zespoły AI to praktyka z celowe, systematyczne ataki na systemy AI to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

Prompt Injection

Manipulating AI behavior through malicious inputs that override system instructions

Jailbreaking

Omijanie środków bezpieczeństwa w celu generowania zabronionych treści

Wydobywanie danych

Wyodrębnianie wrażliwych informacji z danych szkoleniowych lub wyników

Manipulacja modelem

Zmienianie zachowania modelu poprzez zatruwanie lub ataki dostrajające

Dlaczego AI Red Teaming ma znaczenie w 2026 r.

  • 180% increase in LLM-related security incidents (2025)
  • Zespół AI Red firmy Microsoft ocenił Ponad 100 produktów GenAI i odkryłem, że wiele istotnych niepowodzeń ma swoje źródło w proste techniki
  • Systemy AI coraz częściej sobie radzą wrażliwe dane i krytyczne decyzje
  • Wymogi regulacyjne (ustawa UE dotycząca sztucznej inteligencji) Testowanie bezpieczeństwa AI dla systemów wysokiego ryzyka

Budowanie zespołu AI Red

Wymagane umiejętności

Umiejętności techniczne

  • Zrozumienie architektury LLM
  • Szybka wiedza inżynierska
  • Bezpieczeństwo aplikacji internetowych
  • Testowanie bezpieczeństwa API
  • Skrypty (Python, bash)

Umiejętności kontradyktoryjne

  • Kreatywne rozwiązywanie problemów
  • Świadomość inżynierii społecznej
  • Multimodalne myślenie o atakach
  • Badania i rozpoznanie
  • Dokumentacja i raportowanie

Wiedza domeny

  • OWASP LLM Top 10
  • Framework MITRE ATLAS
  • Podstawy AI/ML
  • Etyka i odpowiedzialność ujawnienie
  • Ryzyka specyficzne dla branży

Modele zaangażowania

Model Opis Plusy Wady
Zespół wewnętrzny Dedykowany wewnętrzny zespół red team Głęboka wiedza o produkcie, ciągłe testowanie Może pomijać perspektywę zewnętrzną
Konsultant zewnętrzny Zewnętrzna firma zajmująca się bezpieczeństwem Świeża perspektywa, specjalistyczne umiejętności Wyższe koszty, krzywa uczenia się
Hybrydowe Współpraca wewnętrzna i zewnętrzna Najlepsze z obu światów Narzut koordynacyjny
Automatycznie Zintegrowane testowanie CI/CD Ciągłe, skalowalne Ograniczone do znanych wzorców

Faza 1: Rozpoznanie i odkrywanie

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 Mapowanie systemów

  • Przegląd architektury: Dowiedz się, w jaki sposób sztuczna inteligencja integruje się z innymi systemami
  • Przepływ danych: Mapuj sposób przesyłania danych przez system
  • Punkty końcowe API: Identyfikacja wszystkich odsłoniętych interfejsów
  • Integracje z firmami zewnętrznymi: Udokumentuj usługi zewnętrzne
  • Role użytkowników: Poznaj różne poziomy dostępu

1.2 Badanie możliwości

  • Możliwości modelu: Co może zrobić sztuczna inteligencja?
  • Dostęp do narzędzi: Jakie funkcje może wywołać?
  • Dostęp do danych: Jakie informacje może pobrać?
  • Kanały wyjściowe: Jak się komunikuje?
  • Zarządzanie stanem: Jak radzi sobie z sesjami?

Kluczowe techniki

  • Wyodrębnianie podpowiedzi systemowych: Próba ujawnienia instrukcji systemowych poprzez ostrożne podpowiadanie
  • Model Fingerprinting: Zidentyfikuj podstawowy model na podstawie wzorców zachowań
  • Wykrywanie API: Znajdź ukryte lub nieudokumentowane punkty końcowe
  • Przegląd dokumentacji: Analizuj publiczne dokumenty pod kątem szczegółów implementacji

Faza 2: Mapowanie luk w zabezpieczeniach

Identify and categorize potential attack vectors based on the discovered attack surface.

Taksonomia ataków

Prompt Injection

  • Bezpośrednie wstrzykiwanie
  • Wstrzyknięcie pośrednie
  • Manipulacja wieloobrotowa
  • Przepełnienie kontekstu

Ataki jailbreak

  • Odgrywanie ról (DAN)
  • Podszywanie się pod postacie
  • Formowanie autoryzacji
  • Obejście kodowania

Wydobywanie danych

  • Odzyskiwanie danych szkoleniowych
  • Wyciek monitów systemowych
  • Dostęp do historii rozmów
  • Narażenie klucza API

Odmowa usługi

  • Wyczerpanie zasobów
  • Przepełnienie kontekstu
  • Manipulacja modelami
  • Zawieszenie/awaria systemu

Nadużycia narzędzi/funkcji

  • Nieautoryzowane wywołania API
  • Manipulacja parametrami
  • Łączenie funkcji
  • Eskalacja uprawnień

Ataki wielomodalne

  • Wstrzykiwanie na podstawie obrazu
  • Manipulacja dźwiękiem
  • Exploity międzymodalne
  • Zawartość osadzona

Ataki modelowe

  • Przykłady kontradyktoryjne
  • Inwersja modelu
  • Wnioskowanie o członkostwie
  • Ekstrakcja modelu

Łańcuch dostaw

  • Zatrucie zależności
  • Kompromis w centrum modeli
  • Zatruwanie danych szkoleniowych
  • Ryzyko osób trzecich

Faza 3: Eksploatacja

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

Metodologia wykorzystania

  1. Priorytet: Uszereguj luki według ważności i możliwości wykorzystania
  2. Weryfikacja koncepcji: Opracuj działające exploity dla każdej luki
  3. Ocena wpływu: Określ rzeczywiste konsekwencje udanego wykorzystania luki w zabezpieczeniach
  4. Łączenie: Sprawdź, czy można połączyć wiele luk w zabezpieczeniach w celu uzyskania większego efektu
  5. Dokumentacja: Rejestruj wszystkie próby wykorzystania, sukcesy i niepowodzenia

Lekcje Microsoft Red Team

Na podstawie testów ponad 100 produktów GenAI zespół AI Red firmy Microsoft odkrył:

  • Działają proste techniki: Wiele istotnych błędów wynika z podstawowych monitów o jailbreak
  • Liczy się myślenie na poziomie systemu: Luki często obejmują wiele komponentów
  • Kreatywność człowieka wygrywa: Zautomatyzowane narzędzia znajdują znane wzorce; ludzie znajdują nowe ataki
  • Niezbędne jest ciągłe testowanie: Nowe funkcje wprowadzają nowe powierzchnie ataku

Faza 4: Testowanie trwałości

Test whether attack effects persist beyond the initial interaction and can survive system resets.

Trwałość sesji

  • Czy manipulacja przetrwa odświeżenie sesji?
  • Czy stan może być wstępnie ładowany do nowych sesji?
  • Czy występują utrzymujące się efekty z poprzednich monitów?

Trwałość modelu

  • Czy ataki mogą mieć wpływ na przyszłe aktualizacje modeli?
  • Czy dostrajanie pozwala zachować luki w zabezpieczeniach?
  • Czy ataki trujące są trwałe?

Trwałość systemu

  • Czy luki w zabezpieczeniach mogą przetrwać aktualizacje?
  • Czy istnieją mechanizmy backdoora?
  • Czy ataki utrzymują się w różnych wdrożeniach?

Dogłębne zapoznanie się z narzędziami

Garak

Skaner podatności LLM typu open source firmy NVIDIA

  • Sondy pod kątem ponad 40 typów luk w zabezpieczeniach
  • Ciągła ocena modelu
  • Regularne aktualizacje bazy danych o lukach w zabezpieczeniach
  • Integracja z potokami CI/CD
Zobacz na GitHubie →

PyRIT

Narzędzie do identyfikacji ryzyka w języku Python firmy Microsoft

  • Kompleksowe środowisko Red Team
  • Obsługa wielu powierzchni ataku
  • Automatyczne generowanie ataków
  • Ocena i ocena
Zobacz na GitHubie →

Promptfoo

Platforma testowa i ewaluacyjna LLM

  • Szybkie środowisko testowania
  • Ocena bezpieczeństwa
  • Porównanie wydajności
  • Porównanie wersji
Wyświetl stronę internetową →

Rebuff

Szybkie wykrywanie pakietu SDK do wykrywania iniekcji

  • Wykrywanie prób wstrzyknięć
  • Wielowarstwowa obrona
  • Niski odsetek fałszywych alarmów
  • Łatwa integracja
Zobacz na GitHubie →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

Punkty integracji potoku

1. Przed zatwierdzeniem

  • Weryfikacja lokalnego monitu
  • Wykrywanie wstrzykiwania na podstawie wzorców
  • Testowanie stacji roboczych dla programistów

2. Pull Request

  • Automatyczne skanowanie podatności na ataki
  • Porównanie bazowe
  • Egzekwowanie bramek bezpieczeństwa

3. Produkcja przedprodukcyjna

  • Pełna ocena zespołu czerwonego
  • Testowanie regresyjne
  • Porównanie wydajności

4. Produkcja

  • Ciągłe monitorowanie
  • Wykrywanie anomalii
  • Integracja reakcji na incydenty

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

Ramy oceny istotności

Ważność Kryteria Przykład
Krytyczne Zdalne wykonanie kodu, naruszenie danych, naruszenie bezpieczeństwa systemu Pełne natychmiastowe wstrzyknięcie prowadzące do RCE
Wysokie Nieautoryzowany dostęp, ujawnienie wrażliwych danych Wyodrębnianie podpowiedzi systemowych
Średnia Ominięcie zasad, ograniczony dostęp do danych Omijanie filtra treści
Niski Drobne naruszenia zasad, informacyjne Niezamierzony format wyjściowy

Metody oceny

LLM-as-Judge

Wykorzystanie sztucznej inteligencji do oceny wyników AI pod kątem bezpieczeństwa i zgodności z polityką

Ocena przez człowieka

Ekspercki przegląd wyników w celu szczegółowej oceny bezpieczeństwa

Automatyczna punktacja

Dopasowywanie wzorców i ocena oparta na regułach

Metryki Red Team

Śledzenie wskaźnika powodzenia wykorzystania, współczynnika fałszywych alarmów

Architektura naprawcza

Warstwy obrony

1. Filtrowanie danych wejściowych

  • Wykrywanie wzorców podpowiedzi
  • Rozpoznawanie kodowania
  • Limity długości
  • Ograniczanie szybkości

2. Poręcze

  • Weryfikacja wyników
  • Filtrowanie treści
  • Zasady korzystania z narzędzi
  • Kontrola dostępu

3. Trenowanie modelu

  • Dostrajanie pod kątem bezpieczeństwa
  • Ulepszenia RLHF
  • Inżynieria podpowiedzi systemu
  • Temperatura/dostrajanie od góry

4. Projekt systemu

  • Oddzielenie uprawnień
  • Human-in-the-loop
  • Logowanie i monitorowanie
  • Reakcja na incydenty

Testowanie weryfikacyjne

Po wdrożeniu poprawek przetestuj ponownie, aby zweryfikować:

  • Oryginalnych luk nie można już wykorzystać
  • Poprawki nie wprowadzają nowych luk w zabezpieczeniach
  • Funkcjonalność systemu pozostaje nienaruszona
  • Wydajność jest akceptowalna
  • Możliwość zarządzania wskaźnikami wyników fałszywie dodatnich

Szablon raportowania

Streszczenie dla kadry kierowniczej

  • Zakres i cele
  • Omówienie kluczowych ustaleń
  • Podsumowanie oceny ryzyka
  • Zalecenia dotyczące priorytetów

Szczegóły techniczne

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • Zrzuty ekranu i dzienniki
  • Schematy łańcuchów ataków
  • Fragmenty kodu

Zalecenia

  • Krótkoterminowe poprawki (szybkie wygrane)
  • Średnioterminowe ulepszenia
  • Długoterminowe zmiany w architekturze
  • Wymagania dotyczące zasobów
  • Oś czasu

Dodatki

  • Dane wyjściowe narzędzia
  • Wykorzystane przypadki testowe
  • Referencje
  • Słownik

Względy etyczne

Autoryzacja

Always obtain explicit written permission before testing. Document scope boundaries.

Granice zakresu

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

Obsługa danych

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

Odpowiedzialne ujawnianie danych

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

Chcesz dowiedzieć się więcej?

Kontynuuj eksplorację tematów związanych z bezpieczeństwem sztucznej inteligencji.

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.