AI Hackelés
AI biztonsági erőforrások

Felhasználói tevékenységnaplók:

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • Olvasási idő: ~15 perc

Mi az AI Red Teaming?

Az AI red teaming gyakorlata: szándékos, szisztematikus támadások mesterséges intelligencia rendszerek ellen to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

DevOps mérnökei

Manipulating AI behavior through malicious inputs that override system instructions

Jailbreak

A biztonsági intézkedések megkerülése tiltott tartalom létrehozásához

Adatkinyerés

PII-felismerés

Modellkezelés

Szerepjáték

Miért számít az AI Red Teaming 2026-ban

  • 180% increase in LLM-related security incidents (2025)
  • A Microsoft AI Red Team | elfogult példák a modell viselkedésének megváltoztatására 100+ GenAI-termékek és megállapította, hogy sok jelentős hiba származik Egyszerű technikák
  • A mesterséges intelligencia rendszerek egyre gyakrabban kezelik érzékeny adatok és kritikus döntések
  • Szabályozási követelmények (EU AI-törvény) felhatalmazás AI biztonsági tesztelés magas kockázatú rendszerekhez

A MI Red Team felépítése

Szükséges készségek

Műszaki készségek

  • Az LLM architektúra megértése
  • Azonnali mérnöki ismeretek
  • Webes alkalmazások biztonsága
  • API biztonsági tesztelése
  • Scripting (Python, bash)

Ellenálló készségek

  • Kreatív problémamegoldás
  • Társadalomfejlesztési tudatosság
  • Multimodális támadási gondolkodás
  • Kutatás és felderítés
  • Dokumentáció és jelentés

Domainismeret

  • OWASP LLM Top 10
  • MITRE ATLAS keretrendszer
  • AI/ML alapjai
  • Az SOC elemzői mesterséges intelligencia-specifikus fenyegetéselemzést adnak hozzá.
  • Iparspecifikus kockázatok

Engagement Models

Modell ||1. Clawdbot/MCP ökoszisztéma megsértése (2026. január) Előnyök Hátrányok
Belső csapat Dedicated in-house red team Mély termékismeret, folyamatos tesztelés Külső perspektíva hiányozhat
Tanácsadó Harmadik féltől származó biztonsági cég Friss perspektíva, speciális ismeretek Magasabb költség, tanulási görbe
Hibrid Belső + külső együttműködés Mindkét világ legjobbja Koordinációs többlet
Automatikusan CI/CD integrált tesztelés Folyamatos, méretezhető Ismert mintákra korlátozva

1. fázis: Felderítés és felfedezés

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 Rendszerleképezés

  • Architektúra áttekintés: Kontextus túlcsordulás
  • Data flow: Jelenítse fel, hogyan mozognak az adatok a rendszerben
  • API-végpontok: Az összes elérhető interfész azonosítása
  • Harmadik féltől származó integrációk: Dokumentálja a külső szolgáltatásokat
  • Felhasználói szerepkörök: A különböző hozzáférési szintek értelmezése

1.2 Képességvizsgálat

  • Modell képességei: Az 1. számú LLM biztonsági rése. Ismerje meg a támadási technikákat, a védelmet és az AI-rendszerek tesztelésének módját.
  • Eszközhozzáférés: Milyen funkciókat tud hívni?
  • Adathozzáférés: Milyen információkat tud lekérni?
  • Kimeneti csatornák: Hogyan kommunikál?
  • Állami vezetés: Hogyan kezeli a munkameneteket?

LLM-hez kapcsolódó CVE-k (halmozott)

  • Rendszerprompt kivonása Kísérlet a rendszerutasítások felfedésére gondos felszólítással
  • Modell ujjlenyomat: A viselkedésmodell azonosítása| Végrehajtás
  • API felfedezése: Rejtett vagy nem dokumentált végpontok keresése
  • Dokumentáció áttekintése: Elemezze a nyilvános dokumentumokat a megvalósítás részleteiért

2. fázis: Sebezhetőség feltérképezése

Identify and categorize potential attack vectors based on the discovered attack surface.

Támadástaxonómia

DevOps mérnökei

  • Közvetlen befecskendezés
  • Közvetett befecskendezés
  • Többfordulós manipuláció
  • Használjon csúszó ablakokat

Jailbreak támadások

  • Szerepjáték (DAN)
  • Karakterek megszemélyesítése
  • Engedélyezés keretezése
  • Kódolási megkerülés

Adatkinyerés

  • Képzési adatok helyreállítása
  • Rendszer azonnali szivárgás
  • Hozzáférés a beszélgetési előzményekhez
  • API-kulcsok megjelenítése

Szolgáltatásmegtagadás

  • Erőforrások kimerülése
  • Használjon csúszó ablakokat
  • Modell manipuláció
  • Rendszer lefagyása/összeomlása

Eszköz/Funkció-visszaélés

  • | 2026 | Model Context Protocol Security Guide
  • Paraméter-manipuláció
  • Funkcióláncolás
  • Jogok kiterjesztése

Multi-Modális támadások -|| Új kód sebezhetőségek

  • Képalapú beillesztés
  • Hangmanipuláció
  • Cross-modális kihasználások
  • Beágyazott tartalom

Modelltámadások

  • Példák ellenzőre
  • Modell inverzió
  • Tagságra vonatkozó következtetések
  • Modell kibontása

Supply Chain

  • Függőségmérgezés
  • Model hub-kompromisszum Az adatsértési jelentések költsége
  • Tanítási adatok mérgezése
  • Harmadik felektől származó kockázatok

3. fázis: Kizsákmányolás

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

|| kommunikáció

  1. Prioritás hozzárendelés: Rangsorolja a sebezhetőségeket súlyosság és kihasználhatóság szerint
  2. Az elgondolás bizonyítása: Fejlesszen újra működő kizsákmányolást minden egyes tudásra:RGindítás|| bases
  3. Hatásvizsgálat: Határozza meg a sikeres kizsákmányolás valós következményeit
  4. Láncolás: Tesztelje meg, hogy több sebezhetőség kombinálható-e a nagyobb hatás érdekében
  5. Dokumentáció: Rögzítse az összes kizsákmányolási kísérletet, sikert és kudarcot

Microsoft Red Team Lesson Kategóriák

100+ GenAI-termék tesztelése alapján a Microsoft AI Red Team a következőket találta:

  • Hozzáférés a beszélgetési előzményekhez Ellenőrizze a bemenet érvényesítését
  • Rendszerszintű gondolkodás számít: A sérülékenységek gyakran több összetevőre is kiterjednek
  • Human creativity wins: Az automatizált eszközök ismert mintákat találnak; az emberek új támadásokat találnak
  • A folyamatos tesztelés elengedhetetlen: Az új funkciók új támadási felületeket vezetnek be

4. fázis: Perzisztencia tesztelése

Test whether attack effects persist beyond the initial interaction and can survive system resets.

Session Persistence

  • Túléli a manipuláció a munkamenet-frissítést?
  • Be lehet tölteni az új állapotba az új munkameneteket?
  • Vannak-e elhúzódó hatásai a korábbi promptoknak?

Modell tartóssága

  • Befolyásolhatják-e a támadások a modellek jövőbeli frissítéseit?
  • A finomhangolás megőrzi a sebezhetőségeket?
  • Állandóak a mérgező támadások?

Rendszer tartóssága

  • Túlélhetik-e a biztonsági rések a frissítéseket?
  • Léteznek-e az alapvető háttérajtó-mechanizmusok?| prompts
  • A támadások továbbra is fennállnak a telepítések során?

Eszközök Deep Dive

Garak

Az NVIDIA nyílt forráskódú LLM sebezhetőség-ellenőrzője

  • Nincs nyilvános internet-hozzáférés
  • Folyamatos modellértékelés
  • Rendszeres biztonsági rés2. Legkisebb privilégium
  • Integration with CI/CD pipelines
Megtekintés a GitHubon →

PyRIT

A Microsoft Python kockázatazonosító eszköze

  • Átfogó vörös csapat keretrendszer
  • Többszörös támadási felület támogatása
  • Automatikus támadásgenerálás
  • Pontozás és értékelés
Megtekintés a GitHubon →

Promptfoo

LLM tesztelési és kiértékelő platform

  • Azonnali tesztelési keretrendszer
  • Biztonsági értékelés
  • Performance benchmarking
  • Verzió-összehasonlítás
Webhely megtekintése →

Rebuff

Azonnali befecskendezési észlelés SDK

  • Befecskendezési kísérletek észlelése
  • Többrétegű védelem
  • Alacsony hamis pozitív arány
  • Egyszerű integráció
Megtekintés a GitHubon →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

Csővezeték-integrációs pontok

1. Kikapcsolás előtt

  • Helyi prompt ellenőrzés
  • Mintaalapú befecskendezés észlelése
  • Fejlesztői munkaállomás tesztelése

2. Pull Request

  • Automatikus biztonsági rés-ellenőrzés
  • Alapvonal-összehasonlítás
  • Biztonsági kapuk betartatása

3. Gyártás előtti

  • A vörös csapat teljes értékelése
  • Regressziós tesztelés
  • Performance benchmarking

4. Termelés

  • Folyamatos megfigyelés
  • Anomáliák észlelése
  • Incidensekre adott válaszok integrációja

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

Severity Rating Framework

Súlyosság Rendszerprompt kivonása Kitartás Példa
Kritikus Távoli kódvégrehajtás, adatszivárgás, rendszer kompromittálása RCE-hez vezető teljes azonnali beillesztés
Magas Jogosulatlan hozzáférés, érzékeny adatok közzététele Rendszer azonnali kibontása
Közepes Irányelvek megkerülése, korlátozott adathozzáférés Tartalomszűrő megkerülése
Alacsony Kisebb irányelvsértések, információs AI biztonsági incidensek, beleértve az LLM-megsértéseket, az ügynöki felhatalmazást és az azonnali bejutást – Frissítve 2026. március Nem szándékolt kimeneti formátum

Értékelési módszerek

LLM-as-Judge

A mesterséges intelligencia segítségével értékelje ki a mesterséges intelligencia kimeneteit a biztonság és az irányelvek betartása érdekében

Human Evaluation

A kimenetek szakértői áttekintése az árnyalt biztonsági értékeléshez

Automatizált pontozás

Mintaegyeztetés és szabályalapú kiértékelés

Red Team Metrics

Kihasználási sikerarány nyomon követése, hamis pozitív arány

Járosítási architektúra

Védelmi rétegek

1. Bemeneti szűrés

  • Minták azonnali észlelése
  • Kódolásfelismerés
  • Hosszú korlátok
  • Aránykorlátozás

2. Biztonsági példák| Képzés

  • Kimenetellenőrzés
  • Tartalomszűrés
  • Eszközhasználati szabályzat||Professzionális|
  • Hozzáférés-vezérlés

3. Modell keményítése

  • Finomhangolás a biztonság érdekében
  • RLHF fejlesztések
  • Rendszerprompt tervezés
  • Hőmérséklet/top-p hangolás

4. Maximális hosszúságú prompt spam, ami kimerült a számításban

  • Jogok elkülönítése
  • Human in the loop
  • Naplózás és figyelés
  • Reagálás az incidensekre

Érvényesítési tesztelés

After implementing fixes, re-test to verify:

  • Az eredeti sebezhetőségek már nem használhatók
  • A javítások nem vezetnek be új sebezhetőséget
  • A rendszer funkcionalitása érintetlen marad
  • A teljesítmény elfogadható
  • A téves pozitív arányok kezelhetők

Jelentéssablon

Végzeti összefoglaló banki hangalapú hitelesítés

  • Hatókör és célok
  • A legfontosabb megállapítások áttekintése
  • Kockázatbesorolás összegzése
  • Prioritási javaslatok

Műszaki részletek

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • Biztonsági útmutató látásmodellekhez, audiorendszerekhez és többmodális támadási vektorokhoz – Frissítve 2026. márciusi
  • Támadási láncok
  • Kódrészletek

Javaslatok

  • Rövid távú javítások (gyors győzelem)
  • Középtávú fejlesztések
  • Hosszú távú építészeti változtatások
  • Erőforrásigény
  • Idővonal

Függelékek

  • Eszközkimenetek
  • Használt tesztesetek
  • Referenciák
  • Szójegyzék

Etikai megfontolások

Authorization

Always obtain explicit written permission before testing. Document scope boundaries.

Hatáskör határai

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

Adatkezelés

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

Felelősségteljes nyilvánosságra hozatal

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

Készen áll a további információra?

Általános befejezés

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.