Felhasználói tevékenységnaplók:
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • Olvasási idő: ~15 perc
Mi az AI Red Teaming?
Az AI red teaming gyakorlata: szándékos, szisztematikus támadások mesterséges intelligencia rendszerek ellen to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
DevOps mérnökei
Manipulating AI behavior through malicious inputs that override system instructions
Jailbreak
A biztonsági intézkedések megkerülése tiltott tartalom létrehozásához
Adatkinyerés
PII-felismerés
Modellkezelés
Szerepjáték
Miért számít az AI Red Teaming 2026-ban
- 180% increase in LLM-related security incidents (2025)
- A Microsoft AI Red Team | elfogult példák a modell viselkedésének megváltoztatására 100+ GenAI-termékek és megállapította, hogy sok jelentős hiba származik Egyszerű technikák
- A mesterséges intelligencia rendszerek egyre gyakrabban kezelik érzékeny adatok és kritikus döntések
- Szabályozási követelmények (EU AI-törvény) felhatalmazás AI biztonsági tesztelés magas kockázatú rendszerekhez
A MI Red Team felépítése
Szükséges készségek
Műszaki készségek
- Az LLM architektúra megértése
- Azonnali mérnöki ismeretek
- Webes alkalmazások biztonsága
- API biztonsági tesztelése
- Scripting (Python, bash)
Ellenálló készségek
- Kreatív problémamegoldás
- Társadalomfejlesztési tudatosság
- Multimodális támadási gondolkodás
- Kutatás és felderítés
- Dokumentáció és jelentés
Domainismeret
- OWASP LLM Top 10
- MITRE ATLAS keretrendszer
- AI/ML alapjai
- Az SOC elemzői mesterséges intelligencia-specifikus fenyegetéselemzést adnak hozzá.
- Iparspecifikus kockázatok
Engagement Models
| Modell | ||1. Clawdbot/MCP ökoszisztéma megsértése (2026. január) | Előnyök | Hátrányok |
|---|---|---|---|
| Belső csapat | Dedicated in-house red team | Mély termékismeret, folyamatos tesztelés | Külső perspektíva hiányozhat |
| Tanácsadó | Harmadik féltől származó biztonsági cég | Friss perspektíva, speciális ismeretek | Magasabb költség, tanulási görbe |
| Hibrid | Belső + külső együttműködés | Mindkét világ legjobbja | Koordinációs többlet |
| Automatikusan | CI/CD integrált tesztelés | Folyamatos, méretezhető | Ismert mintákra korlátozva |
1. fázis: Felderítés és felfedezés
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 Rendszerleképezés
- Architektúra áttekintés: Kontextus túlcsordulás
- Data flow: Jelenítse fel, hogyan mozognak az adatok a rendszerben
- API-végpontok: Az összes elérhető interfész azonosítása
- Harmadik féltől származó integrációk: Dokumentálja a külső szolgáltatásokat
- Felhasználói szerepkörök: A különböző hozzáférési szintek értelmezése
1.2 Képességvizsgálat
- Modell képességei: Az 1. számú LLM biztonsági rése. Ismerje meg a támadási technikákat, a védelmet és az AI-rendszerek tesztelésének módját.
- Eszközhozzáférés: Milyen funkciókat tud hívni?
- Adathozzáférés: Milyen információkat tud lekérni?
- Kimeneti csatornák: Hogyan kommunikál?
- Állami vezetés: Hogyan kezeli a munkameneteket?
LLM-hez kapcsolódó CVE-k (halmozott)
- Rendszerprompt kivonása Kísérlet a rendszerutasítások felfedésére gondos felszólítással
- Modell ujjlenyomat: A viselkedésmodell azonosítása| Végrehajtás
- API felfedezése: Rejtett vagy nem dokumentált végpontok keresése
- Dokumentáció áttekintése: Elemezze a nyilvános dokumentumokat a megvalósítás részleteiért
2. fázis: Sebezhetőség feltérképezése
Identify and categorize potential attack vectors based on the discovered attack surface.
Támadástaxonómia
DevOps mérnökei
- Közvetlen befecskendezés
- Közvetett befecskendezés
- Többfordulós manipuláció
- Használjon csúszó ablakokat
Jailbreak támadások
- Szerepjáték (DAN)
- Karakterek megszemélyesítése
- Engedélyezés keretezése
- Kódolási megkerülés
Adatkinyerés
- Képzési adatok helyreállítása
- Rendszer azonnali szivárgás
- Hozzáférés a beszélgetési előzményekhez
- API-kulcsok megjelenítése
Szolgáltatásmegtagadás
- Erőforrások kimerülése
- Használjon csúszó ablakokat
- Modell manipuláció
- Rendszer lefagyása/összeomlása
Eszköz/Funkció-visszaélés
- | 2026 | Model Context Protocol Security Guide
- Paraméter-manipuláció
- Funkcióláncolás
- Jogok kiterjesztése
Multi-Modális támadások -|| Új kód sebezhetőségek
- Képalapú beillesztés
- Hangmanipuláció
- Cross-modális kihasználások
- Beágyazott tartalom
Modelltámadások
- Példák ellenzőre
- Modell inverzió
- Tagságra vonatkozó következtetések
- Modell kibontása
Supply Chain
- Függőségmérgezés
- Model hub-kompromisszum Az adatsértési jelentések költsége
- Tanítási adatok mérgezése
- Harmadik felektől származó kockázatok
3. fázis: Kizsákmányolás
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
|| kommunikáció
- Prioritás hozzárendelés: Rangsorolja a sebezhetőségeket súlyosság és kihasználhatóság szerint
- Az elgondolás bizonyítása: Fejlesszen újra működő kizsákmányolást minden egyes tudásra:RGindítás|| bases
- Hatásvizsgálat: Határozza meg a sikeres kizsákmányolás valós következményeit
- Láncolás: Tesztelje meg, hogy több sebezhetőség kombinálható-e a nagyobb hatás érdekében
- Dokumentáció: Rögzítse az összes kizsákmányolási kísérletet, sikert és kudarcot
Microsoft Red Team Lesson Kategóriák
100+ GenAI-termék tesztelése alapján a Microsoft AI Red Team a következőket találta:
- Hozzáférés a beszélgetési előzményekhez Ellenőrizze a bemenet érvényesítését
- Rendszerszintű gondolkodás számít: A sérülékenységek gyakran több összetevőre is kiterjednek
- Human creativity wins: Az automatizált eszközök ismert mintákat találnak; az emberek új támadásokat találnak
- A folyamatos tesztelés elengedhetetlen: Az új funkciók új támadási felületeket vezetnek be
4. fázis: Perzisztencia tesztelése
Test whether attack effects persist beyond the initial interaction and can survive system resets.
Session Persistence
- Túléli a manipuláció a munkamenet-frissítést?
- Be lehet tölteni az új állapotba az új munkameneteket?
- Vannak-e elhúzódó hatásai a korábbi promptoknak?
Modell tartóssága
- Befolyásolhatják-e a támadások a modellek jövőbeli frissítéseit?
- A finomhangolás megőrzi a sebezhetőségeket?
- Állandóak a mérgező támadások?
Rendszer tartóssága
- Túlélhetik-e a biztonsági rések a frissítéseket?
- Léteznek-e az alapvető háttérajtó-mechanizmusok?| prompts
- A támadások továbbra is fennállnak a telepítések során?
Eszközök Deep Dive
Garak
Az NVIDIA nyílt forráskódú LLM sebezhetőség-ellenőrzője
- Nincs nyilvános internet-hozzáférés
- Folyamatos modellértékelés
- Rendszeres biztonsági rés2. Legkisebb privilégium
- Integration with CI/CD pipelines
PyRIT
A Microsoft Python kockázatazonosító eszköze
- Átfogó vörös csapat keretrendszer
- Többszörös támadási felület támogatása
- Automatikus támadásgenerálás
- Pontozás és értékelés
Promptfoo
LLM tesztelési és kiértékelő platform
- Azonnali tesztelési keretrendszer
- Biztonsági értékelés
- Performance benchmarking
- Verzió-összehasonlítás
Rebuff
Azonnali befecskendezési észlelés SDK
- Befecskendezési kísérletek észlelése
- Többrétegű védelem
- Alacsony hamis pozitív arány
- Egyszerű integráció
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
Csővezeték-integrációs pontok
1. Kikapcsolás előtt
- Helyi prompt ellenőrzés
- Mintaalapú befecskendezés észlelése
- Fejlesztői munkaállomás tesztelése
2. Pull Request
- Automatikus biztonsági rés-ellenőrzés
- Alapvonal-összehasonlítás
- Biztonsági kapuk betartatása
3. Gyártás előtti
- A vörös csapat teljes értékelése
- Regressziós tesztelés
- Performance benchmarking
4. Termelés
- Folyamatos megfigyelés
- Anomáliák észlelése
- Incidensekre adott válaszok integrációja
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
Severity Rating Framework
| Súlyosság | Rendszerprompt kivonása Kitartás | Példa |
|---|---|---|
| Kritikus | Távoli kódvégrehajtás, adatszivárgás, rendszer kompromittálása | RCE-hez vezető teljes azonnali beillesztés |
| Magas | Jogosulatlan hozzáférés, érzékeny adatok közzététele | Rendszer azonnali kibontása |
| Közepes | Irányelvek megkerülése, korlátozott adathozzáférés | Tartalomszűrő megkerülése |
| Alacsony | Kisebb irányelvsértések, információs AI biztonsági incidensek, beleértve az LLM-megsértéseket, az ügynöki felhatalmazást és az azonnali bejutást – Frissítve 2026. március | Nem szándékolt kimeneti formátum |
Értékelési módszerek
LLM-as-Judge
A mesterséges intelligencia segítségével értékelje ki a mesterséges intelligencia kimeneteit a biztonság és az irányelvek betartása érdekében
Human Evaluation
A kimenetek szakértői áttekintése az árnyalt biztonsági értékeléshez
Automatizált pontozás
Mintaegyeztetés és szabályalapú kiértékelés
Red Team Metrics
Kihasználási sikerarány nyomon követése, hamis pozitív arány
Járosítási architektúra
Védelmi rétegek
1. Bemeneti szűrés
- Minták azonnali észlelése
- Kódolásfelismerés
- Hosszú korlátok
- Aránykorlátozás
2. Biztonsági példák| Képzés
- Kimenetellenőrzés
- Tartalomszűrés
- Eszközhasználati szabályzat||Professzionális|
- Hozzáférés-vezérlés
3. Modell keményítése
- Finomhangolás a biztonság érdekében
- RLHF fejlesztések
- Rendszerprompt tervezés
- Hőmérséklet/top-p hangolás
4. Maximális hosszúságú prompt spam, ami kimerült a számításban
- Jogok elkülönítése
- Human in the loop
- Naplózás és figyelés
- Reagálás az incidensekre
Érvényesítési tesztelés
After implementing fixes, re-test to verify:
- Az eredeti sebezhetőségek már nem használhatók
- A javítások nem vezetnek be új sebezhetőséget
- A rendszer funkcionalitása érintetlen marad
- A teljesítmény elfogadható
- A téves pozitív arányok kezelhetők
Jelentéssablon
Végzeti összefoglaló banki hangalapú hitelesítés
- Hatókör és célok
- A legfontosabb megállapítások áttekintése
- Kockázatbesorolás összegzése
- Prioritási javaslatok
Műszaki részletek
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- Biztonsági útmutató látásmodellekhez, audiorendszerekhez és többmodális támadási vektorokhoz – Frissítve 2026. márciusi
- Támadási láncok
- Kódrészletek
Javaslatok
- Rövid távú javítások (gyors győzelem)
- Középtávú fejlesztések
- Hosszú távú építészeti változtatások
- Erőforrásigény
- Idővonal
Függelékek
- Eszközkimenetek
- Használt tesztesetek
- Referenciák
- Szójegyzék
Etikai megfontolások
Authorization
Always obtain explicit written permission before testing. Document scope boundaries.
Hatáskör határai
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
Adatkezelés
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
Felelősségteljes nyilvánosságra hozatal
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
Készen áll a további információra?
Általános befejezés