AI rendszert fenyegető veszélyek
Az AI-specifikus sebezhetőségek és támadási vektorok átfogó katalógusa
Kritikus veszélyek
Immediate risks with potential for severe impact. Require urgent remediation.
Magas kockázatú
Serious vulnerabilities that should be addressed promptly to reduce exposure.
Védelmi stratégiák
Bevált módszerek és mérséklések az AI-fenyegetettség csökkentésére.
Fenyegetési kategóriák
Prompt Injection
CriticalCrafted inputs designed to manipulate model behavior, override safeguards, or extract sensitive information.
Tesztelési módszer
- Craft adversarial prompts with hidden instructions or special characters
- Attempt multi-turn injection chaining
- Test for jailbreak bypass of alignment filters
- Evaluate output sanitization and safety layers
Training Data Poisoning
CriticalMalicious or biased data introduced into training pipelines, compromising model integrity and reliability.
Tesztelési módszer
- Analyze data provenance and supply chain
- Inject poisoned samples and assess downstream effects
- Test resilience to mislabeled or manipulated data
- Review validation and anomaly detection mechanisms
Model Inversion
HighReconstructing training data or sensitive attributes from model outputs, leading to privacy breaches.
Tesztelési módszer
- Attempt to recover representative training samples
- Test susceptibility to membership inference attacks
- Evaluate differential privacy protections
- Assess risk of leaking PII from embeddings
Adversarial Examples
HighInputs intentionally perturbed to cause misclassification, hallucinations, or other erroneous outputs.
Tesztelési módszer
- Generate gradient-based adversarial examples
- Apply noise and perturbation attacks
- Check model consistency across variations
- Evaluate robustness against transfer attacks
Model Stealing
HighExtraction of model functionality or parameters through repeated queries or side-channel analysis.
Tesztelési módszer
- Simulate query-based model extraction
- Analyze API rate limits and response variability
- Check for fingerprinting vulnerabilities
- Test throttling and monitoring protections
Data Memorization Leakage
HighSensitive information unintentionally memorized by AI models, retrievable via crafted prompts.
Tesztelési módszer
- Probe for known secret patterns in outputs
- Test for repeated exposure of sensitive training data
- Assess risk of accidental PII disclosure
Model Misuse & Malicious Automation
HighAI leveraged to perform tasks outside intended scope, enabling social engineering, spam, or automated attacks.
Tesztelési módszer
- Simulate misuse scenarios using sandbox models
- Test AI output moderation and guardrails
- Assess monitoring alerts for abnormal behaviors
Tesztelés és védelem legjobb gyakorlatai
Biztonságos tesztelési környezet
- Delegált vagy replikapéldányokat használjon a hagyományos AI teszteléshez, tervezze meg az ügynököt,| A hagyományos teszteléshez || és az eszközökön és rendszereken átívelő hatást fejt ki. Ez új támadási felületeket hoz létre, amelyek speciális biztonsági megközelítéseket igényelnek.
- Hálózati szegmentálás
- Megfigyelési, naplózási és visszaállítási lehetőségek alkalmazása
Dokumentáció és megfigyelhető paraméterek
- Részletes tesztnaplók és bizonyítékok kezelése
- Modellválaszok rögzítése a reprodukálhatóság érdekében
- Tesztesetek címkézése, osztályozása és rendszerezése a jövőbeni ellenőrzésekhez
Jogi és etikai megfelelőség
- Stay within authorized scope and contracts
- Tartsa be az adatvédelmet, az adatvédelmi törvényeket és a szellemi tulajdont
- Kövesse a felelősségteljes közzétételt és a sebezhetőség összehangolt feltárását
Monitoring & Mitigation
- Anomália-észlelés alkalmazása szokatlan AI-kimeneteknél
- Regularly review rate limits, API access, and query patterns
- Integrate real-time alerting for critical threats