Menaces du système d'IA
Catalogue complet des vulnérabilités et des vecteurs d'attaque spécifiques à l'IA
Menaces critiques
Immediate risks with potential for severe impact. Require urgent remediation.
Risque élevé
Serious vulnerabilities that should be addressed promptly to reduce exposure.
Stratégies de défense
Meilleures pratiques et mesures d'atténuation pour réduire l'exposition aux menaces de l'IA.
Catégories de menaces
Prompt Injection
CriticalCrafted inputs designed to manipulate model behavior, override safeguards, or extract sensitive information.
Approche de test
- Craft adversarial prompts with hidden instructions or special characters
- Attempt multi-turn injection chaining
- Test for jailbreak bypass of alignment filters
- Evaluate output sanitization and safety layers
Training Data Poisoning
CriticalMalicious or biased data introduced into training pipelines, compromising model integrity and reliability.
Approche de test
- Analyze data provenance and supply chain
- Inject poisoned samples and assess downstream effects
- Test resilience to mislabeled or manipulated data
- Review validation and anomaly detection mechanisms
Model Inversion
HighReconstructing training data or sensitive attributes from model outputs, leading to privacy breaches.
Approche de test
- Attempt to recover representative training samples
- Test susceptibility to membership inference attacks
- Evaluate differential privacy protections
- Assess risk of leaking PII from embeddings
Adversarial Examples
HighInputs intentionally perturbed to cause misclassification, hallucinations, or other erroneous outputs.
Approche de test
- Generate gradient-based adversarial examples
- Apply noise and perturbation attacks
- Check model consistency across variations
- Evaluate robustness against transfer attacks
Model Stealing
HighExtraction of model functionality or parameters through repeated queries or side-channel analysis.
Approche de test
- Simulate query-based model extraction
- Analyze API rate limits and response variability
- Check for fingerprinting vulnerabilities
- Test throttling and monitoring protections
Data Memorization Leakage
HighSensitive information unintentionally memorized by AI models, retrievable via crafted prompts.
Approche de test
- Probe for known secret patterns in outputs
- Test for repeated exposure of sensitive training data
- Assess risk of accidental PII disclosure
Model Misuse & Malicious Automation
HighAI leveraged to perform tasks outside intended scope, enabling social engineering, spam, or automated attacks.
Approche de test
- Simulate misuse scenarios using sandbox models
- Test AI output moderation and guardrails
- Assess monitoring alerts for abnormal behaviors
Meilleures pratiques de test et de défense
Environnement de test sécurisé
- Utiliser des instances en bac à sable ou des répliques pour les tests
- N'effectuez jamais de tests non autorisés sur les systèmes de production
- Implémenter des fonctionnalités de surveillance, de journalisation et de restauration
Documentation et observabilité
- Maintenir des journaux de test détaillés et des preuves
- Capturez les réponses du modèle pour la reproductibilité
- Étiqueter, classer et organiser les cas de test pour les audits futurs
Conformité juridique et éthique
- Rester dans la portée et les contrats autorisés
- Respecter la protection des données, les lois sur la confidentialité et la propriété intellectuelle
- Suivez la divulgation responsable et la divulgation coordonnée des vulnérabilités
Surveillance et atténuation
- Implémenter la détection des anomalies pour les sorties inhabituelles de l'IA
- Réviser régulièrement les limites de débit, l'accès aux API et les modèles de requêtes
- Intégrer des alertes en temps réel pour les menaces critiques.