Απειλές συστήματος τεχνητής νοημοσύνης
Περιεκτικός κατάλογος χειρισμών επιθέσεων vulner και ειδικών για το AI
Κρίσιμες απειλές
Immediate risks with potential for severe impact. Require urgent remediation.
Υψηλού κινδύνου
Serious vulnerabilities that should be addressed promptly to reduce exposure.
Στρατηγικές άμυνας
Βέλτιστες πρακτικές και μετριασμούς για τη μείωση της έκθεσης σε απειλές τεχνητής νοημοσύνης.
Κατηγορίες απειλών
Prompt Injection
CriticalCrafted inputs designed to manipulate model behavior, override safeguards, or extract sensitive information.
Προσέγγιση δοκιμής
- Craft adversarial prompts with hidden instructions or special characters
- Attempt multi-turn injection chaining
- Test for jailbreak bypass of alignment filters
- Evaluate output sanitization and safety layers
Training Data Poisoning
CriticalMalicious or biased data introduced into training pipelines, compromising model integrity and reliability.
Προσέγγιση δοκιμής
- Analyze data provenance and supply chain
- Inject poisoned samples and assess downstream effects
- Test resilience to mislabeled or manipulated data
- Review validation and anomaly detection mechanisms
Model Inversion
HighReconstructing training data or sensitive attributes from model outputs, leading to privacy breaches.
Προσέγγιση δοκιμής
- Attempt to recover representative training samples
- Test susceptibility to membership inference attacks
- Evaluate differential privacy protections
- Assess risk of leaking PII from embeddings
Adversarial Examples
HighInputs intentionally perturbed to cause misclassification, hallucinations, or other erroneous outputs.
Προσέγγιση δοκιμής
- Generate gradient-based adversarial examples
- Apply noise and perturbation attacks
- Check model consistency across variations
- Evaluate robustness against transfer attacks
Model Stealing
HighExtraction of model functionality or parameters through repeated queries or side-channel analysis.
Προσέγγιση δοκιμής
- Simulate query-based model extraction
- Analyze API rate limits and response variability
- Check for fingerprinting vulnerabilities
- Test throttling and monitoring protections
Data Memorization Leakage
HighSensitive information unintentionally memorized by AI models, retrievable via crafted prompts.
Προσέγγιση δοκιμής
- Probe for known secret patterns in outputs
- Test for repeated exposure of sensitive training data
- Assess risk of accidental PII disclosure
Model Misuse & Malicious Automation
HighAI leveraged to perform tasks outside intended scope, enabling social engineering, spam, or automated attacks.
Προσέγγιση δοκιμής
- Simulate misuse scenarios using sandbox models
- Test AI output moderation and guardrails
- Assess monitoring alerts for abnormal behaviors
Βέλτιστες πρακτικές δοκιμής και άμυνας
Ασφαλές περιβάλλον δοκιμών
- Χρησιμοποιήστε sandboxed|Με παραδοσιακές δοκιμές | Τα συστήματα πρακτορικής τεχνητής νοημοσύνης σχεδιάζουν, αποφασίζουν, αναθέτουν και ενεργούν μεταξύ εργαλείων και συστημάτων. Αυτό δημιουργεί νέες επιφάνειες επίθεσης που απαιτούν εξειδικευμένες προσεγγίσεις ασφαλείας.
- Μην εκτελείτε ποτέ μη εξουσιοδοτημένες δοκιμές σε συστήματα παραγωγής
- Εφαρμογή δυνατοτήτων παρακολούθησης, καταγραφής και επαναφοράς
Τεκμηρίωση & Παρατηρησιμότητα
- Διατηρήστε λεπτομερή αρχεία καταγραφής δοκιμών και αποδεικτικά στοιχεία
- Λήψη αποκρίσεων μοντέλου για αναπαραγωγιμότητα
- Σχετικοί πόροι
Νομική και ηθική συμμόρφωση
- Μείνετε εντός του εξουσιοδοτημένου πλαισίου|SMITE|Praaktic|Garaktic| και Promptfoo
- Σεβάστε την προστασία δεδομένων, τους νόμους απορρήτου και την πνευματική ιδιοκτησία
- Ακολουθήστε την υπεύθυνη αποκάλυψη και τη συντονισμένη αποκάλυψη ευπάθειας
Παρακολούθηση και μετριασμός
- Εφαρμογή ανίχνευσης ανωμαλιών για ασυνήθιστες εξόδους AI
- Ελέγχετε τακτικά τα όρια ρυθμού, την πρόσβαση API και τα μοτίβα ερωτημάτων
- Ενσωματώστε ειδοποιήσεις σε πραγματικό χρόνο για κρίσιμες απειλές