Системные угрозы AI
Полный каталог уязвимостей, специфичных для ИИ, и векторов атак
Критические угрозы
Immediate risks with potential for severe impact. Require urgent remediation.
Высокий риск
Serious vulnerabilities that should be addressed promptly to reduce exposure.
Стратегии защиты
Передовые методы и меры по снижению воздействия угроз ИИ.
Категории угроз
Prompt Injection
CriticalCrafted inputs designed to manipulate model behavior, override safeguards, or extract sensitive information.
Подход к тестированию
- Craft adversarial prompts with hidden instructions or special characters
- Attempt multi-turn injection chaining
- Test for jailbreak bypass of alignment filters
- Evaluate output sanitization and safety layers
Training Data Poisoning
CriticalMalicious or biased data introduced into training pipelines, compromising model integrity and reliability.
Подход к тестированию
- Analyze data provenance and supply chain
- Inject poisoned samples and assess downstream effects
- Test resilience to mislabeled or manipulated data
- Review validation and anomaly detection mechanisms
Model Inversion
HighReconstructing training data or sensitive attributes from model outputs, leading to privacy breaches.
Подход к тестированию
- Attempt to recover representative training samples
- Test susceptibility to membership inference attacks
- Evaluate differential privacy protections
- Assess risk of leaking PII from embeddings
Adversarial Examples
HighInputs intentionally perturbed to cause misclassification, hallucinations, or other erroneous outputs.
Подход к тестированию
- Generate gradient-based adversarial examples
- Apply noise and perturbation attacks
- Check model consistency across variations
- Evaluate robustness against transfer attacks
Model Stealing
HighExtraction of model functionality or parameters through repeated queries or side-channel analysis.
Подход к тестированию
- Simulate query-based model extraction
- Analyze API rate limits and response variability
- Check for fingerprinting vulnerabilities
- Test throttling and monitoring protections
Data Memorization Leakage
HighSensitive information unintentionally memorized by AI models, retrievable via crafted prompts.
Подход к тестированию
- Probe for known secret patterns in outputs
- Test for repeated exposure of sensitive training data
- Assess risk of accidental PII disclosure
Model Misuse & Malicious Automation
HighAI leveraged to perform tasks outside intended scope, enabling social engineering, spam, or automated attacks.
Подход к тестированию
- Simulate misuse scenarios using sandbox models
- Test AI output moderation and guardrails
- Assess monitoring alerts for abnormal behaviors
Лучшие практики тестирования и защиты
Безопасная среда тестирования
- Использовать изолированные экземпляры или экземпляры-реплики для тестирования
- Никогда не проводите несанкционированные тесты на производственных системах
- Внедрить возможности мониторинга, ведения журнала и отката
Документация и наблюдаемость
- Ведение подробных журналов испытаний и доказательств
- Захват ответов модели для обеспечения воспроизводимости
- Тегирование, классификация и организация тестовых случаев для будущих аудитов
Соответствие правовым и этическим нормам
- Оставайтесь в пределах разрешенного объема и контрактов
- Соблюдайте защиту данных, законы о конфиденциальности и интеллектуальную собственность
- Следуйте ответственному раскрытию информации и скоординированному раскрытию уязвимостей
Мониторинг и смягчение последствий
- Реализовать обнаружение аномалий для необычных выходных данных ИИ
- Регулярно проверять ограничения скорости, доступ к API и шаблоны запросов
- Интегрировать оповещения в режиме реального времени о критических угрозах