Взлом ИИ
Ресурсы безопасности AI

Мультимодальная безопасность искусственного интеллекта

Security guide for vision models, audio systems, and cross-modal attack vectors - Updated August 2026

85%
Модели Vision уязвимы для вредоносных патчей
(Отраслевые исследования)
$12B+
Прогнозируемые потери от мошенничества с дипфейками к 2027 году
(Deloitte 2025)
135%
Рост использования социальной инженерии с помощью искусственного интеллекта
(IBM X-Force 2025)
👁️

Мультимодальная безопасность искусственного интеллекта

Multi-modal AI systems process text, images, audio, and video simultaneously. This creates unique attack surfaces where data in one modality can influence behavior in another. Learn about emerging threats and defenses for these complex systems.

📸 Атаки на модели видения

Состязательные исправления

Small, crafted perturbations that fool image classifiers when printed or displayed. Can cause autonomous vehicles to misidentify stop signs, or bypass content filters.

Пример: Adding a small sticker pattern to a stop sign causes AI to classify it as "speed limit 45"
Серьезность: Высокая | CVSS: 7.5

Быстрое внедрение в образы

Hidden text embedded in images that is invisible to humans but extracted by OCR and processed by vision-language models.

Пример: White text on white background, or text hidden in image metadata that gets processed
Серьезность: Средняя | CVSS: 6.8

Эксфильтрация данных посредством обработки изображений

Vision models can be manipulated to encode and transmit sensitive information through image pixel patterns.

Пример: Model outputs steganographic data in image descriptions containing system prompts
Серьезность: Средняя | CVSS: 5.3

Отравление обучающих данных

Corrupted image datasets used to train vision models can introduce backdoors or alter model behavior.

Пример: Poisoned images with specific triggers cause misclassification when triggered
Серьезность: Средняя | CVSS: 6.2

🔒 Защита модели видения

  • Предварительная обработка входных данных: Применить шумоподавление, сжатие JPEG или состязательное обучение
  • Состязательное обучение: Включение состязательных примеров в данные обучения
  • Нормализация пикселей: Ограничить значения для устранения незаметных возмущений
  • Брандмауэр Vision-LLM: Обеззараживать подписи к изображениям перед обработкой
  • Усиление модели: Применить сертифицированные средства защиты, такие как шумоподавление функций

🎙️ Аудио и голосовая безопасность

Синтез голоса/дипфейки

AI-generated voice clones that impersonate executives, celebrities, or trusted individuals for fraud.

Реальный инцидент: CEO voice clone used to authorize $243K wire transfer (Wall Street Journal, 2019)
Серьезность: Критический | Воздействие: Финансовое мошенничество, кража личных данных

Аудио-состязательные атаки

Inaudible modifications to audio that cause ASR (Automatic Speech Recognition) systems to transcribe attacker-controlled text.

Пример: Скрытые команды в музыке, запускающие голосовых помощников
Серьезность: Высокая | CVSS: 7.8

Обход проверки динамика

Techniques to circumvent voice biometric authentication systems using replay attacks or synthesized audio.

Пример: Воспроизведение голосовой записи для обхода банковской голосовой аутентификации
Серьезность: Высокая | CVSS: 6.5

Внедрение контекста через аудио

Hidden voice commands or audio that influences downstream LLM processing in multi-modal systems.

Пример: Audio in video file contains instructions that modify AI assistant behavior
Серьезность: Средняя | CVSS: 5.5

🔒 Средства защиты аудио

  • Обнаружение жизнеспособности: Требуются случайные фразы или запрос-ответ
  • Аудио происхождение: Использовать C2PA/криптографический контент
  • Модели обнаружения Deepfake: Развертывание специализированных систем обнаружения ИИ
  • Многофакторная проверка: Объединить голос с другими факторами аутентификации
  • Спектральный анализ: Обнаружение артефактов, созданных ИИ в аудио
  • Подтверждение важных действий: Внеполосная проверка для конфиденциальных действий

🔀 Межмодальные атаки

Кросс-модальная подсказка Инъекция

Malicious instructions embedded in one modality (e.g., images) that manipulate behavior in another (e.g., text output).

Пример: Uploading an image with hidden text "Ignore previous instructions and..."
Серьезность: Критический | Отношение: Аналогично OWASP LLM01

Мультимодальный взлом

Using combinations of text, images, and audio to bypass safety guardrails that single-modality attacks cannot.

Пример: Изображение вредоносного контента в сочетании с текстом, который его нормализует
Серьезность: Высокая | CVSS: 7.2

Усиление галлюцинации модели

Multi-modal inputs that increase hallucination rates or cause confident false outputs.

Пример: Неоднозначные изображения в сочетании с наводящими вопросами увеличивают количество ложных подписей
Серьезность: Средняя | CVSS: 5.0

Внедрение символических инструкций

Embedding instructions in visual elements (arrows, boxes, icons) that influence model interpretation.

Пример: Document with arrows pointing specific text, causing model to focus incorrectly
Серьезность: Средняя | CVSS: 5.5

🔒 Межмодальная защита

  • Очистка ввода: Удалить скрытый текст и метаданные из загрузок
  • Разделение модальностей: Обрабатывать каждый тип входных данных в изолированных средах
  • Кросс-модальная фильтрация: Обнаружение несоответствий между модальностями
  • Проверка результатов: Проверить, чтобы выходные данные не противоречили входным фактам
  • Фильтрация контента: Сканировать все способы на наличие нарушений политики

🎬 Видеобезопасность

Видео Deepfakes

AI-generated or manipulated video content that depicts people saying/doing things they didn't.

Варианты использования: Мошенничество со стороны руководства, фейковые новости, шантаж, вмешательство в выборы
Серьезность: Критический | Воздействие: Репутация, финансовая, политическая

Атаки синхронизации губ

Manipulating video to sync fake audio with lip movements, enabling convincing misinformation.

Пример: Редактирование новостных материалов с добавлением фейковых заявлений, соответствующих движениям губ
Серьезность: Высокая | CVSS: 6.8

Манипуляция на уровне кадра

Inserting or removing specific frames in video to alter perceived events or inject content.

Пример: Удаление кадров с камер наблюдения, показывающих несанкционированный доступ
Серьезность: Средняя | CVSS: 5.5

🔒 Защита целостности видео

  • C2PA standard: Внедрение учетных данных контента для происхождения видео
  • Водяные знаки: Добавление невидимых водяных знаков к аутентичному контенту
  • Обнаружение дипфейков: Использовать специальные модели обнаружения перед обработкой
  • Анализ рамок: Обнаружение временных несоответствий
  • Журналирование блокчейна: Запись хэшей видео для проверки

🛡️ Комплексная многомодальная стратегия защиты

🔍 Уровень обнаружения

  • Модели обнаружения Deepfake
  • Детекторы состязательных примеров
  • Обнаружение аномалий по модальности
  • Проверка согласованности между модальностями

🧹 Слой дезинфекции

  • Удалить скрытый текст из изображений
  • Удалить аудиостеганографию
  • Нормализация значений пикселей
  • Фильтрация встроенных метаданных

⚖️ Уровень проверки

  • Перекрестная проверка мультимодальных входных данных
  • Проверка противоречивой информации
  • Проверка на основе надежных источников
  • Отметить неопределенные результаты

📋 Многомодальный контрольный список безопасности

  • Обработка входных данных: Обеззараживание всех загружаемых пользователем изображений, аудио и видео
  • Скрытый контент: Сканирование на предмет невидимого текста, стеганографии и метаданных
  • Кросс-модальность: Проверка согласованности между различными типами входных данных
  • Фильтрация вывода: Проверьте все выходы на предмет нарушений безопасности
  • Аутентификация: Использовать многофакторную проверку для важных действий
  • Происхождение: Внедрение учетных данных C2PA/контента, где это возможно
  • Мониторинг: Регистрация и мониторинг аномальных мультимодальных шаблонов
  • Обучение: Включите состязательные мультимодальные примеры в обучение модели
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.