AI Hacking
Recursos de segurança de IA

Segurança de IA multimodal

Security guide for vision models, audio systems, and cross-modal attack vectors - Updated August 2026

85%
Modelos de visão vulneráveis a patches adversários
(Pesquisa do setor)
$12B+
Perdas projetadas por fraudes deepfake até 2027
(Deloitte 2025)
135%
Aumento na engenharia social assistida por IA
(IBM X-Force 2025)
👁️

Segurança de IA multimodal

Multi-modal AI systems process text, images, audio, and video simultaneously. This creates unique attack surfaces where data in one modality can influence behavior in another. Learn about emerging threats and defenses for these complex systems.

📸 Ataques de modelo de visão

Patches Adversariais

Small, crafted perturbations that fool image classifiers when printed or displayed. Can cause autonomous vehicles to misidentify stop signs, or bypass content filters.

Exemplo: Adding a small sticker pattern to a stop sign causes AI to classify it as "speed limit 45"
Gravidade: Alto | CVSS: 7.5

Injeção imediata em imagens

Hidden text embedded in images that is invisible to humans but extracted by OCR and processed by vision-language models.

Exemplo: White text on white background, or text hidden in image metadata that gets processed
Gravidade: Média | CVSS: 6.8

Exfiltração de dados via processamento de imagem

Vision models can be manipulated to encode and transmit sensitive information through image pixel patterns.

Exemplo: Model outputs steganographic data in image descriptions containing system prompts
Gravidade: Média | CVSS: 5.3

Envenenamento de dados de treinamento

Corrupted image datasets used to train vision models can introduce backdoors or alter model behavior.

Exemplo: Poisoned images with specific triggers cause misclassification when triggered
Gravidade: Média | CVSS: 6.2

🔒 Defesas do modelo de visão

  • Pré-processamento de entrada: Aplicar remoção de ruído, compactação JPEG ou treinamento adversário
  • Treinamento adversário: Inclua exemplos de adversários em dados de treinamento
  • Normalização de pixels: Fixar valores para remover perturbações imperceptíveis
  • Firewall Vision-LLM: Sanitizar legendas de imagens antes do processamento
  • Enforcamento do modelo: Aplicar defesas certificadas como remoção de ruído de recursos

🎙️ Segurança de áudio e voz

Síntese de voz / Deepfakes

AI-generated voice clones that impersonate executives, celebrities, or trusted individuals for fraud.

Incidente real: CEO voice clone used to authorize $243K wire transfer (Wall Street Journal, 2019)
Gravidade: Crítica | Impacto: Fraude financeira, roubo de identidade

Ataques adversários de áudio

Inaudible modifications to audio that cause ASR (Automatic Speech Recognition) systems to transcribe attacker-controlled text.

Exemplo: Comandos ocultos na música que acionam assistentes de voz
Gravidade: Alto | CVSS: 7.8

Ignorar verificação de alto-falante

Techniques to circumvent voice biometric authentication systems using replay attacks or synthesized audio.

Exemplo: Reproduzindo a gravação de voz para ignorar a autenticação de voz bancária
Gravidade: Alto | CVSS: 6.5

Injeção de contexto via áudio

Hidden voice commands or audio that influences downstream LLM processing in multi-modal systems.

Exemplo: Audio in video file contains instructions that modify AI assistant behavior
Gravidade: Média | CVSS: 5.5

🔒 Defesas de segurança de áudio

  • Detecção de atividade: Exigir frases aleatórias ou resposta a desafios
  • Proveniência do áudio: Usar conteúdo C2PA/criptográfico认证
  • Modelos de detecção de Deepfake: Implementar sistemas de detecção de IA dedicados
  • Verificação multifatorial: Combine voz com outros fatores de autenticação
  • Análise espectral: Detectar artefatos gerados por IA em áudio
  • Confirmação de ação de alto valor: Verificação fora de banda para ações confidenciais

🔀 Ataques Cross-Modal

Injeção de prompt entre modal

Malicious instructions embedded in one modality (e.g., images) that manipulate behavior in another (e.g., text output).

Exemplo: Uploading an image with hidden text "Ignore previous instructions and..."
Gravidade: Crítica | Relação: Semelhante ao OWASP LLM01

Jailbreaking multimodal

Using combinations of text, images, and audio to bypass safety guardrails that single-modality attacks cannot.

Exemplo: Imagem de conteúdo prejudicial combinada com texto que o normaliza
Gravidade: Alto | CVSS: 7.2

Amplificação de alucinação de modelo

Multi-modal inputs that increase hallucination rates or cause confident false outputs.

Exemplo: Imagens ambíguas combinadas com perguntas principais aumentam legendas falsas
Gravidade: Média | CVSS: 5.0

Injeção de instruções simbólicas

Embedding instructions in visual elements (arrows, boxes, icons) that influence model interpretation.

Exemplo: Document with arrows pointing specific text, causing model to focus incorrectly
Gravidade: Média | CVSS: 5.5

🔒 Defesas intermodais

  • Sanitização de entrada: Retirar texto e metadados ocultos de uploads
  • Separação de modalidade: Processar cada tipo de entrada em ambientes isolados
  • Filtragem entre modais: Detecte inconsistências entre modalidades
  • Validação de saída: Verifique se os resultados não contradizem os fatos de entrada
  • Filtragem de conteúdo: Verificar todas as modalidades em busca de violações de política

🎬 Segurança de vídeo

Video Deepfakes

AI-generated or manipulated video content that depicts people saying/doing things they didn't.

Casos de uso: Fraude executiva, notícias falsas, chantagem, interferência eleitoral
Gravidade: Crítica | Impacto: Reputação, financeira, política

Ataques Lip Sync

Manipulating video to sync fake audio with lip movements, enabling convincing misinformation.

Exemplo: Editando imagens de notícias para adicionar declarações falsas que correspondam aos movimentos dos lábios
Gravidade: Alto | CVSS: 6.8

Manipulação em nível de quadro

Inserting or removing specific frames in video to alter perceived events or inject content.

Exemplo: Remoção de quadros de câmeras de segurança que mostram acesso não autorizado
Gravidade: Média | CVSS: 5.5

🔒 Defesas de integridade de vídeo

  • C2PA standard: Implementar credenciais de conteúdo para proveniência de vídeo
  • Marca d'água: Adicionar marcas d'água invisíveis ao conteúdo autêntico
  • Detecção de Deepfake: Use modelos de detecção dedicados antes do processamento
  • Análise de estrutura: Detectar inconsistências temporais
  • Registro de blockchain: Gravar hashes de vídeo para verificação

🛡️ Estratégia abrangente de defesa multimodal

🔍 Camada de detecção

  • Modelos de detecção de deepfake
  • Exemplos de detectores adversários
  • Detecção de anomalias por modalidade
  • Verificação de consistência entre modalidades

🧹 Camada de higienização

  • Retirar texto oculto de imagens
  • Remover esteganografia de áudio
  • Normalizar valores de pixels
  • Filtrar metadados incorporados

⚖️ Camada de validação

  • Verificação cruzada de entradas multimodais
  • Verificar informações contraditórias
  • Validar em fontes confiáveis
  • Sinalizar resultados incertos

📋 Lista de verificação de segurança multimodal

  • Processamento de entrada: Sanitize todas as imagens, áudio e vídeo carregados pelo usuário
  • Conteúdo oculto: Verificar texto invisível, esteganografia e metadados
  • Modalidade cruzada: Validar a consistência entre diferentes tipos de entrada
  • Filtragem de saída: Verifique todas as saídas em busca de violações de segurança
  • Autenticação: Use verificação multifatorial para ações de alto valor
  • Proveniência: Implementar credenciais C2PA/conteúdo sempre que possível
  • Monitoramento: Registre e monitore padrões multimodais anômalos
  • Treinamento: Incluir exemplos multimodais adversários no treinamento do modelo
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.