Yo hackeo
Recursos de seguridad

Seguridad de IA multimodal

Security guide for vision models, audio systems, and cross-modal attack vectors - Updated August 2026

85%
Modelos de misión vulnerables a parches adversos.
Investigación de la industria)
$12B+
Pérdidas por fraude deepfake proyectadas para 2027
Deloitte 2025)
135%
Aumento de la ingeniería social asistida por IA.
IBM X-Force 2025)
👁️

Seguridad de IA multimodal

Multi-modal AI systems process text, images, audio, and video simultaneously. This creates unique attack surfaces where data in one modality can influence behavior in another. Learn about emerging threats and defenses for these complex systems.

Ataques de modelos de visión

Parches adversarios

Small, crafted perturbations that fool image classifiers when printed or displayed. Can cause autonomous vehicles to misidentify stop signs, or bypass content filters.

ejemplo: Adding a small sticker pattern to a stop sign causes AI to classify it as "speed limit 45"
cada vez: alto | VSS: 7.5

Inyección rompt en imágenes

Hidden text embedded in images that is invisible to humans but extracted by OCR and processed by vision-language models.

ejemplo: White text on white background, or text hidden in image metadata that gets processed
cada vez: edio | VSS: 6.8

Exfiltración de datos mediante procesamiento de imágenes

Vision models can be manipulated to encode and transmit sensitive information through image pixel patterns.

ejemplo: Model outputs steganographic data in image descriptions containing system prompts
cada vez: edio | VSS: 5.3

Lloviendo envenenamiento de datos

Corrupted image datasets used to train vision models can introduce backdoors or alter model behavior.

ejemplo: Poisoned images with specific triggers cause misclassification when triggered
cada vez: edio | VSS: 6.2

Defensas del modelo de visión

  • preprocesamiento de entrada: Aplicar eliminación de ruido, compresión JPEG o entrenamiento adversario.
  • entrenamiento contradictorio: Incluir ejemplos contradictorios en los datos de entrenamiento.
  • normalización de ixel: valores de lámpara para eliminar perturbaciones imperceptibles
  • Cortafuegos ision-LLM: anitizar los títulos de las imágenes antes de procesarlas
  • endurecimiento del modelo: Aplicar defensas certificadas como la eliminación de ruido de funciones.

️ Seguridad de audio y voz

Síntesis de voz / Deepfakes

AI-generated voice clones that impersonate executives, celebrities, or trusted individuals for fraud.

Incidente real: CEO voice clone used to authorize $243K wire transfer (Wall Street Journal, 2019)
cada vez: crítico | impacto: fraude financiero, robo de identidad

Ataques adversarios de audio

Inaudible modifications to audio that cause ASR (Automatic Speech Recognition) systems to transcribe attacker-controlled text.

ejemplo: Comandos ocultos en la música que activan asistentes de voz.
cada vez: alto | VSS: 7.8

Omisión de verificación de Peaker

Techniques to circumvent voice biometric authentication systems using replay attacks or synthesized audio.

ejemplo: Reproducción de grabaciones de voz para evitar la autenticación de voz bancaria.
cada vez: alto | VSS: 6.5

Inyección de ontext a través de audio

Hidden voice commands or audio that influences downstream LLM processing in multi-modal systems.

ejemplo: Audio in video file contains instructions that modify AI assistant behavior
cada vez: edio | VSS: 5.5

Defensas de seguridad de audio

  • detección de actividad: requerir frases aleatorias o desafío-respuesta
  • procedencia del audio: se C2PA/Contenido criptográfico认证
  • Modelos de detección de eepfake: emplear sistemas de detección de IA dedicados
  • verificación multifactorial: combinar voz con otros factores de autenticación
  • análisis pectral: Detectar artefactos generados por IA en audio
  • confirmación de acción de alto valor: Verificación fuera de banda para acciones sensibles.

Ataques multimodales

Inyección rápida modal de Ross

Malicious instructions embedded in one modality (e.g., images) that manipulate behavior in another (e.g., text output).

ejemplo: Uploading an image with hidden text "Ignore previous instructions and..."
cada vez: crítico | elación: similar a OWASP LLM01

Jailbreak ultimodal

Using combinations of text, images, and audio to bypass safety guardrails that single-modality attacks cannot.

ejemplo: Imagen de contenido dañino combinado con texto que lo normaliza.
cada vez: alto | VSS: 7.2

Modelo de amplificación de alucinaciones.

Multi-modal inputs that increase hallucination rates or cause confident false outputs.

ejemplo: Las imágenes ambiguas combinadas con preguntas capciosas aumentan los subtítulos falsos.
cada vez: edio | VSS: 5.0

Inyección de instrucciones simbólicas

Embedding instructions in visual elements (arrows, boxes, icons) that influence model interpretation.

ejemplo: Document with arrows pointing specific text, causing model to focus incorrectly
cada vez: edio | VSS: 5.5

Defensas intermodales

  • desinfección de entrada: viaje texto oculto y metadatos de las cargas
  • separación de odalidades: procesar cada tipo de entrada en entornos aislados
  • filtrado ross-modal: detectar inconsistencias entre modalidades
  • validación de salida: verificar que las salidas no contradicen los datos de entrada
  • filtrado de contenido: ¿Pueden todas las modalidades por violaciones de políticas?

Vídeo de seguridad

deepfakes

AI-generated or manipulated video content that depicts people saying/doing things they didn't.

Algunos casos: fraude ejecutivo, noticias falsas, chantaje, interferencia electoral
cada vez: crítico | impacto: reputación, financiero, político

Ataques de sincronización de IP

Manipulating video to sync fake audio with lip movements, enabling convincing misinformation.

ejemplo: Editar imágenes de noticias para agregar declaraciones falsas que coincidan con los movimientos de los labios.
cada vez: alto | VSS: 6.8

Manipulación a nivel de ram

Inserting or removing specific frames in video to alter perceived events or inject content.

ejemplo: Eliminación de marcos de cámaras de seguridad que muestran acceso no autorizado.
cada vez: edio | VSS: 5.5

Defensas de integridad del vídeo

  • C2PA standard: Implementar credenciales de contenido para la procedencia del video.
  • atermarking: agregar marcas de agua invisibles al contenido auténtico
  • detección de falsos: Se utilizan modelos de detección dedicados antes del procesamiento.
  • análisis de ram: detectar inconsistencias temporales
  • registro de cadena de bloqueo: Grabar hashes de vídeo para verificación.

️ Estrategia integral de defensa multimodal

Capa de detección

  • modelos de detección de eepfake
  • detectores de ejemplo contradictorios
  • detección de anomalías por modalidad
  • Comprobación de coherencia entre modalidades.

Capa de desinfección

  • viaje texto oculto de imágenes
  • eliminar la esteganografía de audio
  • normalizar los valores de píxeles
  • filtrar metadatos incrustados

️ Capa de validación

  • ross-verificar entradas multimodales
  • diablos por información contradictoria
  • alidar contra fuentes confiables
  • retrasar resultados inciertos

Lista de verificación de seguridad multimodal

  • Procesamiento de entrada: anitizar todas las imágenes, audio y videos subidos por los usuarios
  • Contenido identificado: lata para texto invisible, esteganografía y metadatos
  • Modalidad Ross: Alidar la coherencia entre diferentes tipos de entrada.
  • Filtrado de salida: Compruebe todas las salidas en busca de violaciones de seguridad.
  • autenticación: ver verificación multifactor para acciones de alto valor
  • rogación: Implementar C2PA/credenciales de contenido cuando sea posible.
  • seguimiento: Registrar y monitorear patrones multimodales anómalos
  • lloviendo: Incluir ejemplos multimodales contradictorios en el entrenamiento de modelos.
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.