AI-hackning
Omfattande katalog över AI-specifika sårbarheter och attackvektorer.

Multimodal AI-säkerhet

Security guide for vision models, audio systems, and cross-modal attack vectors - Updated August 2026

85%
Visionsmodeller som är sårbara för motstridiga korrigeringar
(Industry Research)
$12B+
Projected deepfake bedrägeriförluster senast 2027
Ändra modellbeteende genom förgiftning eller finjusterande attacker
135%
Ökning av AI-assisterad social ingenjörskonst
(IBM X-Force 2025)
👁️

Multimodal AI-säkerhet

Multi-modal AI systems process text, images, audio, and video simultaneously. This creates unique attack surfaces where data in one modality can influence behavior in another. Learn about emerging threats and defenses for these complex systems.

📸 Vision Model Attacks

Adversariella patchar

Small, crafted perturbations that fool image classifiers when printed or displayed. Can cause autonomous vehicles to misidentify stop signs, or bypass content filters.

Exempel: Adding a small sticker pattern to a stop sign causes AI to classify it as "speed limit 45"
Allvarlighet: Hög | CVSS: 7.5

Snabb injektion i bilder

Hidden text embedded in images that is invisible to humans but extracted by OCR and processed by vision-language models.

Exempel: White text on white background, or text hidden in image metadata that gets processed
Allvarlighet: Medellång | CVSS: 6.8

Dataexfiltrering via bildbearbetning

Vision models can be manipulated to encode and transmit sensitive information through image pixel patterns.

Exempel: Model outputs steganographic data in image descriptions containing system prompts
Allvarlighet: Medellång | CVSS: 5.3

Träningsdataförgiftning

Corrupted image datasets used to train vision models can introduce backdoors or alter model behavior.

Exempel: Poisoned images with specific triggers cause misclassification when triggered
Allvarlighet: Medellång | CVSS: 6.2

🔒 Vision Model Defenses

  • Indataförbearbetning: Tillämpa denoising, JPEG-komprimering eller kontradiktorisk träning
  • |Adversarial träning Inkludera motstridiga exempel i träningsdata
  • 1. Oautentiserade servrar Kläm in värden för att ta bort omärkliga störningar
  • | adversarial examples Sanitize| Pentester → AI Pentester
  • Modellhärdning: Tillämpa certifierade försvar som funktionsnedbrytning

🎙️ Ljud- och röstsäkerhet

Röstsyntes / Deepfakes

AI-generated voice clones that impersonate executives, celebrities, or trusted individuals for fraud.

Verklig incident: CEO voice clone used to authorize $243K wire transfer (Wall Street Journal, 2019)
Allvarlighet: Kritiska | Social engineering awareness Finansiellt bedrägeri, identitetsstöld

Ljud

Inaudible modifications to audio that cause ASR (Automatic Speech Recognition) systems to transcribe attacker-controlled text.

Exempel: Golda kommandon i musik som utlöser röstassistenter
Allvarlighet: Hög | CVSS: 7.8

Speaker Verification Bypass

Techniques to circumvent voice biometric authentication systems using replay attacks or synthesized audio.

Exempel: Spelar upp röstinspelning för att kringgå bankröstautentisering
Allvarlighet: Hög | CVSS: 6.5

Context Injection via Audio

Hidden voice commands or audio that influences downstream LLM processing in multi-modal systems.

Exempel: Audio in video file contains instructions that modify AI assistant behavior
Allvarlighet: Medellång | CVSS: 5.5

🔒 Ljudsäkerhetsförsvar

  • Minimera störningar i affärsverksamheten Kräv slumpmässiga fraser eller utmaning-svar
  • Ljudhärkomst: Använd C2PA/Kryptografiskt innehåll认证-|fattern för matchning:|fattern injection
  • Attacker för meddelandeåteruppspelning i agentarbetsflöden Distribuera dedikerade AI-detektionssystem
  • GPT-modeller, Assistants API Kombinera röst med andra autentiseringsfaktorer
  • Spektralanalys: Detektera AI-genererade artefakter i ljud
  • Högvärde åtgärdsbekräftelse: Out-of-band Adverified| gränser för input/output token

🔀 Cross-Modal Attacks

Cross-Modal Prompt Injection

Malicious instructions embedded in one modality (e.g., images) that manipulate behavior in another (e.g., text output).

Exempel: Uploading an image with hidden text "Ignore previous instructions and..."
Allvarlighet: Kritiska | Relation: Liknande som LALM01-säkerhet

Multimodal Jailbreaking

Using combinations of text, images, and audio to bypass safety guardrails that single-modality attacks cannot.

Exempel: Bild av skadligt innehåll parat med text som normaliserar det
Allvarlighet: Hög | CVSS: 7.2

Modell Hallucinationsförstärkning

Multi-modal inputs that increase hallucination rates or cause confident false outputs.

Exempel: Tvetydiga bilder parade med ledande frågor ökar falska bildtexter
Allvarlighet: Medellång | CVSS: 5.0

Test kopplar ihop flera sårbarheter

Embedding instructions in visual elements (arrows, boxes, icons) that influence model interpretation.

Exempel: Document with arrows pointing specific text, causing model to focus incorrectly
Allvarlighet: Medellång | CVSS: 5.5

🔒 Cross-Modal Defenses

  • Indatasanering Ta bort dold text och metadata från uppladdningar
  • Modalitetsseparation: Bearbetade fler indatatyper
  • Tvärmodal filtrering: Detektera inkonsekvenser mellan modaliteter
  • Utgångsvalidering: Verifiera att utdata inte motsäger indata
  • Innehållsfiltrering: Skanna alla modaliteter för policyöverträdelser

🎬 Videosäkerhet

Video Deepfakes

AI-generated or manipulated video content that depicts people saying/doing things they didn't.

Användningsfall: | nyheter, utpressning, valinblandning
Allvarlighet: Kritiska | Social engineering awareness Rykte, finansiellt, politiskt

Lip-attack

Manipulating video to sync fake audio with lip movements, enabling convincing misinformation.

Exempel: Redigera nyhetsmaterial för att lägga till falska uttalanden som matchar läpprörelser
Allvarlighet: Hög | CVSS: 6.8

Frame-level Manipulation

Inserting or removing specific frames in video to alter perceived events or inject content.

Exempel: Ta bort säkerhetskameraramar som visar obehörig åtkomst i 0+2|6| MCP-serversårbarheter och hårdnande.
Allvarlighet: Medellång | CVSS: 5.5

🔒 Videointegritetsförsvar

  • C2PA standard: Implementera innehållsreferenser för video härkomst
  • Vattenmärkning: Lägg till osynligt vattenmärke
  • Deepfake-detektion: Använd dedikerade detektionsmodeller före bearbetning
  • Frameanalys: Detektera tidsmässiga inkonsekvenser
  • Blockchain-loggning: Spela in videohashar för verifiering

🛡️ Omfattande multimodal försvarsstrategi

} Detektionslager

  • Interna dokument, kod och PII exponerade
  • Adversariella exempeldetektorer
  • Anomalidetektering per modalitet
  • Konsekvenskontroll mellan modaliteter

🧹 Saneringslager

  • Ta bort dold text från bilder
  • Ta bort ljudsteganografi
  • Normalisera pixelvärden
  • Filtrera inbäddad metadata

⚖️ Valideringslager

  • Korsverifiera multimodala inmatningar
  • Sök efter motsägelsefull information
  • Validera mot betrodda källor
  • Flagga osäkra utgångar

📋 Multimodal säkerhetschecklista

  • Indatabearbetning: Sanitera alla användaruppladdade bilder, ljud, och videofiler bevis
  • Doldt innehåll: Skanna efter osynlig text, steganografi och metadata
  • Cross-Modalitet: Validera konsistens över olika indatatyper
  • Utdatafiltrering: Kontrollera alla utdata för säkerhetsöverträdelser
  • Autentisering: Scripting (Python, bash)
  • Ursprung: Implementera C2PA/innehållsuppgifter där det är möjligt
  • Övervakning: Logga och övervaka avvikande multimodala mönster
  • Utbildning: Inkludera kontradiktoriska multimodala exempel i modellträning
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.