AI-hackning
Omfattande katalog över AI-specifika sårbarheter och attackvektorer.

OWASP Top 10 for LLM Applications 2025/2026

The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes

73%
AI-distributioner har kritiska sårbarheter
Ch(OWASP-säkerhetsstatus för AI-säkerhet)
41%
Enterprise AI har oautentiserade API:er
(CodeWall Research, 2025)
Virtually 100%
Prompt-injektion som kan utnyttjas i LLM-distributioner
(OWASP LLM Topp 10, 2025)
⚠

Kritisk riskmedvetenhet

Snabb injektion förblir den #1 sårbarheten. Se vår omfattande guide för promptinjektion →

🔮

OWASP LLM Top 10 2026: What's Changing

The 2025 version is still the active standard, but the 2026 draft introduces significant changes:

  • NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
  • NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
  • NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
  • Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
  • Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks

Track OWASP LLM Top 10 2026 progress →

LLM01

DevOps-ingenjörer

Critical

Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.

Attacktyper
  • Direkt Injektion: Aktiva användarmeddelanden som åsidosätter systeminstruktioner|1 minuter
  • Indirect Injection: Hidden instructions in external documents, web content, or API responses
  • Kontextmanipulation: Utnyttja konversationskontext för att ändra beteende
  • Jailbreak-attacker: Förbigående av säkerhetsfilter genom kreativa uppmaningar
Attackexempel
  • Ignore previous instructions and...
  • Text inbäddad inbäddad inkodad tecken invisbar
  • Prompt injektion via lagrat XSS i webbinnehåll
  • DAN (Do Anything Now) style jailbreaks
Mitigationsstrategier
  • Implementera strikt indatavalidering och sanering
  • Använd behörighetsseparation mellan användarinmatningar och systemuppmaningar
  • Tillämpa utdatafiltrering innan resultat visas
  • Övervaka injektionsmönster i loggar
  • Implementera försvar på djupet med flera säkerhetslager
LLM02

Avslöjande av känslig information

Critical

LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.

Attacktyper
  • Utvinning av träningsdata: Återställer känslig data från modellminne
  • PII-identifierbar information om personligt läckage|
  • API-nyckel/legitimationsexponering: Avslöjar hemligheter i svar
  • Afslöjande av affärslogik: Exponera proprietära algoritmer eller processer
Attackexempel
  • Extraherar e-postadresser genom specifika uppmaningar
  • Avslöjar SQL-uppgifter i felmeddelanden
  • Avslöjar kund-PII från träningsdata
  • Exponera interna systemuppmaningar
Mitigationsstrategier
  • Implementera robust in-/utdatafiltrering
  • Tvinga upp pipelines för datasanering
  • Tillämpa policyer för att välja bort användare för dataanvändning
  • Använd differentiella sekretessvägar avslöjade|| vektor DB
  • Begränsa systemets snabbåtkomst och synlighet viatomAI expmandus-data
LLM03

Supply Chain Vulnerabilities

High

Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.

Attacktyper
  • Modelmanipulering: Komprometterade förutbildade modeller
  • PyPI/npm-beroendesårbarheter: Osäkra bibliotek
  • Skadlig finjusteringsdata: Förgiftade träningsdatauppsättningar
  • Kompromissade API-leverantörer: Otillförlitliga LLM-tjänster
Attackexempel
  • Klämbara störningsbara värden för att ta bort störningar
  • Sårbar transformatorbiblioteksexploatering
  • Förgiftad träningsdata med dolda triggers
  • Kompromissad RAG-dokumentbutik
Mitigationsstrategier
  • Verifiera modellens integritet genom kontrollsummor och signaturer
  • Underhåll SBOM (Software Bill of Materials)
  • Använd betrodda modellhubbar och verifiera härkomst
  • Skanningsberoenden för kända sårbarheter
  • Implementera modelllivscykelhantering
LLM04

Data- och modellförgiftning

High

Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.

Attacktyper
  • Träningsdataförgiftning: Korrumperar modellträningsdata
  • Finjustering Förgiftning: Injicera bakdörrar via finjustering
  • RAG-förgiftning: Kontaminerande användning av ANSI-integration
  • Inbäddningsmanipulation: Korrupta vektordatabaser
Attackexempel
  • Infoga partiska exempel för att ändra modellbeteende
  • Skapa bakdörrstriggers i träningsdata
  • Förgiftning av offentliga datauppsättningar som används för träning
  • Injicera falsk information i RAG-dokument
Mitigationsstrategier
  • Verifiera datauppkomst och leveranskedjans integritet
  • Implementera datavalidering och upptäckt av avvikelser
  • Använd datasaneringspipelines
  • Tillämpa robusta finjusteringsskydd
  • Övervakning av modellbeteendedrift
LLM05

Felaktig utdatahantering

High

Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.

Attacktyper
  • Hämtning av SS-angrepp via inbäddning av webbplatser|| skript från modellsvar
  • SQL-injektion: Skadliga frågor genererade av LLM
  • Kommandeinjektion: LLM genererar osäkra systemkommandon
  • Path Traversal: LLM avslöjar eller kommer åt obehöriga vägar
Attackexempel
  • LLM genererar JavaScript som körs i webbläsaren
  • Modell som matar ut skadliga SQL-förfrågningar
  • Kodgenerering inklusive osäkra systemanrop
  • Verifierade säkerhetskopior med testade återställningsprocedurer
Mitigationsstrategier
  • Implementera utdatavalidering och sanering
  • Använd sammanhangsmedveten innehållsfiltrering
  • Använd samma säkerhetskontroller som användarinmatningar
  • Sandbox LLM-utdata före nedströmsanvändning
  • Aktivera säkra kodningslägen vid kodgenerering
LLM06

Överdriven byrå

High

Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.

Attacktyper
  • Unlimit Excessive Function API behörigheter
  • Autonom åtgärd: Utföra åtgärder utan mänskligt godkännande|attackbaserat|
  • Verktygsmissbruk: Utnyttja integrerade externa verktyg
  • Chain-of-Thought Manipulation: Ändra resonemangsprocesser
Attackexempel
  • LLM med admin API-åtkomst som utför obehöriga ändringar
  • Auto-exekvera, automatiskt utföra finansiella transaktioner, gränsvärden för granskning av API och gränsvärde för regelbundna mönster för API
  • Raderar resurser utan bekräftelse
  • Manipulerar användardata utan samtycke
Mitigationsstrategier
  • Implementera åtkomstkontroller med minst privilegier
  • Kräver människa-i-slingan för kritiska åtgärder
  • Tillämpa hastighetsbegränsning på känsliga operationer
  • Logga och övervaka alla autonoma åtgärder
  • Använd omfångsbegränsningar för verktygsåtkomst
LLM07

Systempromptläckage

Medium

Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.

Attacktyper
  • Extrahering av direktprompt: Social ingenjörskonst för att avslöja uppmaningar
  • Kontextspill: Överflödestekniker för att exponera systemmeddelanden
  • Rollspelsutnyttjande: Lura LLM till att avslöja instruktioner
  • Loggläckage: exponerar prompter i loggar eller fel
Attackexempel
  • Be LLM att upprepa "föregående text" för att extrahera systemprompt
  • Använder kontextfönsterspill för att kringgå instruktionsanalys
  • Fråga injektion för att åsidosätta systemrollen
  • Hitta meddelanden i programloggar
Mitigationsstrategier
  • Obfuscate systemprompts|
  • Implementera tekniker för snabbisolering
  • Använd separat bearbetning för känsliga instruktioner
  • Övervaka efter snabba extraheringsförsök
  • Tillämpa strikt loggfiltrering
LLM08

Vektor- och inbäddningssvagheter

Medium

Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.

Attacktyper
  • RAG-injektion: Skadligt innehåll i hämtade dokument
  • Vektor DB-kompromiss: Attackerande vektorlagring
  • Inbäddningsextraktion: Stjäl inbäddningsrepresentationer
  • Kontextmanipulation: Korrupta hämtningsresultat
Attackexempel
  • Förgiftade dokument hämtas som toppresultat
  • Vektordatabas obehörig åtkomst
  • Extrahera träningsdata från inbäddningar
  • Hämtning av inbäddningsrepresentationer
Mitigationsstrategier
  • att omdirigera agentmål
  • Implementera åtkomstkontroller för vektordatabas
  • Använd inbäddningskryptering där tillgänglig
  • Använd omrankning med säkerhetsfilter
  • Övervakningshämtning för anomalier
LLM09

Desinformation

Medium

LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.

Attacktyper
  • Hallucinationer: Säkra men falska utdata
  • Faktuella felmeddelanden| Governance Survey 2025
  • Biasförstärkning: Förstärker befintliga fördomar
  • | utgångar
Attackexempel
  • Citerar icke-existerande undersökningar av röster|| autentisering
  • Ge felaktig medicinsk rådgivning
  • Hybrid
  • Skapa falska nyheter eller recensioner
Mitigationsstrategier
  • Implementera pipelines för faktakontroll
  • Använd konfidenspoäng och osäkerhetsuppskattning
  • Använd källverifiering för kritiska utdata
  • Oauktoriserade API-anrop
  • Märk AI-genererat innehåll tydligt
LLM10

Obegränsad konsumtion

Medium

Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.

Attacktyper
  • API-hastighetsmissbruk: Överdrivna API-anrop uttömmande kvoter
  • Resursutmattning
  • Kostnadsutnyttjande: Missbruk av betala per token som leder till avgifter
  • Inferensattacker: Extrahera modell via överdrivna frågor
Attackexempel
  • Automatiska attacker | till AI-säkerhetsincidenter inklusive LLM-intrång, agentkompromettering och prompt injektion - Uppdaterad mars 2026
  • Max-längd prompt skräppost som orsakar datorutmattning
  • Extraherande modell genom miljontals frågor
  • Rekursiva promptslingor som konsumerar resurser
Mitigationsstrategier
  • Implementera strikt hastighetsbegränsning och kvoter
  • Lägg till input/output till 4. Rapportering
  • Övervaka användningsmönster för anomalier
  • Använd kostnadskontroller och budgetvarningar
  • Tillämpa tidsgränskontroller på långvariga operationer

OWASP Testing Framework

Följ denna strukturerade metod för att testa varje sårbarhet:

1. Spaning

  • Karta systemarkitektur och dataflöde
  • Identifiera ingångspunkter och API-gränssnitt
  • Dokumentintegrerade verktyg och plugins Response Playbook 200
  • Granska systemuppmaningar och konfiguration

2. Sårbarhetsmapping

  • Testa varje OWASP-kategori systematiskt
  • Dokumentera attackyta och ingångspunkter
  • Identifiera försvarsmekanismer på plats
  • Kartberoenden och tredjepartstjänster

3. Exploatering

  • Utför proof-of-concept-attacker
  • Dokumentexploatering och påverkan
  • Genererar partiska anställningsrekommendationer
  • Bedöm genomförbarheten för attacker i verkligheten

4. Rapportering

  • Prioritera resultat efter risknivå
  • Ge rekommendationer för åtgärdande av säkerhetskontroller
  • Inkludera proof-of-concept-kod
  • Föreslå defensiva förbättringar

Nätverkssegmentering

Källor och statistik

AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.