Hackování AI
Zdroje zabezpečení AI

OWASP Top 10 for LLM Applications 2025/2026

The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes

73%
Nasazení AI má kritická zranitelnost
(OWASP State of AI Security, 2025 all output for safety||Check all output for safety)
41%
Enterprise AI má neověřená rozhraní API
(CodeWall Research, 2025)
Virtually 100%
Okamžité vložení využitelné v nasazení LLM
(OWASP LLM Top 10, 2025)
⚠

Uvědomění o kritických rizicích

Prompt Injection zůstává chybou číslo 1. Podívejte se na našeho komplexního průvodce vložením výzvy →

🔮

OWASP LLM Top 10 2026: What's Changing

The 2025 version is still the active standard, but the 2026 draft introduces significant changes:

  • NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
  • NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
  • NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
  • Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
  • Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks

Track OWASP LLM Top 10 2026 progress →

LLM01

Inženýři DevOps

Critical

Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.

Typy útoků
  • Přímé vložení: Výzvy škodlivého uživatele, které přepisují systémové pokyny
  • Indirect Injection: Hidden instructions in external documents, web content, or API responses
  • Manipulace s kontextem: Využití kontextu konverzace ke změně chování
  • Útoky z útěk z vězení: Obcházení bezpečnostních filtrů prostřednictvím kreativních výzev
Příklady útoků
  • Ignore previous instructions and...
  • Text vložený do neviditelných znaků Unicode
  • Multimodální zabezpečení umělé inteligence
  • DAN (Do Anything Now) style jailbreaks
Strategie zmírňování
  • Implementujte přísné ověřování vstupů a dezinfekci
  • Používat seznamy povolených operací
  • Aplikujte výstupní filtrování před zobrazením výsledků
  • Monitorování vzorů vkládání do protokolů
  • Implementujte hloubkovou obranu s více vrstvami zabezpečení
LLM02

Zveřejňování citlivých informací

Critical

LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.

Typy útoků
  • Tréninková extrakce dat: Obnova citlivých dat z paměti modelu
  • Protokol úniku všech aktivních relace: Odhalitelné osobní informace|
  • Klíč API/Kreditační tajný klíč
  • Zveřejnění obchodní logiky: Odhalení proprietárních algoritmů nebo procesů
Příklady útoků
  • Extrahování e-mailových adres prostřednictvím specifických výzev
  • Odhalení pověření SQL v chybových zprávách
  • Zveřejnění PII zákazníka z dat školení
  • Odhalení interních systémových výzev
Strategie zmírňování
  • Implementujte robustní filtrování vstupů/výstupů
  • Vynutit kanály dezinfekce dat
  • Použít zásady odhlášení uživatele pro používání dat
  • Použijte různé techniky ochrany soukromí
  • Omezení okamžitého přístupu a viditelnosti systému
LLM03

Zranitelnosti dodavatelského řetězce

High

Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.

Typy útoků
  • Manipulace s modelem: kompromitované předem vycvičené modely
  • Zranitelnosti v závislosti na PyPI/npm: Nezabezpečené knihovny
  • Škodlivá data jemného ladění: Otrávené datové sady pro školení
  • Poskytovatelé kompromitovaných API: Nedůvěryhodné služby LLM
Příklady útoků
  • Závaží modelu z nedůvěryhodného zdroje
  • Využití zranitelných knihoven transformátorů
  • Otrávená trénovací data se skrytými spouštěči
  • Ohrožené úložiště dokumentů RAG
Strategie zmírňování
  • Ověřte integritu modelu pomocí kontrolních součtů a podpisů
  • Udržovat SBOM (softwarový kusovník)
  • Používejte důvěryhodné modelové uzly a ověřte původ
  • Skenování závislostí na známé zranitelnosti
  • Implementujte správu životního cyklu modelu
LLM04

Otrava dat a modelů

High

Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.

Typy útoků
  • Otrava trénovacích dat: Poškození trénovacích dat modelu
  • Jemné doladění otravy: Injektování zadních vrátek pomocí jemného ladění
  • RAG Otrava: Kontaminace znalostních bází pro vyhledávání prostřednictvím uděleného|NSSAI Integrace| Průzkumy
  • Manipulace s vkládáním: Poškozování vektorových databází
Příklady útoků
  • Vkládání neobjektivních příkladů ke změně chování modelu
  • Vytváření spouštěčů zadních vrátek v tréninkových datech
  • Otrava veřejných datových sad používaných pro školení
  • Vkládání nepravdivých informací do dokumentů RAG
Strategie zmírňování
  • Ověřte původ dat a integritu dodavatelského řetězce
  • Implementace ověřování dat a detekce anomálií
  • Používejte potrubí dezinfekce dat
  • Použijte robustní bezpečnostní opatření pro jemné doladění
  • Monitorování posunu chování modelu
LLM05

Nesprávné zpracování výstupu

High

Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.

Typy útoků
  • XSS přes LLM Výstup: Skriptování mezi stránkami z odpovědí modelu
  • SQL Injection: Škodlivé dotazy generované LLM
  • Injekce příkazů: LLM generuje nebezpečné systémové příkazy
  • Path Traversal: LLM odhaluje neautorizované cesty nebo k nim přistupuje
Příklady útoků
  • LLM generující JavaScript, který se spouští v prohlížeči
  • Model vydávající škodlivé dotazy SQL
  • Generování kódu včetně nebezpečných systémových volání
  • zveřejnění cesty k souboru||zveřejnění cesty k souboru||zveřejnění cesty k souboru||Simi v odpovědích z odpovědí zálohy s otestovanými postupy obnovy
Strategie zmírňování
  • Implementujte ověřování a sanitaci výstupu
  • Bezpečnostní certifikáty
  • Použijte stejné ovládací prvky zabezpečení jako uživatelské vstupy
  • Výstupy Sandbox LLM před dalším použitím
  • Povolit režimy zabezpečeného kódování při generování kódu
LLM06

Nadměrné zastoupení

High

Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.

Typy útoků
  • Neomezený přístup k funkcím: Nadměrná oprávnění API
  • Autonomní akce: Provádění akcí bez lidského souhlasu
  • Zneužívání nástrojů: Využití integrovaných externích nástrojů
  • Manipulace s řetězcem myšlení: Změna procesů uvažování
Příklady útoků
  • LLM s přístupem administrátorského rozhraní API provádějícím neoprávněné změny
  • Automatické provádění finančních transakcí
  • Odstranění zdrojů bez potvrzení
  • Manipulace s uživatelskými daty bez souhlasu
Strategie zmírňování
  • Implementujte kontroly přístupu s nejmenšími oprávněními
  • Vyžadovat člověka ve smyčce pro kritické akce
  • Použít omezení rychlosti na citlivé operace
  • Zaznamenávejte a monitorujte všechny autonomní akce
  • Použít omezení rozsahu pro přístup k nástroji
LLM07

||Security Prom:

Medium

Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.

Typy útoků
  • Přímá extrakce výzev: Sociální inženýrství k odhalení výzev
  • Přetečení kontextu: Techniky přetečení k odhalení systémových zpráv
  • Využití hraní rolí: Napálit LLM k odhalení pokynů
  • Únik protokolů: Odhalování výzev v protokolech nebo chyb
Příklady útoků
  • Žádost LLM o opakování „předchozího textu“ pro extrakci systémového promptu
  • Použití přetečení kontextového okna k obejití analýzy instrukcí
  • Výzva k přepsání systémové role
  • Hledání výzev v protokolech aplikací
Strategie zmírňování
  • Zamlžujte systémové výzvy, kde je to možné
  • Implementujte techniky rychlé izolace
  • Použít samostatné zpracování pro citlivé pokyny
  • Monitorování rychlých pokusů o extrakci
  • Použít přísné filtrování protokolů
LLM08

Slabé stránky vektorů a vkládání

Medium

Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.

Typy útoků
  • Injekce RAG: Škodlivý obsah v načtených dokumentech
  • Ohrožení vektorové databáze: Útok na úložiště vektorů
  • Extrakce vkládání: Krádež reprezentací vkládání přes L||Získávání manipulace přes web|LM|X z modelových odpovědí
  • Manipulace s kontextem: Poškozování výsledků vyhledávání
Příklady útoků
  • Otrávené dokumenty se načítají jako nejlepší výsledky
  • Neoprávněný přístup k vektorové databázi
  • Extrahování školicích dat z vložení
  • Rychlé přijetí bez kontroly zabezpečení vytváří masivní plochu pro útoky
Strategie zmírňování
  • Ověření a dezinfekce všech vstupních dokumentů agenta RAG na restrukturalizaci
  • Implementace řízení přístupu k vektorové databázi
  • Pokud je to možné, použijte šifrování pro vkládání
  • Použít přehodnocení pomocí bezpečnostních filtrů
  • Sledování načítání anomálií
LLM09

Nepravdivé informace

Medium

LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.

Typy útoků
  • Halucinace: Jisté, ale falešné výstupy
  • Věcné informace o chybách AI prezentované jako fakt: Nepravdivost. Průzkum 2025
  • Zesilování zkreslení: Posílení stávajících předsudků
  • Právo na smazání
Příklady útoků
  • Citování pomocí hlasu|přehrávání hlasu|neexistující bankovnictví |
  • Poskytování nesprávných lékařských rad
  • Generating biased hiring recommendations
  • Vytváření falešných zpráv nebo recenzí
Strategie zmírňování
  • Implementujte kanály ověřování faktů
  • Použít hodnocení spolehlivosti a odhad nejistoty
  • U kritických výstupů použijte ověření zdroje
  • Přidejte původ obsahu a nejlepší postupy zabezpečení přiřazování20||6 | Průvodce zabezpečením kontextového protokolu modelu
  • Jasně označte obsah vygenerovaný umělou inteligencí
LLM10

Neohraničená spotřeba

Medium

Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.

Typy útoků
  • Zneužívání rychlosti API: Nadměrná volání API vyčerpávající kvóty
  • Vyčerpání zdrojů: Vyčerpání výpočetních zdrojů
  • Zneužití nákladů: Zneužití plateb za token vedoucí k poplatkům
  • Útoky na odvození: Extrahování modelu pomocí nadměrného množství dotazů
Příklady útoků
  • Automatické útoky spotřebovávají celou kvótu bezpečnostního incidentu, včetně postupů LLM, prolomení agentů, postupné narušení AI, krok za krokem rychlé vložení – Aktualizováno v březnu 2026
  • Max-length prompt spam causing compute exhaustion
  • Extrakce modelu prostřednictvím milionů dotazů
  • Rekurzivní promptní smyčky spotřebovávající zdroje
Strategie zmírňování
  • Implementujte přísné omezení sazeb a kvóty
  • Přidat vstupní/výstupní limity tokenů
  • Sledování vzorců používání pro anomálie
  • Používejte kontroly nákladů a upozornění na rozpočet
  • Použijte kontroly časového limitu u dlouhotrvajících operací

Testovací rámec OWASP

Při testování každé zranitelnosti postupujte podle tohoto strukturovaného přístupu:

1. Reconnaissance

  • Architektura mapového systému a datový tok
  • Identifikujte vstupní body a rozhraní API
  • Integrované nástroje a pluginy pro dokumenty
  • Zkontrolujte systémové výzvy a konfiguraci

2. Mapování zranitelnosti

  • Systémově testujte každou kategorii OWASP
  • Povrch a vstupní body útoku na dokumenty
  • Určete zavedené obranné mechanismy
  • Závislosti na mapách a služby třetích stran

3. Využití

  • Provádění útoků typu proof-of-concept
  • Využitelnost a dopad dokumentů
  • Hybridní
  • Posouzení proveditelnosti útoku v reálném světě

4. Hlášení

  • Upřednostnění zjištění podle úrovně rizika
  • Provide remediation recommendations
  • Zahrnout kód důkazu konceptu
  • Navrhnout defenzivní vylepšení

Oficiální zdroje

Zdroje a statistiky

AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.