OWASP Top 10 for LLM Applications 2025/2026
The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes
Świadomość ryzyka krytycznego
Prompt Injection pozostaje luką numer 1. Zapoznaj się z naszym obszernym przewodnikiem dotyczącym szybkiego wstrzykiwania →
OWASP LLM Top 10 2026: What's Changing
The 2025 version is still the active standard, but the 2026 draft introduces significant changes:
- NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
- NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
- NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
- Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
- Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks
Prompt Injection
Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.
Typy ataków
- Wstrzyknięcie bezpośrednie: monity złośliwego użytkownika, które zastępują instrukcje systemowe
- Indirect Injection: Hidden instructions in external documents, web content, or API responses
- Manipulacja kontekstem: wykorzystywanie kontekstu konwersacji do zmiany zachowania
- Ataki Jailbreak: ominięcie filtrów bezpieczeństwa poprzez kreatywne podpowiedzi
Przykłady ataków
Ignore previous instructions and...Tekst osadzony w niewidocznych znakach UnicodeSzybkie wstrzykiwanie poprzez przechowywany XSS w treści internetowejDAN (Do Anything Now) style jailbreaks
Strategie łagodzenia
- Wdrożenie ścisłej walidacji i oczyszczania danych wejściowych
- Użyj separacji uprawnień między danymi wejściowymi użytkownika a systemem podpowiedzi
- Zastosuj filtrowanie wyników przed wyświetleniem wyników
- Monitor wzorców wstrzykiwań w logach
- Wdrożenie dogłębnej ochrony z wieloma warstwami zabezpieczeń
Ujawnianie informacji wrażliwych
LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.
Typy ataków
- Wydobywanie danych szkoleniowych: odzyskiwanie wrażliwych danych z pamięci modelu
- Wyciek danych osobowych: ujawnienie danych osobowych
- Ujawnianie kluczy API/poświadczeń: ujawnianie sekretów w odpowiedziach
- Ujawnianie logiki biznesowej: ujawnianie zastrzeżonych algorytmów lub procesów
Przykłady ataków
Wyodrębnianie adresów e-mail za pomocą określonych monitówUjawnianie danych uwierzytelniających SQL w komunikatach o błędachUjawnianie danych osobowych klienta z danych szkoleniowychUjawnianie monitów systemu wewnętrznego
Strategie łagodzenia
- Wdrożenie niezawodnego filtrowania wejścia/wyjścia
- Egzekwowanie potoków oczyszczania danych
- Zastosuj zasady rezygnacji użytkownika w zakresie wykorzystania danych
- Użyj technik różnicowej prywatności
- Ogranicz dostęp i widoczność monitów systemowych
Luki w łańcuchu dostaw
Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.
Typy ataków
- Manipulowanie modelem: naruszenie wstępnie wytrenowanych modeli
- Luki w zabezpieczeniach zależności PyPI/npm: niebezpieczne biblioteki
- Szkodliwe dane dostrajające: zatrute zbiory danych szkoleniowych
- Zagrożeni dostawcy API: niezaufane usługi LLM
Przykłady ataków
Wagi modelu backdoorem z niezaufanego źródłaWykorzystywanie podatnej na ataki biblioteki transformatorówZatrute dane szkoleniowe z ukrytymi wyzwalaczamiZaatakowany magazyn dokumentów RAG
Strategie łagodzenia
- Zweryfikuj integralność modelu za pomocą sum kontrolnych i podpisów
- Utrzymanie SBOM (zestawienia materiałów oprogramowania)
- Korzystaj z zaufanych centrów modeli i weryfikuj pochodzenie
- Skanuj zależności pod kątem znanych luk w zabezpieczeniach
- Wdróż zarządzanie cyklem życia modelu
Zatruwanie danych i modeli
Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.
Typy ataków
- Zatruwanie danych szkoleniowych: uszkodzenie danych szkoleniowych modelu
- Dostrajanie Zatruwanie: wstrzykiwanie backdoorów poprzez dostrajanie
- Zatrucie RAG: Zanieczyszczanie baz wiedzy wyszukiwania
- Manipulacja osadzaniem: uszkodzenie wektorowych baz danych
Przykłady ataków
Wstawianie stronniczych przykładów w celu zmiany zachowania modeluTworzenie wyzwalaczy backdoora w danych szkoleniowychZatruwanie publicznych zbiorów danych używanych do szkoleniaWstrzykiwanie fałszywych informacji do dokumentów RAG
Strategie łagodzenia
- Weryfikacja pochodzenia danych i integralności łańcucha dostaw
- Wdrożenie sprawdzania poprawności danych i wykrywania anomalii
- Używaj potoków oczyszczania danych
- Zastosuj solidne, dostrajające zabezpieczenia
- Monitoruj zmiany zachowania modelu
Niewłaściwa obsługa wyników
Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.
Typy ataków
- XSS przez LLM Dane wyjściowe: skrypty między witrynami z modelu odpowiedzi
- Wstrzykiwanie SQL: złośliwe zapytania generowane przez LLM
- Wstrzykiwanie poleceń: LLM generuje niebezpieczne polecenia systemowe
- Ścieżka Traversal: LLM ujawnia nieautoryzowane ścieżki lub uzyskuje do nich dostęp
Przykłady ataków
LLM generuje JavaScript uruchamiany w przeglądarceModel generujący złośliwe zapytania SQLGenerowanie kodu, w tym niebezpieczne wywołania systemoweUjawnianie ścieżki pliku w odpowiedziach
Strategie łagodzenia
- Wdrożenie sprawdzania poprawności i oczyszczania danych wyjściowych
- Użyj kontekstowego filtrowania treści
- Zastosuj te same mechanizmy zabezpieczeń, co dane wprowadzone przez użytkownika
- Wyniki Sandbox LLM przed dalszym użyciem
- Włącz bezpieczne tryby kodowania podczas generowania kodu
Nadmierna agencja
Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.
Typy ataków
- Nieograniczony dostęp do funkcji: nadmierne uprawnienia API
- Działanie autonomiczne: wykonywanie działań bez zgody człowieka
- Nadużycie narzędzi: wykorzystanie zintegrowanych narzędzi zewnętrznych
- Manipulacja łańcuchem myśli: zmiana procesów rozumowania
Przykłady ataków
LLM z dostępem administratora do interfejsu API podczas wykonywania nieautoryzowanych zmianAutomatyczne wykonywanie transakcji finansowychUsuwanie zasobów bez potwierdzeniaManipulowanie danymi użytkownika bez zgody
Strategie łagodzenia
- Wdrażaj kontrolę dostępu z najniższymi uprawnieniami
- Wymagają działania człowieka w pętli do kluczowych działań
- Zastosuj ograniczanie szybkości do wrażliwych operacji
- Logowanie i monitorowanie wszystkich autonomicznych działań
- Użyj ograniczeń zakresu dostępu do narzędzi
Wyciek podpowiedzi systemowych
Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.
Typy ataków
- Bezpośrednie wyodrębnianie podpowiedzi: inżynieria społeczna w celu ujawnienia podpowiedzi
- Przepełnienie kontekstu: Techniki przepełnienia w celu ujawnienia komunikatów systemowych
- Wykorzystywanie ról: oszukanie LLM w celu ujawnienia instrukcji
- Wyciek dziennika: ujawnianie podpowiedzi w dziennikach lub błędach
Przykłady ataków
Proszenie LLM o powtórzenie „poprzedniego tekstu” w celu wyodrębnienia monitu systemowegoKorzystanie z przepełnienia okna kontekstowego w celu ominięcia analizy instrukcjiMonit o wstrzyknięcie w celu zastąpienia roli systemowejWyszukiwanie podpowiedzi w dziennikach aplikacji
Strategie łagodzenia
- Zaciemnianie monitów systemowych, jeśli to możliwe
- Wdrożenie technik natychmiastowej izolacji
- Użyj oddzielnego przetwarzania dla wrażliwych instrukcji
- Monitoruj próby natychmiastowej ekstrakcji
- Zastosuj ścisłe filtrowanie logów
Niedociągnięcia w zakresie wektorów i osadzania
Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.
Typy ataków
- Wstrzykiwanie RAG: złośliwa treść w odzyskanych dokumentach
- Naruszenie wektorowego bazy danych: atak na pamięć wektorową
- Ekstrakcja osadzania: kradzież reprezentacji osadzania
- Manipulacja kontekstem: zakłócanie wyników pobierania
Przykłady ataków
Zatrute dokumenty są pobierane jako najlepsze wynikiNieautoryzowany dostęp do bazy danych wektorówWyodrębnianie danych szkoleniowych z osadzaniaManipulacja pobieraniem poprzez ataki osadzania
Strategie łagodzenia
- Weryfikacja i oczyszczanie wszystkich dokumentów wejściowych RAG
- Wdrożenie kontroli dostępu do wektorowych baz danych
- Jeśli to możliwe, użyj szyfrowania osadzającego
- Zastosuj zmianę rankingu za pomocą filtrów bezpieczeństwa
- Monitoruj wyszukiwanie anomalii
Dezinformacja
LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.
Typy ataków
- Halucynacje: Pewne, ale fałszywe wyniki
- Błędy rzeczowe: Nieprawidłowe informacje przedstawione jako fakt
- Wzmacnianie odchyleń: Wzmacnianie istniejących uprzedzeń
- Manipulacja: celowe wprowadzające w błąd dane wyjściowe
Przykłady ataków
Cytowanie nieistniejących artykułów naukowychUdzielenie błędnej porady lekarskiejGenerowanie stronniczych rekomendacji dotyczących zatrudnieniaTworzenie fałszywych wiadomości lub recenzji
Strategie łagodzenia
- Wdrożenie potoków sprawdzania faktów
- Użyj punktacji zaufania i szacowania niepewności
- Zastosuj weryfikację źródła w przypadku krytycznych wyników
- Dodaj pochodzenie i przypisanie treści
- Wyraźnie oznacz treści wygenerowane przez sztuczną inteligencję
Nieograniczone zużycie
Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.
Typy ataków
- Nadużycie szybkości interfejsu API: nadmierne wywołania API wyczerpujące przydziały
- Wyczerpanie zasobów: Maksymalne wykorzystanie zasobów obliczeniowych
- Wykorzystywanie kosztów: Nadużycia związane z płatnością za token prowadzące do opłat
- Ataki wnioskowania: wyodrębnianie modelu za pomocą nadmiernych zapytań
Przykłady ataków
Zautomatyzowane ataki zużywające cały limit APISpam monitowy o maksymalnej długości powodujący wyczerpanie mocy obliczeniowejWyodrębnianie modelu poprzez miliony zapytańRekurencyjne pętle podpowiedzi zużywające zasoby
Strategie łagodzenia
- wdrożenie rygorystycznych ograniczeń szybkości i przydziałów
- Dodaj limity tokenów wejścia/wyjścia
- Monitoruj wzorce użycia pod kątem anomalii
- Korzystaj z kontroli kosztów i alertów budżetowych
- Zastosuj kontrolę limitu czasu dla długotrwałych operacji
Ramy testowe OWASP
Zastosuj to ustrukturyzowane podejście do testowania każdej luki w zabezpieczeniach:
1. Rekonesans
- mapowanie architektury systemu i przepływu danych
- Identyfikacja punktów wejściowych i API interfejsy
- Zintegrowane narzędzia i wtyczki z dokumentami
- Przejrzyj monity i konfigurację systemu
2. Mapowanie luk w zabezpieczeniach
- Systematycznie testuj każdą kategorię OWASP
- Powierzchnia ataku na dokumenty i punkty wejścia
- Identyfikacja istniejących mechanizmów obronnych
- Zależności map i usługi stron trzecich
3. Eksploatacja
- Przeprowadzanie ataków typu proof-of-concept
- Możliwość wykorzystania i wpływ dokumentu
- Testowanie łączenia łańcuchowego wiele luk w zabezpieczeniach
- Ocena wykonalności ataku w świecie rzeczywistym
4. Raportowanie
- Ustal priorytety ustaleń według poziomu ryzyka
- Przedstaw zalecenia dotyczące środków zaradczych
- Dołącz kod potwierdzający koncepcję
- Zaproponuj ulepszenia w zakresie ochrony
Zasoby oficjalne
- Oficjalna strona OWASP LLM 10 najlepszych w 2025 r.
- Pobierz OWASP LLM Top 10 plików PDF na rok 2025
- Projekt zabezpieczeń OWASP LLM
- OWASP Agentic AI Security
Źródła i statystyki
- Raport o stanie bezpieczeństwa AI OWASP 2025 - 73% of organizations have critical AI vulnerabilities
- Cyberbezpieczeństwo Szwajcaria - Statystyki bezpieczeństwa AI 2026 - Ponad 40 wyselekcjonowanych statystyk
- CrowdStrike Global Threat Report 2026 - AI-enabled attacks up 89%
- Darktrace State of AI Cybersecurity 2026 - Ankieta przeprowadzona wśród ponad 1500 liderów bezpieczeństwa
- IBM X-Force Threat Intelligence Index 2026 - Ataki przyspieszane przez sztuczną inteligencję