Hakowanie AI
Zasoby bezpieczeństwa AI

OWASP Top 10 for LLM Applications 2025/2026

The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes

73%
Wdrożenia sztucznej inteligencji mają krytyczne luki w zabezpieczeniach
(OWASP State of AI Security, 2025)
41%
Sztuczna sztuczna inteligencja przedsiębiorstwa ma nieuwierzytelnione interfejsy API
(CodeWall Research, 2025)
Virtually 100%
Szybkie wstrzyknięcie możliwe do wykorzystania we wdrożeniach LLM
(10 najlepszych OWASP LLM, 2025)
⚠

Świadomość ryzyka krytycznego

Prompt Injection pozostaje luką numer 1. Zapoznaj się z naszym obszernym przewodnikiem dotyczącym szybkiego wstrzykiwania →

🔮

OWASP LLM Top 10 2026: What's Changing

The 2025 version is still the active standard, but the 2026 draft introduces significant changes:

  • NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
  • NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
  • NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
  • Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
  • Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks

Track OWASP LLM Top 10 2026 progress →

LLM01

Prompt Injection

Critical

Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.

Typy ataków
  • Wstrzyknięcie bezpośrednie: monity złośliwego użytkownika, które zastępują instrukcje systemowe
  • Indirect Injection: Hidden instructions in external documents, web content, or API responses
  • Manipulacja kontekstem: wykorzystywanie kontekstu konwersacji do zmiany zachowania
  • Ataki Jailbreak: ominięcie filtrów bezpieczeństwa poprzez kreatywne podpowiedzi
Przykłady ataków
  • Ignore previous instructions and...
  • Tekst osadzony w niewidocznych znakach Unicode
  • Szybkie wstrzykiwanie poprzez przechowywany XSS w treści internetowej
  • DAN (Do Anything Now) style jailbreaks
Strategie łagodzenia
  • Wdrożenie ścisłej walidacji i oczyszczania danych wejściowych
  • Użyj separacji uprawnień między danymi wejściowymi użytkownika a systemem podpowiedzi
  • Zastosuj filtrowanie wyników przed wyświetleniem wyników
  • Monitor wzorców wstrzykiwań w logach
  • Wdrożenie dogłębnej ochrony z wieloma warstwami zabezpieczeń
LLM02

Ujawnianie informacji wrażliwych

Critical

LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.

Typy ataków
  • Wydobywanie danych szkoleniowych: odzyskiwanie wrażliwych danych z pamięci modelu
  • Wyciek danych osobowych: ujawnienie danych osobowych
  • Ujawnianie kluczy API/poświadczeń: ujawnianie sekretów w odpowiedziach
  • Ujawnianie logiki biznesowej: ujawnianie zastrzeżonych algorytmów lub procesów
Przykłady ataków
  • Wyodrębnianie adresów e-mail za pomocą określonych monitów
  • Ujawnianie danych uwierzytelniających SQL w komunikatach o błędach
  • Ujawnianie danych osobowych klienta z danych szkoleniowych
  • Ujawnianie monitów systemu wewnętrznego
Strategie łagodzenia
  • Wdrożenie niezawodnego filtrowania wejścia/wyjścia
  • Egzekwowanie potoków oczyszczania danych
  • Zastosuj zasady rezygnacji użytkownika w zakresie wykorzystania danych
  • Użyj technik różnicowej prywatności
  • Ogranicz dostęp i widoczność monitów systemowych
LLM03

Luki w łańcuchu dostaw

High

Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.

Typy ataków
  • Manipulowanie modelem: naruszenie wstępnie wytrenowanych modeli
  • Luki w zabezpieczeniach zależności PyPI/npm: niebezpieczne biblioteki
  • Szkodliwe dane dostrajające: zatrute zbiory danych szkoleniowych
  • Zagrożeni dostawcy API: niezaufane usługi LLM
Przykłady ataków
  • Wagi modelu backdoorem z niezaufanego źródła
  • Wykorzystywanie podatnej na ataki biblioteki transformatorów
  • Zatrute dane szkoleniowe z ukrytymi wyzwalaczami
  • Zaatakowany magazyn dokumentów RAG
Strategie łagodzenia
  • Zweryfikuj integralność modelu za pomocą sum kontrolnych i podpisów
  • Utrzymanie SBOM (zestawienia materiałów oprogramowania)
  • Korzystaj z zaufanych centrów modeli i weryfikuj pochodzenie
  • Skanuj zależności pod kątem znanych luk w zabezpieczeniach
  • Wdróż zarządzanie cyklem życia modelu
LLM04

Zatruwanie danych i modeli

High

Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.

Typy ataków
  • Zatruwanie danych szkoleniowych: uszkodzenie danych szkoleniowych modelu
  • Dostrajanie Zatruwanie: wstrzykiwanie backdoorów poprzez dostrajanie
  • Zatrucie RAG: Zanieczyszczanie baz wiedzy wyszukiwania
  • Manipulacja osadzaniem: uszkodzenie wektorowych baz danych
Przykłady ataków
  • Wstawianie stronniczych przykładów w celu zmiany zachowania modelu
  • Tworzenie wyzwalaczy backdoora w danych szkoleniowych
  • Zatruwanie publicznych zbiorów danych używanych do szkolenia
  • Wstrzykiwanie fałszywych informacji do dokumentów RAG
Strategie łagodzenia
  • Weryfikacja pochodzenia danych i integralności łańcucha dostaw
  • Wdrożenie sprawdzania poprawności danych i wykrywania anomalii
  • Używaj potoków oczyszczania danych
  • Zastosuj solidne, dostrajające zabezpieczenia
  • Monitoruj zmiany zachowania modelu
LLM05

Niewłaściwa obsługa wyników

High

Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.

Typy ataków
  • XSS przez LLM Dane wyjściowe: skrypty między witrynami z modelu odpowiedzi
  • Wstrzykiwanie SQL: złośliwe zapytania generowane przez LLM
  • Wstrzykiwanie poleceń: LLM generuje niebezpieczne polecenia systemowe
  • Ścieżka Traversal: LLM ujawnia nieautoryzowane ścieżki lub uzyskuje do nich dostęp
Przykłady ataków
  • LLM generuje JavaScript uruchamiany w przeglądarce
  • Model generujący złośliwe zapytania SQL
  • Generowanie kodu, w tym niebezpieczne wywołania systemowe
  • Ujawnianie ścieżki pliku w odpowiedziach
Strategie łagodzenia
  • Wdrożenie sprawdzania poprawności i oczyszczania danych wyjściowych
  • Użyj kontekstowego filtrowania treści
  • Zastosuj te same mechanizmy zabezpieczeń, co dane wprowadzone przez użytkownika
  • Wyniki Sandbox LLM przed dalszym użyciem
  • Włącz bezpieczne tryby kodowania podczas generowania kodu
LLM06

Nadmierna agencja

High

Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.

Typy ataków
  • Nieograniczony dostęp do funkcji: nadmierne uprawnienia API
  • Działanie autonomiczne: wykonywanie działań bez zgody człowieka
  • Nadużycie narzędzi: wykorzystanie zintegrowanych narzędzi zewnętrznych
  • Manipulacja łańcuchem myśli: zmiana procesów rozumowania
Przykłady ataków
  • LLM z dostępem administratora do interfejsu API podczas wykonywania nieautoryzowanych zmian
  • Automatyczne wykonywanie transakcji finansowych
  • Usuwanie zasobów bez potwierdzenia
  • Manipulowanie danymi użytkownika bez zgody
Strategie łagodzenia
  • Wdrażaj kontrolę dostępu z najniższymi uprawnieniami
  • Wymagają działania człowieka w pętli do kluczowych działań
  • Zastosuj ograniczanie szybkości do wrażliwych operacji
  • Logowanie i monitorowanie wszystkich autonomicznych działań
  • Użyj ograniczeń zakresu dostępu do narzędzi
LLM07

Wyciek podpowiedzi systemowych

Medium

Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.

Typy ataków
  • Bezpośrednie wyodrębnianie podpowiedzi: inżynieria społeczna w celu ujawnienia podpowiedzi
  • Przepełnienie kontekstu: Techniki przepełnienia w celu ujawnienia komunikatów systemowych
  • Wykorzystywanie ról: oszukanie LLM w celu ujawnienia instrukcji
  • Wyciek dziennika: ujawnianie podpowiedzi w dziennikach lub błędach
Przykłady ataków
  • Proszenie LLM o powtórzenie „poprzedniego tekstu” w celu wyodrębnienia monitu systemowego
  • Korzystanie z przepełnienia okna kontekstowego w celu ominięcia analizy instrukcji
  • Monit o wstrzyknięcie w celu zastąpienia roli systemowej
  • Wyszukiwanie podpowiedzi w dziennikach aplikacji
Strategie łagodzenia
  • Zaciemnianie monitów systemowych, jeśli to możliwe
  • Wdrożenie technik natychmiastowej izolacji
  • Użyj oddzielnego przetwarzania dla wrażliwych instrukcji
  • Monitoruj próby natychmiastowej ekstrakcji
  • Zastosuj ścisłe filtrowanie logów
LLM08

Niedociągnięcia w zakresie wektorów i osadzania

Medium

Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.

Typy ataków
  • Wstrzykiwanie RAG: złośliwa treść w odzyskanych dokumentach
  • Naruszenie wektorowego bazy danych: atak na pamięć wektorową
  • Ekstrakcja osadzania: kradzież reprezentacji osadzania
  • Manipulacja kontekstem: zakłócanie wyników pobierania
Przykłady ataków
  • Zatrute dokumenty są pobierane jako najlepsze wyniki
  • Nieautoryzowany dostęp do bazy danych wektorów
  • Wyodrębnianie danych szkoleniowych z osadzania
  • Manipulacja pobieraniem poprzez ataki osadzania
Strategie łagodzenia
  • Weryfikacja i oczyszczanie wszystkich dokumentów wejściowych RAG
  • Wdrożenie kontroli dostępu do wektorowych baz danych
  • Jeśli to możliwe, użyj szyfrowania osadzającego
  • Zastosuj zmianę rankingu za pomocą filtrów bezpieczeństwa
  • Monitoruj wyszukiwanie anomalii
LLM09

Dezinformacja

Medium

LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.

Typy ataków
  • Halucynacje: Pewne, ale fałszywe wyniki
  • Błędy rzeczowe: Nieprawidłowe informacje przedstawione jako fakt
  • Wzmacnianie odchyleń: Wzmacnianie istniejących uprzedzeń
  • Manipulacja: celowe wprowadzające w błąd dane wyjściowe
Przykłady ataków
  • Cytowanie nieistniejących artykułów naukowych
  • Udzielenie błędnej porady lekarskiej
  • Generowanie stronniczych rekomendacji dotyczących zatrudnienia
  • Tworzenie fałszywych wiadomości lub recenzji
Strategie łagodzenia
  • Wdrożenie potoków sprawdzania faktów
  • Użyj punktacji zaufania i szacowania niepewności
  • Zastosuj weryfikację źródła w przypadku krytycznych wyników
  • Dodaj pochodzenie i przypisanie treści
  • Wyraźnie oznacz treści wygenerowane przez sztuczną inteligencję
LLM10

Nieograniczone zużycie

Medium

Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.

Typy ataków
  • Nadużycie szybkości interfejsu API: nadmierne wywołania API wyczerpujące przydziały
  • Wyczerpanie zasobów: Maksymalne wykorzystanie zasobów obliczeniowych
  • Wykorzystywanie kosztów: Nadużycia związane z płatnością za token prowadzące do opłat
  • Ataki wnioskowania: wyodrębnianie modelu za pomocą nadmiernych zapytań
Przykłady ataków
  • Zautomatyzowane ataki zużywające cały limit API
  • Spam monitowy o maksymalnej długości powodujący wyczerpanie mocy obliczeniowej
  • Wyodrębnianie modelu poprzez miliony zapytań
  • Rekurencyjne pętle podpowiedzi zużywające zasoby
Strategie łagodzenia
  • wdrożenie rygorystycznych ograniczeń szybkości i przydziałów
  • Dodaj limity tokenów wejścia/wyjścia
  • Monitoruj wzorce użycia pod kątem anomalii
  • Korzystaj z kontroli kosztów i alertów budżetowych
  • Zastosuj kontrolę limitu czasu dla długotrwałych operacji

Ramy testowe OWASP

Zastosuj to ustrukturyzowane podejście do testowania każdej luki w zabezpieczeniach:

1. Rekonesans

  • mapowanie architektury systemu i przepływu danych
  • Identyfikacja punktów wejściowych i API interfejsy
  • Zintegrowane narzędzia i wtyczki z dokumentami
  • Przejrzyj monity i konfigurację systemu

2. Mapowanie luk w zabezpieczeniach

  • Systematycznie testuj każdą kategorię OWASP
  • Powierzchnia ataku na dokumenty i punkty wejścia
  • Identyfikacja istniejących mechanizmów obronnych
  • Zależności map i usługi stron trzecich

3. Eksploatacja

  • Przeprowadzanie ataków typu proof-of-concept
  • Możliwość wykorzystania i wpływ dokumentu
  • Testowanie łączenia łańcuchowego wiele luk w zabezpieczeniach
  • Ocena wykonalności ataku w świecie rzeczywistym

4. Raportowanie

  • Ustal priorytety ustaleń według poziomu ryzyka
  • Przedstaw zalecenia dotyczące środków zaradczych
  • Dołącz kod potwierdzający koncepcję
  • Zaproponuj ulepszenia w zakresie ochrony

Zasoby oficjalne

Źródła i statystyki

AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.