Взлом ИИ
Ресурсы безопасности AI

OWASP Top 10 for LLM Applications 2025/2026

The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes

73%
Развертывания ИИ имеют критические уязвимости
(OWASP State of AI Security, 2025)
41%
Корпоративный ИИ имеет неаутентифицированные API
(CodeWall Research, 2025)
Virtually 100%
Быстрая инъекция, которую можно использовать при развертывании LLM
(OWASP LLM Top 10, 2025)
⚠

Информация о критических рисках

Оперативная инъекция остается уязвимостью №1. См. наше подробное руководство по быстрому внедрению →

🔮

OWASP LLM Top 10 2026: What's Changing

The 2025 version is still the active standard, but the 2026 draft introduces significant changes:

  • NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
  • NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
  • NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
  • Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
  • Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks

Track OWASP LLM Top 10 2026 progress →

LLM01

Быстрое внедрение

Critical

Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.

Типы атак
  • Прямое внедрение: вредоносные запросы пользователя, которые переопределяют системные инструкции
  • Indirect Injection: Hidden instructions in external documents, web content, or API responses
  • Манипулирование контекстом: использование контекста разговора для изменения поведения
  • Атак на джейлбрейк: обход фильтров безопасности с помощью творческих подсказок
Примеры атак
  • Ignore previous instructions and...
  • Текст, встроенный в невидимые символы Юникода
  • Быстрое внедрение через сохраненный XSS в веб-контент
  • DAN (Do Anything Now) style jailbreaks
Стратегии смягчения последствий
  • Внедрить строгую проверку и очистку входных данных
  • Использовать разделение привилегий между входными данными пользователя и системой подсказки
  • Примените фильтрацию вывода перед отображением результатов
  • Отслеживание шаблонов внедрения в журналах
  • Внедрите многоуровневую защиту с несколькими уровнями безопасности
LLM02

Раскрытие конфиденциальной информации

Critical

LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.

Типы атак
  • Извлечение обучающих данных: восстановление конфиденциальных данных из памяти модели
  • Утечка идентификационной информации: раскрытие личной информации
  • API-ключ/раскрытие учетных данных: раскрытие секретов в ответах
  • Раскрытие бизнес-логики: раскрытие проприетарных алгоритмов или процессов
Примеры атак
  • Извлечение адресов электронной почты с помощью специальных запросов
  • Раскрытие учетных данных SQL в сообщениях об ошибках
  • Раскрытие личной информации клиента из данных обучения
  • Раскрытие внутренних системных подсказок
Стратегии смягчения последствий
  • Внедрение надежной фильтрации ввода/вывода
  • Обеспечить конвейеры очистки данных
  • Применить политики отказа пользователей от использования данных
  • Использование методов дифференциальной конфиденциальности
  • Ограничить доступ к системным подсказкам и видимость
LLM03

Уязвимости цепочки поставок

High

Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.

Типы атак
  • Вмешательство в модель: скомпрометированные предварительно обученные модели
  • Уязвимости зависимостей PyPI/npm: небезопасные библиотеки
  • Вредоносные данные точной настройки: отравленные наборы обучающих данных
  • Поставщики скомпрометированных API: ненадежные службы LLM
Примеры атак
  • Весовые коэффициенты модели из ненадежного источника
  • Использование библиотеки уязвимых преобразователей
  • Отравленные данные обучения со скрытыми триггерами
  • Хранилище взломанных документов RAG
Стратегии смягчения последствий
  • Проверить целостность модели с помощью контрольных сумм и подписей
  • Поддержание SBOM (спецификация программного обеспечения)
  • Используйте доверенные концентраторы моделей и проверяйте происхождение
  • Сканировать зависимости на наличие известных уязвимостей
  • Внедрить управление жизненным циклом модели
LLM04

Отравление данных и моделей

High

Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.

Типы атак
  • Отравление данных обучения: повреждение данных обучения модели
  • Точная настройка Отравление: внедрение бэкдоров посредством тонкой настройки
  • Отравление RAG: загрязнение баз знаний по извлечению
  • Манипуляция встраиванием: повреждение векторных баз данных
Примеры атак
  • Вставка предвзятых примеров для изменения поведения модели
  • Создание бэкдор-триггеров в обучающих данных
  • Отравление общедоступных наборов данных, используемых для обучения
  • Внедрение ложной информации в документы RAG
Стратегии смягчения последствий
  • Проверка происхождения данных и целостности цепочки поставок
  • Внедрить проверку данных и обнаружение аномалий
  • Использовать конвейеры очистки данных
  • Примените надежные меры точной настройки безопасности
  • Отслеживать дрейф поведения модели
LLM05

Неправильная обработка вывода

High

Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.

Типы атак
  • XSS через LLM Вывод: межсайтовый скриптинг из модели ответы
  • SQL-инъекция: вредоносные запросы, генерируемые LLM
  • Внедрение команд: LLM генерирует небезопасные системные команды
  • Путь.
Примеры атак
  • LLM генерирует JavaScript, который выполняется в браузере
  • Модель выводит вредоносные SQL-запросы
  • Генерация кода, включая небезопасные системные вызовы
  • Раскрытие пути к файлу в ответах
Стратегии смягчения последствий
  • Внедрите проверку и очистку выходных данных
  • Использовать контекстно-зависимую фильтрацию контента
  • Примените те же меры безопасности, что и пользовательские входные данные
  • Выходные данные LLM в песочнице перед дальнейшим использованием
  • Включить режимы безопасного кодирования при генерации кода
LLM06

Чрезмерное агентство

High

Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.

Типы атак
  • Неограниченный доступ к функциям: чрезмерные разрешения API
  • Автономное действие: выполнение действий без одобрения человека
  • Злоупотребление инструментами: использование интегрированных внешних инструментов
  • Манипулирование цепочкой мыслей: изменение процессов рассуждения
Примеры атак
  • LLM с доступом к API администратора для выполнения несанкционированных изменений
  • Автоматическое выполнение финансовых транзакций
  • Удаление ресурсов без подтверждения
  • Манипулирование пользовательскими данными без согласия
Стратегии смягчения последствий
  • Внедрить контроль доступа с наименьшими привилегиями
  • Требование участия человека в цикле для критических действий
  • Применить ограничение скорости к конфиденциальным операциям
  • Регистрация и мониторинг всех автономных действий
  • Использовать ограничения области доступа к инструментам
LLM07

Утечка системных подсказок

Medium

Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.

Типы атак
  • Прямое извлечение подсказок: социальная инженерия для выявления подсказок
  • Переполнение контекста: методы переполнения для раскрытия системных сообщений
  • Эксплуатация ролевых игр: обманом заставить LLM раскрыть инструкции
  • Утечка журналов: раскрытие подсказок в журналах или ошибках
Примеры атак
  • Просьба к LLM повторить «предыдущий текст» для извлечения системной подсказки
  • Использование переполнения контекстного окна для обхода синтаксического анализа инструкций
  • Быстрое внедрение для переопределения системной роли
  • Поиск подсказок в журналах приложений
Стратегии смягчения последствий
  • Запутывание системных подсказок, где это возможно
  • Внедрить методы быстрой изоляции
  • Использовать отдельную обработку для конфиденциальных инструкций
  • Отслеживание попыток быстрого извлечения
  • Применить строгую фильтрацию журналов
LLM08

Слабости векторов и встраивания

Medium

Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.

Типы атак
  • Внедрение RAG: вредоносное содержимое в извлеченных документах
  • Компрометация векторной базы данных: атака на хранилище векторов
  • Извлечение внедрений: кража внедренных представлений
  • Манипулирование контекстом: искажение результатов поиска
Примеры атак
  • Отравленные документы извлекаются как лучшие результаты
  • Несанкционированный доступ к базе данных Vector
  • Извлечение обучающих данных из внедрений
  • Манипулирование извлечением посредством атак внедрения
Стратегии смягчения последствий
  • Проверка и очистка всех входных документов RAG
  • Внедрение контроля доступа к базе данных векторов
  • Использовать встроенное шифрование, где это возможно
  • Применить изменение рейтинга с помощью фильтров безопасности
  • Отслеживать извлечение аномалий
LLM09

Дезинформация

Medium

LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.

Типы атак
  • Галлюцинации: Уверенные, но ложные результаты
  • Фактические ошибки: неверная информация, представленная как факт
  • Усиление предвзятости: усиление существующих предубеждений
  • Манипулирование: намеренно вводящие в заблуждение выходные данные
Примеры атак
  • Ссылаясь на несуществующие научные статьи
  • Предоставление неверного медицинского совета
  • Создание предвзятых рекомендаций по найму
  • Создание фейковых новостей или обзоров
Стратегии смягчения последствий
  • Внедрение конвейеров проверки фактов
  • Использовать оценку достоверности и оценку неопределенности
  • Применить проверку источника для важных выходных данных
  • Добавьте происхождение и атрибуцию контента
  • Четко обозначайте контент, созданный искусственным интеллектом
LLM10

Неограниченное потребление

Medium

Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.

Типы атак
  • Злоупотребление скоростью API: чрезмерные вызовы API, исчерпывающие квоты
  • Исчерпание ресурсов: максимальное использование вычислительных ресурсов
  • Эксплуатация затрат: злоупотребление оплатой за токен, ведущее к взиманию платы
  • Атаки на выведение: извлечение модели с помощью чрезмерных запросов
Примеры атак
  • Автоматические атаки, потребляющие всю квоту API
  • Спам-подсказки максимальной длины, вызывающие истощение вычислительных ресурсов
  • Извлечение модели с помощью миллионов запросов
  • Рекурсивные циклы подсказок, потребляющие ресурсы
Стратегии смягчения последствий
  • внедрение строгого ограничения скорости и квот
  • Добавить лимиты токенов ввода/вывода
  • Отслеживать шаблоны использования на предмет аномалий
  • Используйте контроль затрат и оповещения о бюджете
  • Применить контроль тайм-аута к длительным операциям

Среда тестирования OWASP

Следуйте этому структурированному подходу для тестирования каждой уязвимости:

1. Разведка

  • сопоставление архитектуры системы и потока данных.
  • Определение входных точек и API интерфейсы
  • Документирование интегрированных инструментов и подключаемых модулей
  • Просмотр системных подсказок и конфигурации

2. Сопоставление уязвимостей

  • Систематически проверяйте каждую категорию OWASP
  • Документировать поверхность атаки и точки входа
  • Определить действующие защитные механизмы
  • Сопоставление зависимостей и сторонних сервисов

3. Эксплуатация

  • Проведение атак для проверки концепции
  • Возможность использования документов и их влияние
  • Множественная цепочка тестов уязвимости
  • Оценка возможности атаки в реальном мире

4. Отчеты

  • Приоритизация выводов по уровню риска
  • Предоставление рекомендаций по исправлению
  • Включить код, подтверждающий концепцию
  • Предложить защитные улучшения

Официальные ресурсы

Источники и статистика

AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.