AI Hacking
Recursos de segurança de IA

OWASP Top 10 for LLM Applications 2025/2026

The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes

73%
As implantações de IA têm vulnerabilidades críticas
(OWASP State of AI Security, 2025)
41%
Enterprise AI tem APIs não autenticadas
(CodeWall Research, 2025)
Virtually 100%
Injeção imediata explorável em implantações LLM
(OWASP LLM Top 10, 2025)
⚠

Consciência de risco crítico

A injeção imediata continua sendo a vulnerabilidade número 1. Veja nosso abrangente Guia de injeção de prompt →

🔮

OWASP LLM Top 10 2026: What's Changing

The 2025 version is still the active standard, but the 2026 draft introduces significant changes:

  • NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
  • NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
  • NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
  • Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
  • Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks

Track OWASP LLM Top 10 2026 progress →

LLM01

Injeção de prompt

Critical

Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.

Tipos de ataque
  • Injeção direta: solicitações de usuários maliciosos que substituem as instruções do sistema
  • Indirect Injection: Hidden instructions in external documents, web content, or API responses
  • Manipulação de contexto: explorando o contexto da conversa para alterar o comportamento
  • Ataques de jailbreak: ignorando filtros de segurança por meio de prompts criativos
Exemplos de ataque
  • Ignore previous instructions and...
  • Texto incorporado em caracteres Unicode invisíveis
  • Injeção imediata via XSS armazenado em conteúdo da web
  • DAN (Do Anything Now) style jailbreaks
Estratégias de mitigação
  • Implementar validação e higienização de entrada rigorosas
  • Use a separação de privilégios entre as entradas do usuário e o sistema instruções
  • Aplicar filtragem de saída antes de exibir os resultados
  • Monitore padrões de injeção em logs
  • Implemente defesa profunda com múltiplas camadas de segurança
LLM02

Divulgação de informações confidenciais

Critical

LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.

Tipos de ataque
  • Extração de dados de treinamento: recuperação de dados confidenciais da memória do modelo
  • Vazamento de PII: exposição de informações de identificação pessoal
  • Exposição de chaves/credenciais de API: revelando segredos nas respostas
  • Divulgação de lógica de negócios: exposição de algoritmos ou processos proprietários
Exemplos de ataque
  • Extração de endereços de e-mail por meio de prompts específicos
  • Revelando credenciais SQL em mensagens de erro
  • Divulgação de PII do cliente a partir de dados de treinamento
  • Exposição de prompts internos do sistema
Estratégias de mitigação
  • Implementar filtragem robusta de entrada/saída
  • Aplicar pipelines de sanitização de dados
  • Aplicar políticas de exclusão do usuário para uso de dados
  • Use técnicas de privacidade diferenciais
  • Restringir acesso e visibilidade imediatos do sistema
LLM03

Vulnerabilidades da cadeia de suprimentos

High

Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.

Tipos de ataque
  • Adulteração de modelo: modelos pré-treinados comprometidos
  • Vulnerabilidades de dependência de PyPI/npm: Bibliotecas inseguras
  • Dados de ajuste fino maliciosos: conjuntos de dados de treinamento envenenados
  • Provedores de API comprometidos: serviços LLM não confiáveis
Exemplos de ataque
  • Pesos de modelo backdoor de fonte não confiável
  • Exploração de biblioteca de transformadores vulneráveis
  • Dados de treinamento envenenados com gatilhos ocultos
  • Armazenamento de documentos RAG comprometido
Estratégias de mitigação
  • Verificar a integridade do modelo por meio de somas de verificação e assinaturas
  • Manter SBOM (lista de materiais de software)
  • Use hubs de modelo confiáveis ​​e verifique a proveniência
  • Verificar dependências em busca de vulnerabilidades conhecidas
  • Implementar gerenciamento do ciclo de vida do modelo
LLM04

Envenenamento de dados e modelos

High

Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.

Tipos de ataque
  • Envenenamento de dados de treinamento: dados de treinamento de modelo corrompidos
  • Ajuste fino Envenenamento: injeção de backdoors por meio de ajuste fino
  • Envenenamento por RAG: contaminação de bases de conhecimento de recuperação
  • Manipulação de incorporação: bancos de dados de vetores corrompidos
Exemplos de ataque
  • Inserção de exemplos tendenciosos para alterar o comportamento do modelo
  • Criação de gatilhos backdoor em dados de treinamento
  • Envenenamento de conjuntos de dados públicos usados ​​para treinamento
  • Injetando informações falsas em documentos RAG
Estratégias de mitigação
  • Verifique a proveniência dos dados e a integridade da cadeia de suprimentos
  • Implementar validação de dados e detecção de anomalias
  • Use pipelines de limpeza de dados
  • Aplique proteções robustas de ajuste fino
  • Monitorar desvios de comportamento do modelo
LLM05

Manipulação de saída inadequada

High

Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.

Tipos de ataque
  • XSS via LLM Saída: scripts entre sites a partir de respostas de modelo
  • Injeção de SQL: consultas maliciosas geradas pelo LLM
  • Injeção de comando: LLM gerando comandos de sistema inseguros
  • Path Traversal: LLM revelando ou acessando não autorizado caminhos
Exemplos de ataque
  • LLM gerando JavaScript que executa no navegador
  • Modelo gerando consultas SQL maliciosas
  • Geração de código, incluindo chamadas de sistema inseguras
  • Divulgação do caminho do arquivo nas respostas
Estratégias de mitigação
  • Implementar validação e higienização de saída
  • Use filtragem de conteúdo sensível ao contexto
  • Aplique os mesmos controles de segurança que as entradas do usuário
  • Saídas do Sandbox LLM antes do uso downstream
  • Ativar modos de codificação seguros na geração de código
LLM06

Agência excessiva

High

Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.

Tipos de ataque
  • Acesso ilimitado a funções: permissões excessivas de API
  • Ação autônoma: executar ações sem aprovação humana
  • Abuso de ferramentas: exploração de ferramentas externas integradas
  • Manipulação de cadeia de pensamento: alterando processos de raciocínio
Exemplos de ataque
  • LLM com acesso à API do administrador realizando alterações não autorizadas
  • Execução automática de transações financeiras
  • Exclusão de recursos sem confirmação
  • Manipulação de dados do usuário sem consentimento
Estratégias de mitigação
  • Implementar controles de acesso com privilégios mínimos
  • Requer humano no circuito para ações críticas
  • Aplicar limitação de taxa a operações confidenciais
  • Registre e monitore todas as ações autônomas
  • Usar limitações de escopo no acesso à ferramenta
LLM07

Vazamento de prompt do sistema

Medium

Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.

Tipos de ataque
  • Extração direta de prompt: engenharia social para revelar prompts
  • Context Overflow: Técnicas de overflow para expor mensagens do sistema
  • Exploração de dramatização: enganar o LLM para revelar instruções
  • Vazamento de log: exposição de prompts em registros ou erros
Exemplos de ataque
  • Pedindo ao LLM para repetir o 'texto anterior' para extrair o prompt do sistema
  • Usando o estouro da janela de contexto para ignorar a análise de instruções
  • Injeção de prompt para substituir a função do sistema
  • Encontrar prompts nos logs de aplicativos
Estratégias de mitigação
  • Ofuscar prompts de sistema sempre que possível
  • Implementar técnicas de isolamento imediato
  • Usar processamento separado para instruções confidenciais
  • Monitore tentativas de extração de prompt
  • Aplicar filtragem de log rigorosa
LLM08

Vector and Embedding Weaknesses

Medium

Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.

Tipos de ataque
  • Injeção RAG: Conteúdo malicioso em documentos recuperados
  • Comprometimento do banco de dados vetorial: ataque ao armazenamento vetorial
  • Extração de incorporação: roubo de representações de incorporação
  • Manipulação de contexto: resultados de recuperação corrompidos
Exemplos de ataque
  • Documentos envenenados sendo recuperados como principais resultados
  • Acesso não autorizado ao banco de dados vetorial
  • Extraindo dados de treinamento de embeddings
  • Manipulação de recuperação por meio de ataques de incorporação
Estratégias de mitigação
  • Validar e higienizar todos os documentos de entrada RAG
  • Implementar controles de acesso ao banco de dados vetorial
  • Usar criptografia incorporada quando disponível
  • Aplicar reclassificação com filtros de segurança
  • Monitore a recuperação em busca de anomalias
LLM09

Desinformação

Medium

LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.

Tipos de ataque
  • Alucinações: Confiantes, mas falsas resultados
  • Erros factuais: informações incorretas apresentadas como fatos
  • Amplificação de preconceitos: reforçando preconceitos existentes
  • Manipulação: saídas enganosas deliberadas
Exemplos de ataque
  • Citando artigos de pesquisa inexistentes
  • Fornecer aconselhamento médico incorreto
  • Gerando recomendações de contratação tendenciosas
  • Criação de notícias ou análises falsas
Estratégias de mitigação
  • Implementar pipelines de verificação de fatos
  • Use pontuação de confiança e estimativa de incerteza
  • Aplicar verificação de origem para saídas críticas
  • Adicionar proveniência e atribuição de conteúdo
  • Rotule claramente o conteúdo gerado por IA
LLM10

Consumo ilimitado

Medium

Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.

Tipos de ataque
  • Abuso de taxa de API: chamadas excessivas de API esgotam cotas
  • Esgotamento de recursos: maximizando os recursos de computação
  • Exploração de custos: abuso de pagamento por token levando a cobranças
  • Ataques de inferência: extração de modelo por meio de consultas excessivas
Exemplos de ataque
  • Ataques automatizados consumindo toda a cota de API
  • Spam de prompt de tamanho máximo causando esgotamento computacional
  • Extração de modelo por meio de milhões de consultas
  • Loops de prompt recursivos consumindo recursos
Estratégias de mitigação
  • Implementar cotas e limites de taxa rigorosos
  • Adicionar limites de token de entrada/saída
  • Monitore padrões de uso em busca de anomalias
  • Use controles de custos e alertas de orçamento
  • Aplicar controles de tempo limite em operações de longa execução

Estrutura de teste OWASP

Siga esta abordagem estruturada para testar cada vulnerabilidade:

1. Reconhecimento

  • Mapear a arquitetura do sistema e o fluxo de dados
  • Identificação de pontos de entrada e interfaces de API
  • Ferramentas e plug-ins integrados de documentos
  • Revise os prompts e a configuração do sistema

2. Mapeamento de vulnerabilidades

  • Teste cada categoria OWASP sistematicamente
  • Documentar superfície de ataque e pontos de entrada
  • Identificar mecanismos de defesa em vigor
  • Mapear dependências e serviços de terceiros

3. Exploração

  • Conduza ataques de prova de conceito
  • Exploração e impacto de documentos
  • Teste o encadeamento múltiplo vulnerabilidades
  • Avalie a viabilidade de ataque no mundo real

4. Relatórios

  • Priorizar descobertas por nível de risco
  • Fornece recomendações de remediação
  • Incluir código de prova de conceito
  • Sugerir melhorias defensivas

Recursos oficiais

Fontes e estatísticas

AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.