OWASP Top 10 for LLM Applications 2025/2026
The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes
Consciência de risco crítico
A injeção imediata continua sendo a vulnerabilidade número 1. Veja nosso abrangente Guia de injeção de prompt →
OWASP LLM Top 10 2026: What's Changing
The 2025 version is still the active standard, but the 2026 draft introduces significant changes:
- NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
- NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
- NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
- Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
- Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks
Injeção de prompt
Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.
Tipos de ataque
- Injeção direta: solicitações de usuários maliciosos que substituem as instruções do sistema
- Indirect Injection: Hidden instructions in external documents, web content, or API responses
- Manipulação de contexto: explorando o contexto da conversa para alterar o comportamento
- Ataques de jailbreak: ignorando filtros de segurança por meio de prompts criativos
Exemplos de ataque
Ignore previous instructions and...Texto incorporado em caracteres Unicode invisíveisInjeção imediata via XSS armazenado em conteúdo da webDAN (Do Anything Now) style jailbreaks
Estratégias de mitigação
- Implementar validação e higienização de entrada rigorosas
- Use a separação de privilégios entre as entradas do usuário e o sistema instruções
- Aplicar filtragem de saída antes de exibir os resultados
- Monitore padrões de injeção em logs
- Implemente defesa profunda com múltiplas camadas de segurança
Divulgação de informações confidenciais
LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.
Tipos de ataque
- Extração de dados de treinamento: recuperação de dados confidenciais da memória do modelo
- Vazamento de PII: exposição de informações de identificação pessoal
- Exposição de chaves/credenciais de API: revelando segredos nas respostas
- Divulgação de lógica de negócios: exposição de algoritmos ou processos proprietários
Exemplos de ataque
Extração de endereços de e-mail por meio de prompts específicosRevelando credenciais SQL em mensagens de erroDivulgação de PII do cliente a partir de dados de treinamentoExposição de prompts internos do sistema
Estratégias de mitigação
- Implementar filtragem robusta de entrada/saída
- Aplicar pipelines de sanitização de dados
- Aplicar políticas de exclusão do usuário para uso de dados
- Use técnicas de privacidade diferenciais
- Restringir acesso e visibilidade imediatos do sistema
Vulnerabilidades da cadeia de suprimentos
Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.
Tipos de ataque
- Adulteração de modelo: modelos pré-treinados comprometidos
- Vulnerabilidades de dependência de PyPI/npm: Bibliotecas inseguras
- Dados de ajuste fino maliciosos: conjuntos de dados de treinamento envenenados
- Provedores de API comprometidos: serviços LLM não confiáveis
Exemplos de ataque
Pesos de modelo backdoor de fonte não confiávelExploração de biblioteca de transformadores vulneráveisDados de treinamento envenenados com gatilhos ocultosArmazenamento de documentos RAG comprometido
Estratégias de mitigação
- Verificar a integridade do modelo por meio de somas de verificação e assinaturas
- Manter SBOM (lista de materiais de software)
- Use hubs de modelo confiáveis e verifique a proveniência
- Verificar dependências em busca de vulnerabilidades conhecidas
- Implementar gerenciamento do ciclo de vida do modelo
Envenenamento de dados e modelos
Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.
Tipos de ataque
- Envenenamento de dados de treinamento: dados de treinamento de modelo corrompidos
- Ajuste fino Envenenamento: injeção de backdoors por meio de ajuste fino
- Envenenamento por RAG: contaminação de bases de conhecimento de recuperação
- Manipulação de incorporação: bancos de dados de vetores corrompidos
Exemplos de ataque
Inserção de exemplos tendenciosos para alterar o comportamento do modeloCriação de gatilhos backdoor em dados de treinamentoEnvenenamento de conjuntos de dados públicos usados para treinamentoInjetando informações falsas em documentos RAG
Estratégias de mitigação
- Verifique a proveniência dos dados e a integridade da cadeia de suprimentos
- Implementar validação de dados e detecção de anomalias
- Use pipelines de limpeza de dados
- Aplique proteções robustas de ajuste fino
- Monitorar desvios de comportamento do modelo
Manipulação de saída inadequada
Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.
Tipos de ataque
- XSS via LLM Saída: scripts entre sites a partir de respostas de modelo
- Injeção de SQL: consultas maliciosas geradas pelo LLM
- Injeção de comando: LLM gerando comandos de sistema inseguros
- Path Traversal: LLM revelando ou acessando não autorizado caminhos
Exemplos de ataque
LLM gerando JavaScript que executa no navegadorModelo gerando consultas SQL maliciosasGeração de código, incluindo chamadas de sistema insegurasDivulgação do caminho do arquivo nas respostas
Estratégias de mitigação
- Implementar validação e higienização de saída
- Use filtragem de conteúdo sensível ao contexto
- Aplique os mesmos controles de segurança que as entradas do usuário
- Saídas do Sandbox LLM antes do uso downstream
- Ativar modos de codificação seguros na geração de código
Agência excessiva
Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.
Tipos de ataque
- Acesso ilimitado a funções: permissões excessivas de API
- Ação autônoma: executar ações sem aprovação humana
- Abuso de ferramentas: exploração de ferramentas externas integradas
- Manipulação de cadeia de pensamento: alterando processos de raciocínio
Exemplos de ataque
LLM com acesso à API do administrador realizando alterações não autorizadasExecução automática de transações financeirasExclusão de recursos sem confirmaçãoManipulação de dados do usuário sem consentimento
Estratégias de mitigação
- Implementar controles de acesso com privilégios mínimos
- Requer humano no circuito para ações críticas
- Aplicar limitação de taxa a operações confidenciais
- Registre e monitore todas as ações autônomas
- Usar limitações de escopo no acesso à ferramenta
Vazamento de prompt do sistema
Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.
Tipos de ataque
- Extração direta de prompt: engenharia social para revelar prompts
- Context Overflow: Técnicas de overflow para expor mensagens do sistema
- Exploração de dramatização: enganar o LLM para revelar instruções
- Vazamento de log: exposição de prompts em registros ou erros
Exemplos de ataque
Pedindo ao LLM para repetir o 'texto anterior' para extrair o prompt do sistemaUsando o estouro da janela de contexto para ignorar a análise de instruçõesInjeção de prompt para substituir a função do sistemaEncontrar prompts nos logs de aplicativos
Estratégias de mitigação
- Ofuscar prompts de sistema sempre que possível
- Implementar técnicas de isolamento imediato
- Usar processamento separado para instruções confidenciais
- Monitore tentativas de extração de prompt
- Aplicar filtragem de log rigorosa
Vector and Embedding Weaknesses
Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.
Tipos de ataque
- Injeção RAG: Conteúdo malicioso em documentos recuperados
- Comprometimento do banco de dados vetorial: ataque ao armazenamento vetorial
- Extração de incorporação: roubo de representações de incorporação
- Manipulação de contexto: resultados de recuperação corrompidos
Exemplos de ataque
Documentos envenenados sendo recuperados como principais resultadosAcesso não autorizado ao banco de dados vetorialExtraindo dados de treinamento de embeddingsManipulação de recuperação por meio de ataques de incorporação
Estratégias de mitigação
- Validar e higienizar todos os documentos de entrada RAG
- Implementar controles de acesso ao banco de dados vetorial
- Usar criptografia incorporada quando disponível
- Aplicar reclassificação com filtros de segurança
- Monitore a recuperação em busca de anomalias
Desinformação
LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.
Tipos de ataque
- Alucinações: Confiantes, mas falsas resultados
- Erros factuais: informações incorretas apresentadas como fatos
- Amplificação de preconceitos: reforçando preconceitos existentes
- Manipulação: saídas enganosas deliberadas
Exemplos de ataque
Citando artigos de pesquisa inexistentesFornecer aconselhamento médico incorretoGerando recomendações de contratação tendenciosasCriação de notícias ou análises falsas
Estratégias de mitigação
- Implementar pipelines de verificação de fatos
- Use pontuação de confiança e estimativa de incerteza
- Aplicar verificação de origem para saídas críticas
- Adicionar proveniência e atribuição de conteúdo
- Rotule claramente o conteúdo gerado por IA
Consumo ilimitado
Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.
Tipos de ataque
- Abuso de taxa de API: chamadas excessivas de API esgotam cotas
- Esgotamento de recursos: maximizando os recursos de computação
- Exploração de custos: abuso de pagamento por token levando a cobranças
- Ataques de inferência: extração de modelo por meio de consultas excessivas
Exemplos de ataque
Ataques automatizados consumindo toda a cota de APISpam de prompt de tamanho máximo causando esgotamento computacionalExtração de modelo por meio de milhões de consultasLoops de prompt recursivos consumindo recursos
Estratégias de mitigação
- Implementar cotas e limites de taxa rigorosos
- Adicionar limites de token de entrada/saída
- Monitore padrões de uso em busca de anomalias
- Use controles de custos e alertas de orçamento
- Aplicar controles de tempo limite em operações de longa execução
Estrutura de teste OWASP
Siga esta abordagem estruturada para testar cada vulnerabilidade:
1. Reconhecimento
- Mapear a arquitetura do sistema e o fluxo de dados
- Identificação de pontos de entrada e interfaces de API
- Ferramentas e plug-ins integrados de documentos
- Revise os prompts e a configuração do sistema
2. Mapeamento de vulnerabilidades
- Teste cada categoria OWASP sistematicamente
- Documentar superfície de ataque e pontos de entrada
- Identificar mecanismos de defesa em vigor
- Mapear dependências e serviços de terceiros
3. Exploração
- Conduza ataques de prova de conceito
- Exploração e impacto de documentos
- Teste o encadeamento múltiplo vulnerabilidades
- Avalie a viabilidade de ataque no mundo real
4. Relatórios
- Priorizar descobertas por nível de risco
- Fornece recomendações de remediação
- Incluir código de prova de conceito
- Sugerir melhorias defensivas
Recursos oficiais
- Página oficial do OWASP LLM Top 10 2025
- Baixar OWASP LLM Top 10 2025 PDF
- Projeto de segurança OWASP LLM
- OWASP Agentic AI Security
Fontes e estatísticas
- Relatório de segurança de IA do OWASP 2025 - 73% of organizations have critical AI vulnerabilities
- Cibersegurança Suíça - Estatísticas de segurança de IA 2026 - Mais de 40 estatísticas selecionadas
- CrowdStrike Global Threat Report 2026 - AI-enabled attacks up 89%
- Darktrace State of AI Cybersecurity 2026 - Pesquisa com mais de 1.500 líderes de segurança
- IBM X-Force Threat Intelligence Index 2026 - Ataques acelerados por IA