Yo hackeo
Recursos de seguridad

OWASP Top 10 for LLM Applications 2025/2026

The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes

73%
Las implementaciones tienen vulnerabilidades críticas.
OWASP Estado de la seguridad de la IA, 2025)
41%
La IA empresarial tiene API no autenticadas
Investigación de CodeWall, 2025)
Virtually 100%
inyección rápida explotable en implementaciones LLM
OWASP LLM Top 10, 2025)
⚠

Conciencia de riesgos críticos

La inyección rompt sigue siendo la vulnerabilidad número uno. Consulte nuestra guía completa de inyección rápida →

🔮

OWASP LLM Top 10 2026: What's Changing

The 2025 version is still the active standard, but the 2026 draft introduces significant changes:

  • NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
  • NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
  • NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
  • Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
  • Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks

Track OWASP LLM Top 10 2026 progress →

LLM01

inyección rompt

Critical

Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.

Tipos de ataque
  • Inyección directa: mensajes de usuario maliciosos que anulan las instrucciones del sistema
  • Indirect Injection: Hidden instructions in external documents, web content, or API responses
  • Manipulación de ontext: explotar el contexto de la conversación para alterar el comportamiento
  • Ataques de ailbreak: eludir los filtros de seguridad mediante indicaciones creativas
Ejemplos de ataque
  • Ignore previous instructions and...
  • ext incrustado en caracteres Unicode invisibles
  • inyección rápida a través de XSS almacenado en contenido web
  • DAN (Do Anything Now) style jailbreaks
Estrategias de litigación
  • Implementar una estricta validación y desinfección de las entradas.
  • Separación de privilegios entre las entradas del usuario y las indicaciones del sistema.
  • Aplicar filtrado de salida antes de mostrar los resultados.
  • Monitor de patrones de inyección en registros.
  • Implementar una defensa en profundidad con múltiples capas de seguridad.
LLM02

Divulgación de información sensible

Critical

LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.

Tipos de ataque
  • Extracción de datos: recuperación de datos confidenciales de la memoria del modelo
  • II Fuga: Exponer información de identificación personal
  • Exposición de credenciales/clave PI: revelar secretos en las respuestas
  • Divulgación de la lógica empresarial: exponer algoritmos o procesos propietarios
Ejemplos de ataque
  • extraer direcciones de correo electrónico a través de indicaciones específicas
  • Mostrar credenciales SQL en mensajes de error
  • Cerrar la PII del cliente de los datos de capacitación.
  • exponer mensajes internos del sistema
Estrategias de litigación
  • Implementar un filtrado robusto de entrada/salida.
  • nforce canales de desinfección de datos
  • Aplicar políticas de exclusión voluntaria del usuario para el uso de datos.
  • se técnicas de privacidad diferenciales
  • Sistema estricto de acceso rápido y visibilidad.
LLM03

Vulnerabilidades de la cadena de suministro

High

Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.

Tipos de ataque
  • Manipulación de modelos: modelos preentrenados comprometidos
  • Vulnerabilidades de dependencia de yPI/npm: bibliotecas inseguras
  • alicious Datos de ajuste fino: conjuntos de datos de entrenamiento envenenados
  • Proveedores de API comprometidos: servicios LLM no confiables
Ejemplos de ataque
  • pesos de modelos respaldados de fuente no confiable
  • explotación de la biblioteca de transformadores vulnerables
  • Datos de entrenamiento envenenados con desencadenantes ocultos.
  • almacén de documentos RAG comprometido
Estrategias de litigación
  • verificar la integridad del modelo mediante sumas de verificación y firmas
  • Mantener SBOM (Lista de materiales de software)
  • Busque centros de modelos confiables y verifique su procedencia.
  • ¿Pueden existir dependencias para vulnerabilidades conocidas?
  • Implementar la gestión del ciclo de vida del modelo.
LLM04

ata y modelo de envenenamiento

High

Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.

Tipos de ataque
  • Lluvia de envenenamiento de datos: datos de entrenamiento del modelo corruptos
  • Envenenamiento de ajuste fino: inyectar puertas traseras mediante ajuste fino
  • Envenenamiento por AG: bases de conocimiento de recuperación contaminadas
  • Manipulación de mbedding: corrupción de bases de datos vectoriales
Ejemplos de ataque
  • Insertar ejemplos sesgados para alterar el comportamiento del modelo.
  • Creación de activadores de puerta trasera en datos de entrenamiento.
  • Envenenamiento de conjuntos de datos públicos utilizados para la formación.
  • Inyectar información falsa en documentos RAG.
Estrategias de litigación
  • verificar la procedencia de los datos y la integridad de la cadena de suministro
  • Implementar validación de datos y detección de anomalías.
  • se tuberías de desinfección de datos
  • Aplicar sólidas salvaguardias de ajuste
  • Monitor de deriva del comportamiento del modelo.
LLM05

Manejo inadecuado de la salida

High

Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.

Tipos de ataque
  • SS a través de salida LLM: secuencias de comandos entre sitios a partir de respuestas modelo
  • Inyección QL: consultas maliciosas generadas por LLM
  • Inyección de comandos: LLM genera comandos de sistema inseguros
  • ath Traversal: LLM que revela o accede a rutas no autorizadas
Ejemplos de ataque
  • LM genera JavaScript que se ejecuta en el navegador
  • modelo que genera consultas SQL maliciosas
  • Generación de odas que incluyen llamadas al sistema inseguras.
  • divulgación de ruta de archivo en las respuestas
Estrategias de litigación
  • Implementar validación y desinfección de resultados.
  • ver filtrado de contenido contextual
  • Aplicar los mismos controles de seguridad que las entradas del usuario.
  • Salidas de andbox LLM antes de su uso posterior
  • Activar modos de codificación seguros en la generación de código.
LLM06

Agencia excesiva

High

Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.

Tipos de ataque
  • Acceso limitado a funciones: permisos API excesivos
  • Acción autónoma: realizar acciones sin la aprobación humana.
  • Abuso de herramientas: explotación de herramientas externas integradas
  • Manipulación de la cadena de pensamiento: alteración de los procesos de razonamiento
Ejemplos de ataque
  • LM con acceso a la API de administrador realizando cambios no autorizados
  • transacciones financieras de ejecución automática
  • eliminando recursos sin confirmación
  • manipular datos del usuario sin consentimiento
Estrategias de litigación
  • Implementar controles de acceso con privilegios mínimos.
  • Requerir intervención humana para acciones críticas.
  • Aplicar limitación de tasas a operaciones sensibles
  • Registrar y monitorear todas las acciones autónomas.
  • ver limitaciones de alcance en el acceso a herramientas
LLM07

Fuga rápida del sistema

Medium

Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.

Tipos de ataque
  • Extracción directa de indicaciones: ingeniería social para revelar indicaciones
  • ontext Overflow: técnicas de desbordamiento para exponer mensajes del sistema
  • Explotación de ole Play: engaña a LLM para que revele instrucciones
  • og Fuga: exposición de mensajes en registros o errores
Ejemplos de ataque
  • Solicitar a LLM que repita el 'texto anterior' para extraer el mensaje del sistema
  • cantar desbordamiento de ventana de contexto para omitir el análisis de instrucciones
  • Inyección rápida para anular la función del sistema.
  • Encontrar mensajes en los registros de la aplicación.
Estrategias de litigación
  • El sistema bfuscate indica cuando es posible.
  • implementar técnicas de aislamiento rápido
  • Se procesa por separado para instrucciones confidenciales.
  • Monitor para intentos de extracción rápidos.
  • Aplicar filtrado de registros estricto
LLM08

Debilidades del sector y la incrustación

Medium

Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.

Tipos de ataque
  • Inyección AG: contenido malicioso en documentos recuperados
  • Compromiso de ector DB: ataque al almacenamiento vectorial
  • Extracción de mbedding: robo de representaciones incrustadas
  • Manipulación de ontext: resultados de recuperación corruptos
Ejemplos de ataque
  • Los documentos envenenados se recuperan como mejores resultados.
  • acceso no autorizado a la base de datos del sector
  • extraer datos de entrenamiento de incrustaciones
  • Manipulación de recuperación mediante ataques de incrustación.
Estrategias de litigación
  • alidar y desinfectar todos los documentos de entrada del RAG
  • implementar controles de acceso a bases de datos vectoriales
  • se incorpora cifrado cuando esté disponible
  • aplicar reclasificación con filtros de seguridad
  • Monitor de recuperación de anomalías.
LLM09

es información

Medium

LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.

Tipos de ataque
  • Alucinaciones: Salidas seguras pero falsas.
  • Errores reales: información incorrecta presentada como un hecho
  • Amplificación de ias: reforzando los sesgos existentes
  • manipulación: resultados engañosos deliberados
Ejemplos de ataque
  • iting trabajos de investigación inexistentes
  • Dar consejos médicos incorrectos.
  • generar recomendaciones de contratación sesgadas
  • leer noticias o reseñas falsas
Estrategias de litigación
  • Implementar canales de verificación de hechos.
  • se puntuación de confianza y estimación de incertidumbre
  • Aplicar verificación de origen para productos críticos.
  • dd procedencia y atribución del contenido
  • contenido generado por abel AI claramente
LLM10

Consumo ilimitado

Medium

Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.

Tipos de ataque
  • Abuso de PI Rate: llamadas API excesivas que agotan las cuotas
  • Agotamiento de recursos: maximizar los recursos informáticos
  • Explotación de la mayoría: abuso de pago por token que genera cargos
  • Ataques de referencia: extracción del modelo mediante consultas excesivas
Ejemplos de ataque
  • ataques automatizados que consumen toda la cuota de API
  • spam de aviso de longitud de hacha que causa agotamiento de la computación
  • Extraer modelo a través de millones de consultas.
  • bucles rápidos ecursivos que consumen recursos
Estrategias de litigación
  • Implementar límites estrictos de tarifas y cuotas.
  • Límites de tokens de entrada/salida dd
  • Supervisar los patrones de uso en busca de anomalías.
  • ver controles de costos y alertas de presupuesto
  • Aplicar controles de tiempo de espera en operaciones de larga duración.

Marco de prueba WASP

Siga este enfoque estructurado para probar cada vulnerabilidad:

. Reconocimiento

  • Arquitectura del sistema AP y flujo de datos.
  • identificar puntos de entrada e interfaces API
  • herramientas y complementos integrados de documentos
  • Revisar las indicaciones y la configuración del sistema.

. Mapeo de vulnerabilidades

  • est cada categoría de OWASP sistemáticamente
  • Superficie de ataque de objetos y puntos de entrada.
  • identificar los mecanismos de defensa existentes
  • dependencias de AP y servicios de terceros

. Explotación

  • Realizar ataques de prueba de concepto.
  • Explotación e impacto del documento.
  • está encadenando múltiples vulnerabilidades
  • Evaluar la viabilidad de un ataque en el mundo real.

. Informes

  • priorizar los hallazgos por nivel de riesgo
  • proporcionar recomendaciones de remediación
  • Incluye código de prueba de concepto.
  • sugerir mejoras defensivas
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.