Yo hackeo
Recursos de seguridad

Seguridad AG: Guía completa

Securing Retrieval-Augmented Generation systems against document poisoning, retrieval manipulation, and embedding attacks

Updated: August 2026 • arte de OWASP LLM08

¿Qué es RAG?

Retrieval-Augmented Generation (RAG) is an AI architecture that combines large language models with external knowledge retrieval. Enterprise LLM deployments now use RAG extensively, making its security critical.

. Consulta de usuario

ser envía una pregunta o mensaje al sistema

. incrustar

uery se convierte en incrustación de vectores

. Recuperación

Documentos similares recuperados de la base de datos vectorial.

. Aumento

contexto recuperado agregado al mensaje

. Generación

LM genera respuesta usando el contexto

él confía en la paradoja

RAG systems have a fundamental security flaw: user queries are treated as untrusted input, but retrieved context is implicitly trusted - even though both enter the same prompt. This creates a significant attack surface that traditional security doesn't address.

Vectores de ataque

. Envenenamiento de documentos

Inyectar contenido malicioso en documentos almacenados en la base de conocimientos.

Cómo funciona
  • El atacante carga o inyecta documentos maliciosos
  • Los documentos están incrustados y almacenados en una base de datos vectorial.
  • Cuando se realiza una consulta relevante, se recupera el documento envenenado.
  • LM incorpora contexto malicioso en la respuesta
impacto
  • 90% success Con sólo 5 documentos envenenados.
  • Funciona incluso en bases de datos con millones de documentos.
  • una causa de resultados dañinos, sesgados o incorrectos
  • difícil de detectar después del despliegue

. Manipulación de recuperación

manipular qué documentos se recuperan para influir en los resultados.

Cómo funciona
  • El atacante crea consultas para activar una recuperación específica.
  • Debilidades del algoritmo de clasificación xploits
  • ses similitud semántica con la recuperación de secuestro
  • manipulación de usuario ross en sistemas compartidos
impacto
  • Fuerza la recuperación de contenido controlado por el atacante.
  • y suprimir el contenido legítimo
  • permite la manipulación dirigida
  • Recupera la confianza en la calidad de la recuperación

. Inversión de incrustación

Recuperar datos originales de incrustaciones de vectores.

Cómo funciona
  • El atacante obtiene acceso a la base de datos vectorial
  • Técnicas de inversión de ses en incrustaciones.
  • Ecoconstruye texto original a partir de vectores.
  • Recupera datos confidenciales incorporados
impacto
  • Recover 50-70% of input words
  • exponer datos confidenciales en incrustaciones
  • violaciones de rivalidad
  • Cuestiones de cumplimiento (GDPR, etc.)

. Ataques entre inquilinos

Explotación de infraestructura RAG compartida en sistemas multiinquilino.

Cómo funciona
  • El atacante es un inquilino del sistema compartido.
  • Rechaza contenido que afecte a otros inquilinos.
  • base de datos vectorial compartida xploits
  • recupera datos de otros inquilinos
impacto
  • ata fuga entre inquilinos
  • acceso no autorizado a datos de la competencia
  • violaciones de cumplimiento
  • daño eputacional

CVE del mundo real

Vulnerabilidades documentadas en los sistemas RAG.

ID VE producto descripción cada vez VSS
CVE-2025-68700 RAGFlow RCE via Canvas CodeExec component - untrusted data parsed with eval() Critical 9.1
CVE-2025-69286 RAGFlow Insecure API key generation allows mutual token derivation (authentication bypass) Critical 8.9
CVE-2025-25282 RAGFlow IDOR vulnerability allowing cross-tenant access and unauthorized user addition High 8.1
CVE-2025-69286 RAGFlow Token generation using same URLSafeTimedSerializer for API keys High 8.9
GHSA-8xw3-v6c2-j84j RAGFlow RCE via stdout parsing in CodeExec component High 8.5

estrategias de defensa

. Seguridad de la fase de ingesta

Validación del documento

  • ¿Pueden todos los documentos buscar malware?
  • Validar el formato y la estructura del documento.
  • Diablos, para detectar patrones de contenido sospechosos.
  • imitar tipos de documentos permitidos

Filtrado de contenidos

  • eliminar la PII antes de incrustarla
  • filtrar patrones de datos confidenciales
  • bloquear patrones maliciosos conocidos
  • Implementar listas de permitidos/bloqueados

Controles de acceso

  • alidar fuente de documentos
  • implementar RBAC para la ingestión
  • Registro de auditoría para todas las cargas.
  • nuevos documentos garantizados

. Seguridad de la fase de recuperación

higienización de la uería

  • Alidar y desinfectar las consultas de los usuarios.
  • detectar intentos de inyección
  • imitar la complejidad de la consulta
  • comió limitando

Recuperación Filtrado

  • implementar seguridad de reclasificación
  • referencia cruzada con fuentes confiables
  • detectar patrones de recuperación anómalos
  • limitar el número de documentos

Aislamiento de arrendamiento final

  • espacios de nombres vectoriales separados
  • límites estrictos para los inquilinos
  • prevención de consultas de inquilinos de ross
  • ncryption por inquilino

. Seguridad de la fase de generación

Validación de salida

  • alidar resultados de LLM
  • diablos por contenido inyectado
  • actuar-verificar contra fuentes
  • filtrado de contenido

Verificación ontext

  • verificar la autenticidad del contenido recuperado
  • detectar intentos de manipulación
  • retrasar patrones de contexto inusuales
  • og todo el uso del contexto

uman-in-the-Loop

  • revisar resultados confidenciales
  • aprobar acciones de alto riesgo
  • capacidad de anulación anual
  • caminos de escalación

. Seguridad de datos

cifrado

  • vectores de ncrypt en reposo
  • LS para datos en tránsito
  • mejores practicas de gestion de ey
  • Considere el cifrado homomórfico.

seguridad de la base de datos

  • autenticación fuerte
  • aislamiento de red
  • auditorías de seguridad periódicas
  • manejo de pinchazos

protección de la privacidad

  • minimización de datos
  • II detección y eliminación
  • políticas de retención
  • derecho a la eliminación de soporte

Metodología de prueba

Lista de verificación de pruebas de seguridad AG

  • pruebas de inyección de documentos
  • pruebas de manipulación de recuperación
  • intentos de inversión de incrustación
  • pruebas de aislamiento de inquilinos de ross
  • II pruebas de fuga
  • pruebas de desbordamiento de contexto
  • pruebas de manipulación de anking
  • pruebas de omisión de autenticación
  • Pruebas de inyección de PI
  • pruebas de negativa de servicio
  • pruebas de exfiltración de ata
  • auditoría de cumplimiento

herramientas de prueba

arak

Escáner de vulnerabilidad LM con sondas específicas de RAG

ver →

pache trapo

Marco de pruebas de seguridad específico de AG

ver →

Escáneres ector DB

Herramientas para probar la seguridad de bases de datos vectoriales.

ver →

Ejemplos de oda

Ejemplo de validación de documento

```python
import re
from typing import List

class RAGDocumentValidator:
    SUSPICIOUS_PATTERNS = [
        r"ignore previous instructions",
        r"system prompt:",
        r"{{.*}}",
        r"you are now dan",
    ]
    
    PII_PATTERNS = [
        r"\b\d{3}-\d{2}-\d{4}\b",  # SSN
        r"\b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b",  # Email
        r"\b\d{16}\b",  # Credit card
    ]
    
    def validate_document(self, content: str) -> dict:
        """Validate document before embedding."""
        warnings = []
        blocked = False
        
        # Check for suspicious patterns
        for pattern in self.SUSPICIOUS_PATTERNS:
            if re.search(pattern, content, re.IGNORECASE):
                warnings.append(f"Suspicious pattern: {pattern}")
                blocked = True
        
        # Check for PII
        for pattern in self.PII_PATTERNS:
            if re.search(pattern, content):
                warnings.append(f"PII detected: {pattern}")
        
        return {
            "valid": not blocked,
            "warnings": warnings,
            "pii_detected": len([w for w in warnings if "PII" in w]) > 0
        }
```
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.