Seguridad AG: Guía completa
Securing Retrieval-Augmented Generation systems against document poisoning, retrieval manipulation, and embedding attacks
Updated: August 2026 • arte de OWASP LLM08
¿Qué es RAG?
Retrieval-Augmented Generation (RAG) is an AI architecture that combines large language models with external knowledge retrieval. Enterprise LLM deployments now use RAG extensively, making its security critical.
. Consulta de usuario
ser envía una pregunta o mensaje al sistema
. incrustar
uery se convierte en incrustación de vectores
. Recuperación
Documentos similares recuperados de la base de datos vectorial.
. Aumento
contexto recuperado agregado al mensaje
. Generación
LM genera respuesta usando el contexto
él confía en la paradoja
RAG systems have a fundamental security flaw: user queries are treated as untrusted input, but retrieved context is implicitly trusted - even though both enter the same prompt. This creates a significant attack surface that traditional security doesn't address.
Vectores de ataque
. Envenenamiento de documentos
Inyectar contenido malicioso en documentos almacenados en la base de conocimientos.
Cómo funciona
- El atacante carga o inyecta documentos maliciosos
- Los documentos están incrustados y almacenados en una base de datos vectorial.
- Cuando se realiza una consulta relevante, se recupera el documento envenenado.
- LM incorpora contexto malicioso en la respuesta
impacto
- 90% success Con sólo 5 documentos envenenados.
- Funciona incluso en bases de datos con millones de documentos.
- una causa de resultados dañinos, sesgados o incorrectos
- difícil de detectar después del despliegue
. Manipulación de recuperación
manipular qué documentos se recuperan para influir en los resultados.
Cómo funciona
- El atacante crea consultas para activar una recuperación específica.
- Debilidades del algoritmo de clasificación xploits
- ses similitud semántica con la recuperación de secuestro
- manipulación de usuario ross en sistemas compartidos
impacto
- Fuerza la recuperación de contenido controlado por el atacante.
- y suprimir el contenido legítimo
- permite la manipulación dirigida
- Recupera la confianza en la calidad de la recuperación
. Inversión de incrustación
Recuperar datos originales de incrustaciones de vectores.
Cómo funciona
- El atacante obtiene acceso a la base de datos vectorial
- Técnicas de inversión de ses en incrustaciones.
- Ecoconstruye texto original a partir de vectores.
- Recupera datos confidenciales incorporados
impacto
- Recover 50-70% of input words
- exponer datos confidenciales en incrustaciones
- violaciones de rivalidad
- Cuestiones de cumplimiento (GDPR, etc.)
. Ataques entre inquilinos
Explotación de infraestructura RAG compartida en sistemas multiinquilino.
Cómo funciona
- El atacante es un inquilino del sistema compartido.
- Rechaza contenido que afecte a otros inquilinos.
- base de datos vectorial compartida xploits
- recupera datos de otros inquilinos
impacto
- ata fuga entre inquilinos
- acceso no autorizado a datos de la competencia
- violaciones de cumplimiento
- daño eputacional
CVE del mundo real
Vulnerabilidades documentadas en los sistemas RAG.
| ID VE | producto | descripción | cada vez | VSS |
|---|---|---|---|---|
CVE-2025-68700 |
RAGFlow | RCE via Canvas CodeExec component - untrusted data parsed with eval() | Critical | 9.1 |
CVE-2025-69286 |
RAGFlow | Insecure API key generation allows mutual token derivation (authentication bypass) | Critical | 8.9 |
CVE-2025-25282 |
RAGFlow | IDOR vulnerability allowing cross-tenant access and unauthorized user addition | High | 8.1 |
CVE-2025-69286 |
RAGFlow | Token generation using same URLSafeTimedSerializer for API keys | High | 8.9 |
GHSA-8xw3-v6c2-j84j |
RAGFlow | RCE via stdout parsing in CodeExec component | High | 8.5 |
estrategias de defensa
. Seguridad de la fase de ingesta
Validación del documento
- ¿Pueden todos los documentos buscar malware?
- Validar el formato y la estructura del documento.
- Diablos, para detectar patrones de contenido sospechosos.
- imitar tipos de documentos permitidos
Filtrado de contenidos
- eliminar la PII antes de incrustarla
- filtrar patrones de datos confidenciales
- bloquear patrones maliciosos conocidos
- Implementar listas de permitidos/bloqueados
Controles de acceso
- alidar fuente de documentos
- implementar RBAC para la ingestión
- Registro de auditoría para todas las cargas.
- nuevos documentos garantizados
. Seguridad de la fase de recuperación
higienización de la uería
- Alidar y desinfectar las consultas de los usuarios.
- detectar intentos de inyección
- imitar la complejidad de la consulta
- comió limitando
Recuperación Filtrado
- implementar seguridad de reclasificación
- referencia cruzada con fuentes confiables
- detectar patrones de recuperación anómalos
- limitar el número de documentos
Aislamiento de arrendamiento final
- espacios de nombres vectoriales separados
- límites estrictos para los inquilinos
- prevención de consultas de inquilinos de ross
- ncryption por inquilino
. Seguridad de la fase de generación
Validación de salida
- alidar resultados de LLM
- diablos por contenido inyectado
- actuar-verificar contra fuentes
- filtrado de contenido
Verificación ontext
- verificar la autenticidad del contenido recuperado
- detectar intentos de manipulación
- retrasar patrones de contexto inusuales
- og todo el uso del contexto
uman-in-the-Loop
- revisar resultados confidenciales
- aprobar acciones de alto riesgo
- capacidad de anulación anual
- caminos de escalación
. Seguridad de datos
cifrado
- vectores de ncrypt en reposo
- LS para datos en tránsito
- mejores practicas de gestion de ey
- Considere el cifrado homomórfico.
seguridad de la base de datos
- autenticación fuerte
- aislamiento de red
- auditorías de seguridad periódicas
- manejo de pinchazos
protección de la privacidad
- minimización de datos
- II detección y eliminación
- políticas de retención
- derecho a la eliminación de soporte
Metodología de prueba
Lista de verificación de pruebas de seguridad AG
- pruebas de inyección de documentos
- pruebas de manipulación de recuperación
- intentos de inversión de incrustación
- pruebas de aislamiento de inquilinos de ross
- II pruebas de fuga
- pruebas de desbordamiento de contexto
- pruebas de manipulación de anking
- pruebas de omisión de autenticación
- Pruebas de inyección de PI
- pruebas de negativa de servicio
- pruebas de exfiltración de ata
- auditoría de cumplimiento
herramientas de prueba
Ejemplos de oda
Ejemplo de validación de documento
```python
import re
from typing import List
class RAGDocumentValidator:
SUSPICIOUS_PATTERNS = [
r"ignore previous instructions",
r"system prompt:",
r"{{.*}}",
r"you are now dan",
]
PII_PATTERNS = [
r"\b\d{3}-\d{2}-\d{4}\b", # SSN
r"\b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b", # Email
r"\b\d{16}\b", # Credit card
]
def validate_document(self, content: str) -> dict:
"""Validate document before embedding."""
warnings = []
blocked = False
# Check for suspicious patterns
for pattern in self.SUSPICIOUS_PATTERNS:
if re.search(pattern, content, re.IGNORECASE):
warnings.append(f"Suspicious pattern: {pattern}")
blocked = True
# Check for PII
for pattern in self.PII_PATTERNS:
if re.search(pattern, content):
warnings.append(f"PII detected: {pattern}")
return {
"valid": not blocked,
"warnings": warnings,
"pii_detected": len([w for w in warnings if "PII" in w]) > 0
}
```