RAG-biztonság: teljes útmutató
Securing Retrieval-Augmented Generation systems against document poisoning, retrieval manipulation, and embedding attacks
Updated: August 2026 • Az OWASP LLM08 befecskendezési technikájának része
Mi az a RAG?
Retrieval-Augmented Generation (RAG) is an AI architecture that combines large language models with external knowledge retrieval. Enterprise LLM deployments now use RAG extensively, making its security critical.
1. Felhasználói lekérdezés
Strukturált megközelítés a mesterséges intelligencia teszteléséhez – a tervezéstől a jelentéskészítésig.
2. Beágyazás
A lekérdezést vektoros beágyazássá alakítják munkafolyamatok.
3. Visszakeresés
Similar documents retrieved from vector DB
4. Kiegészítés
A kért kontextus hozzáadva a prompthoz
5. Generáció
Az LLM a kontextus felhasználásával választ generál
A Trust Paradox Speciális számai|
RAG systems have a fundamental security flaw: user queries are treated as untrusted input, but retrieved context is implicitly trusted - even though both enter the same prompt. This creates a significant attack surface that traditional security doesn't address.
Támadásvektorok
1. Dokumentummérgezés
Rosszindulatú tartalom beszúrása a tudásbázisban tárolt dokumentumokba.
Hogyan működik Személyazonosításra alkalmas adatok láthatók
- A támadó rosszindulatú dokumentumokat tölt fel vagy szúr be Kimenet: Helyek közötti szkriptelés a modellválaszokból
- A dokumentumok vektoros DB-be vannak ágyazva és tárolva feltört ügynöki keretrendszerek.
- A releváns lekérdezéskor a megmérgezett dokumentumot lekérik.
- LLM rosszindulatú kontextust épít be a válaszba
Hatás
- 90% success Jogi: [legal@company]
- Még több millió dokumentumot tartalmazó adatbázisokban is működik
- NIST AI kockázatkezelés
- Telepítés után nehéz észlelni
2. Visszakeresési manipuláció
Manipulálni, hogy mely dokumentumok legyenek beolvasva, hogy befolyásolják a kimeneteket.
Hogyan működik Személyazonosításra alkalmas adatok láthatók
- A támadó lekérdezéseket hoz létre, hogy specifikus visszakeresést indítson el
- Kihasználja a rangsorolási algoritmus gyengeségeit
- Szemantikai hasonlóságot használ a gépeltérítési visszakereséshez
- Felhasználók közötti manipuláció megosztott rendszerekben
Hatás
- Kényszeríti a támadók által irányított tartalom visszakeresését
- Elnyomhatja a jogos tartalmat
- Célzott manipulációt tesz lehetővé
- Megtöri a visszakeresés minőségébe vetett bizalmat
3. Inverzió beágyazása
Eredeti adatok visszaállítása vektoros beágyazásokból.
Hogyan működik Személyazonosításra alkalmas adatok láthatók
- A támadó hozzáférést kap a vektoros adatbázishoz
- Inverziós technikákat használ a beágyazásoknál
- Visszaállítja az eredeti szöveget vektorokból
- Kényes beágyazott adatok helyreállítása
Hatás
- Recover 50-70% of input words
- Érzékeny adatok közzététele a beágyazásokban
- Adatvédelem megsértése
- Megfelelőségi problémák (GDPR stb.)
4. Cross-Tenant Attacks
Megosztott RAG-infrastruktúra kihasználása több bérlős rendszerekben.
Hogyan működik Személyazonosításra alkalmas adatok láthatók
- A támadó a megosztott rendszer egyik bérlője
- | egyéb bérlői szolgáltatásokat. hamisítás több ügynököt tartalmazó rendszerekben
- Kihasználja a megosztott vektoradatbázist
- Adatok lekérése más bérlőktől
Hatás
- Data leakage between tenants
- Jogosulatlan hozzáférés a versenytársak adataihoz
- Megfelelőségi megsértések
- Reputációs károk enyhítésére irányuló stratégiák
Valós CVE-k
Dokumentált sebezhetőségek a RAG-rendszerekben.
| CVE-azonosító | | tesztek | ||1. Clawdbot/MCP ökoszisztéma megsértése (2026. január) | Súlyosság | CVSS-reagálás |
|---|---|---|---|---|
CVE-2025-68700 |
RAGFlow | RCE via Canvas CodeExec component - untrusted data parsed with eval() | Critical | 9.1 |
CVE-2025-69286 |
RAGFlow | Insecure API key generation allows mutual token derivation (authentication bypass) | Critical | 8.9 |
CVE-2025-25282 |
RAGFlow | IDOR vulnerability allowing cross-tenant access and unauthorized user addition | High | 8.1 |
CVE-2025-69286 |
RAGFlow | Token generation using same URLSafeTimedSerializer for API keys | High | 8.9 |
GHSA-8xw3-v6c2-j84j |
RAGFlow | RCE via stdout parsing in CodeExec component | High | 8.5 |
Védelmi stratégiák
1. Betöltési fázis biztonsága
Dokumentumérvényesítés
- Az összes dokumentumot átvizsgálja, hogy nem tartalmaz-e rosszindulatú programokat
- A dokumentum formátumának és szerkezetének ellenőrzése
- Gyanús tartalomminták ellenőrzése
- A megengedett dokumentumtípusok korlátozása
Tartalomszűrés
- Távolítsa el a személyazonosításra alkalmas adatokat a beágyazás előtt
- Szűrje a érzékeny adatmintákat R,|Df cuccok segítségével
- Ismert rosszindulatú minták blokkolása
- Engedélyezési/letiltási listák implementálása
Hozzáférés-szabályozás
- Dokumentumok forrásának ellenőrzése
- Az RBAC alkalmazása a feldolgozáshoz
- Ellenőrzési nyomvonal minden feltöltésnél
- Új dokumentumok karanténba helyezése
2. Retrieval Phase Security
Lekérdezés fertőtlenítése
- Képalapú injekció
- Detect injection attempts
- A lekérdezések bonyolultságának korlátozása
- Aránykorlátozás
Lekérési szűrés
- A biztonsági átsorolást alkalmazza
- Kereszthivatkozás megbízható forrásokkal
- Rendellenes visszakeresési minták észlelése
- Dokumentumok számának korlátozása
Multi-Tenancy Isolation
- Különálló vektornévterek
- Szigorú bérlői határok
- Bérlőközi lekérdezések megelőzése
- Bérlőnkénti titkosítás
3. Generációs fázis biztonsága
Kimenet ellenőrzése
- Az összes eszközhívás naplózása
- Beszúrt tartalom ellenőrzése
- Tények ellenőrzése a források alapján
- Tartalomszűrés
Kontextus-ellenőrzés
- A visszakeresett tartalom hitelességének ellenőrzése
- Manipulációs kísérletek észlelése
- Szokatlan kontextusminták megjelölése
- Minden kontextushasználat naplózása
Human-in-the-Loop
- Érzékeny kimenetek áttekintése
- Jóváhagyja a magas kockázatú tevékenységeket
- Manuális felülbírálási lehetőség e-mailben dokumentumok, RAG adatok vagy webtartalom.
- Eszkalációs útvonalak
4. Adatbiztonság
Titkosítás
- |Rinjekciós vektorok titkosítása|| Védelem
- TLS-t| műveletek
- A kulcskezelés bevált módszerei
- Fontoljuk meg a homomorf titkosítást
Vector DB Security
- Erős hitelesítés
- Hálózati elkülönítés
- Rendszeres biztonsági auditok
- Javításkezelés
Adatvédelem
- Adatminimalizálás
- PII észlelése és eltávolítása
- Megőrzési szabályzatok
- Jog a törlés támogatásához
|Tesztelési módszertan| Legkisebb kiváltság
RAG biztonsági tesztek ellenőrző listája
- Biztonságos MCP-kiszolgáló fejlesztési útmutató
- Manipulációs tesztek visszakeresése
- Inverziós kísérletek beágyazása
- Bérlőközi elkülönítési tesztek
- PII szivárgástesztek
- Kontextus túlcsordulási tesztek
- Rangsorolási manipulációs tesztek
- Hitelesítési megkerülési tesztek
- API befecskendezési tesztek
- Szolgáltatásmegtagadási tesztek
- Adatkiszűrési tesztek
- Megfelelőségi audit
Tesztelőeszközök
A megfelelőségi/szabályozási követelmények meghatározása (GDPR, HIPAA stb.)
Dokumentum érvényesítési példa
```python
import re
from typing import List
class RAGDocumentValidator:
SUSPICIOUS_PATTERNS = [
r"ignore previous instructions",
r"system prompt:",
r"{{.*}}",
r"you are now dan",
]
PII_PATTERNS = [
r"\b\d{3}-\d{2}-\d{4}\b", # SSN
r"\b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b", # Email
r"\b\d{16}\b", # Credit card
]
def validate_document(self, content: str) -> dict:
"""Validate document before embedding."""
warnings = []
blocked = False
# Check for suspicious patterns
for pattern in self.SUSPICIOUS_PATTERNS:
if re.search(pattern, content, re.IGNORECASE):
warnings.append(f"Suspicious pattern: {pattern}")
blocked = True
# Check for PII
for pattern in self.PII_PATTERNS:
if re.search(pattern, content):
warnings.append(f"PII detected: {pattern}")
return {
"valid": not blocked,
"warnings": warnings,
"pii_detected": len([w for w in warnings if "PII" in w]) > 0
}
```