एआई रेड टीमिंग: पूर्ण कार्यप्रणाली गाइड
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • पढ़ने का समय: ~15 मिनट
एआई रेड टीमिंग क्या है?
एआई रेड टीमिंग अभ्यास है of एआई सिस्टम पर जानबूझकर, व्यवस्थित हमले to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
प्रॉम्प्ट इंजेक्शन
Manipulating AI behavior through malicious inputs that override system instructions
जेलब्रेकिंग
निषिद्ध सामग्री उत्पन्न करने के लिए सुरक्षा उपायों को दरकिनार
डेटा निष्कर्षण
प्रशिक्षण डेटा या आउटपुट से संवेदनशील जानकारी निकालना
मॉडल हेरफेर
बदलना विषाक्तता या फाइन-ट्यूनिंग हमलों के माध्यम से मॉडल व्यवहार
2026 में एआई रेड टीमिंग क्यों मायने रखती है
- 180% increase in LLM-related security incidents (2025)
- माइक्रोसॉफ्ट की एआई रेड टीम ने मूल्यांकन किया है 100+ GenAI उत्पाद और पाया कि कई प्रभावशाली विफलताएं आती हैं सरल तकनीक
- एआई सिस्टम तेजी से संभाल रहे हैं संवेदनशील डेटा और महत्वपूर्ण निर्णय
- नियामक आवश्यकताएं (ईयू एआई अधिनियम) जनादेश सभी संचारों में एजेंट की पहचान प्रमाणित करें उच्च जोखिम वाली प्रणालियों के लिए
एआई रेड टीम का निर्माण
आवश्यक कौशल
तकनीकी कौशल
- एलएलएम आर्किटेक्चर की समझ ||
- त्वरित इंजीनियरिंग ज्ञान
- वेब एप्लिकेशन सुरक्षा
- एपीआई सुरक्षा परीक्षण
- स्क्रिप्टिंग (पायथन, बैश)
प्रतिकूल कौशल
- रचनात्मक समस्या-समाधान
- सोशल इंजीनियरिंग जागरूकता
- मल्टी-मोडल हमले की सोच
- अनुसंधान और टोही
- दस्तावेज़ीकरण और रिपोर्टिंग
मालिकों और समय सीमा के साथ विशिष्ट कार्य
- ओडब्ल्यूएएसपी एलएलएम शीर्ष 10
- एमआईटीआरई एटलस फ्रेमवर्क
- एआई/एमएल बुनियादी सिद्धांत
- नैतिकता और जिम्मेदार खुलासा
- उद्योग-विशिष्ट जोखिम
एंगेजमेंट मॉडल्स
| मॉडल | विवरण | पेशेवर | विपक्ष |
|---|---|---|---|
| आंतरिक टीम | समर्पित इन-हाउस रेड टीम | गहन उत्पाद ज्ञान, निरंतर परीक्षण | बाहरी परिप्रेक्ष्य छूट सकता है |
| बाहरी सलाहकार | तृतीय-पक्ष सुरक्षा फर्म | ताजा परिप्रेक्ष्य, विशेष कौशल | उच्च लागत, सीखने की अवस्था |
| हाइब्रिड | आंतरिक + बाहरी सहयोग | दोनों दुनिया के सर्वश्रेष्ठ | समन्वय ओवरहेड |
| स्वचालित | सीआई / सीडी एकीकृत परीक्षण || | निरंतर, स्केलेबल | ज्ञात पैटर्न तक सीमित |
चरण 1: टोही और खोज
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 सिस्टम मैपिंग
- आर्किटेक्चर समीक्षा: समझें कि एआई अन्य प्रणालियों के साथ कैसे एकीकृत होता है
- डेटा प्रवाह: मानचित्र कैसे सिस्टम के माध्यम से डेटा चलता है
- एपीआई एंडपॉइंट्स: सभी उजागर इंटरफेस की पहचान करें
- तृतीय-पक्ष एकीकरण: दस्तावेज़ बाहरी सेवाएँ
- उपयोगकर्ता भूमिकाएं: विभिन्न एक्सेस स्तरों को समझें
1.2 क्षमता जांच
- मॉडल क्षमताएं: एआई क्या कर सकता है?
- टूल एक्सेस: यह किन कार्यों को लागू कर सकता है? डेटा.
- डेटा एक्सेस: यह कौन सी जानकारी पुनः प्राप्त कर सकता है?
- आउटपुट चैनल: यह कैसे संचार करता है?
- राज्य प्रबंधन: यह सत्रों को कैसे संभालता है?
मुख्य तकनीकें
- सिस्टम प्रॉम्प्ट निष्कर्षण: सावधानीपूर्वक संकेत के माध्यम से सिस्टम निर्देशों को प्रकट करने का प्रयास
- मॉडल फ़िंगरप्रिंटिंग: व्यवहार पैटर्न के माध्यम से अंतर्निहित मॉडल की पहचान करें
- एपीआई डिस्कवरी: छिपे हुए या गैर-दस्तावेजीकृत समापन बिंदु ढूंढें
- दस्तावेज़ीकरण समीक्षा: कार्यान्वयन विवरण के लिए सार्वजनिक दस्तावेज़ों का विश्लेषण करें
चरण 2: भेद्यता मानचित्रण
Identify and categorize potential attack vectors based on the discovered attack surface.
टैक्सोनॉमी पर हमला
प्रॉम्प्ट इंजेक्शन
- डायरेक्ट इंजेक्शन
- अप्रत्यक्ष इंजेक्शन
- अन्य किरायेदारों को प्रभावित करने वाली सामग्री को इंजेक्ट करता है
- संदर्भ अतिप्रवाह
जेलब्रेक हमले
- रोल-प्लेइंग (डीएएन)
- कैरेक्टर प्रतिरूपण
- प्राधिकरण फ़्रेमिंग
- एनकोडिंग बाईपास
डेटा निष्कर्षण
- प्रशिक्षण डेटा पुनर्प्राप्ति
- सिस्टम त्वरित रिसाव
- बातचीत इतिहास पहुंच
- एपीआई कुंजी एक्सपोजर
सेवा से इनकार
- संसाधन थकावट
- संदर्भ अतिप्रवाह
- मॉडल हेरफेर
- सिस्टम हैंग/क्रैश
टूल/फ़ंक्शन दुरुपयोग
- अनधिकृत एपीआई कॉल
- पैरामीटर हेरफेर
- फंक्शन चेनिंग||डोमेन ज्ञान
- विशेषाधिकार वृद्धि
मल्टी-मोडल हमले
- छवि-आधारित इंजेक्शन
- ऑडियो हेरफेर
- क्रॉस-मोडल शोषण
- एम्बेडेड सामग्री
मॉडल अटैक
- प्रतिकूल उदाहरण
- मॉडल व्युत्क्रम
- सदस्यता अनुमान
- मॉडल निष्कर्षण
आपूर्ति श्रृंखला
- निर्भरता विषाक्तता
- मॉडल हब समझौता
- प्रशिक्षण डेटा विषाक्तता
- तृतीय-पक्ष जोखिम
चरण 3: शोषण
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
शोषण पद्धति
- प्राथमिकता असाइनमेंट: गंभीरता और शोषण के आधार पर कमजोरियों को रैंक करें
- अवधारणा का प्रमाण: प्रत्येक भेद्यता के लिए कार्यशील कारनामे विकसित करें
- प्रभाव आकलन: सफल शोषण के वास्तविक दुनिया के परिणामों को निर्धारित करें
- श्रृंखला: परीक्षण करें कि क्या अधिक प्रभाव के लिए कई कमजोरियों को जोड़ा जा सकता है
- एनआईएसटी एआई जोखिम प्रबंधन शोषण के सभी प्रयासों, सफलताओं और असफलताओं को रिकॉर्ड करें
माइक्रोसॉफ्ट रेड टीम पाठ
100+ GenAI उत्पादों के परीक्षण के आधार पर, Microsoft की AI रेड टीम ने पाया:
- सरल तकनीक कार्य: कई प्रभावशाली विफलताएं बुनियादी जेलब्रेक संकेतों से आती हैं
- सिस्टम-स्तरीय सोच मायने रखती है: कमजोरियाँ अक्सर कई घटकों में फैली होती हैं
- मानव रचनात्मकता जीतती है: स्वचालित उपकरण ज्ञात पैटर्न ढूंढते हैं; मनुष्य नए हमले ढूंढते हैं
- निरंतर परीक्षण आवश्यक है: नई सुविधाएँ नए हमले की सतहों का परिचय देती हैं
चरण 4: दृढ़ता परीक्षण
Test whether attack effects persist beyond the initial interaction and can survive system resets.
सत्र दृढ़ता
- क्या हेरफेर सत्र ताज़ा होने से बचता है?
- क्या राज्य को नए सत्रों में पहले से लोड किया जा सकता है?
- क्या पिछले संकेतों से लंबे समय तक चलने वाले प्रभाव हैं?
मॉडल दृढ़ता
- क्या हमले भविष्य के मॉडल अपडेट को प्रभावित कर सकते हैं?
- क्या फाइन-ट्यूनिंग कमजोरियों को संरक्षित करती है?
- क्या जहर के हमले स्थायी हैं?
सिस्टम दृढ़ता
- क्या कमजोरियां अपडेट से बच सकती हैं?
- क्या पिछले दरवाजे तंत्र हैं?
- क्या तैनाती भर में हमले जारी रहते हैं?
टूलिंग डीप डाइव
Garak
NVIDIA का ओपन-सोर्स एलएलएम भेद्यता स्कैनर
- 40+ भेद्यता प्रकारों की जांच
- सतत मॉडल मूल्यांकन
- नियमित भेद्यता डेटाबेस अपडेट
- सीआई/सीडी पाइपलाइनों के साथ एकीकरण
PyRIT
माइक्रोसॉफ्ट का पायथन जोखिम पहचान उपकरण
- व्यापक रेड टीम फ्रेमवर्क
- मल्टीपल अटैक सरफेस सपोर्ट
- स्वचालित आक्रमण पीढ़ी
- स्कोरिंग और मूल्यांकन
Promptfoo
एलएलएम परीक्षण और मूल्यांकन मंच
- त्वरित परीक्षण ढांचा
- सुरक्षा मूल्यांकन
- प्रदर्शन बेंचमार्किंग
- संस्करण तुलना
Rebuff
शीघ्र इंजेक्शन पहचान एसडीके
- इंजेक्शन के प्रयासों का पता लगाना ||
- मल्टी-लेयर रक्षा
- कम झूठी सकारात्मक दर
- आसान एकीकरण
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
पाइपलाइन एकीकरण बिंदु
1. प्री-कमिट
- स्थानीय त्वरित सत्यापन
- पैटर्न-आधारित इंजेक्शन पहचान
- डेवलपर वर्कस्टेशन परीक्षण
2. पुल अनुरोध
- स्वचालित भेद्यता स्कैनिंग
- बेसलाइन तुलना
- सुरक्षा गेट प्रवर्तन
3. प्री-प्रोडक्शन
- सीवीई
- रिग्रेशन परीक्षण
- प्रदर्शन बेंचमार्किंग
4. उत्पादन
- निरंतर निगरानी
- विसंगति का पता लगाना
- घटना प्रतिक्रिया एकीकरण
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
गंभीरता रेटिंग फ्रेमवर्क
| गंभीरता | मानदंड | उदाहरण |
|---|---|---|
| महत्वपूर्ण | रिमोट कोड निष्पादन, डेटा उल्लंघन, सिस्टम समझौता | आरसीई की ओर ले जाने वाला पूर्ण त्वरित इंजेक्शन |
| उच्च | अनधिकृत पहुंच, संवेदनशील डेटा एक्सपोजर | System prompt extraction |
| मध्यम | पॉलिसी बाईपास, सीमित डेटा पहुंच | सामग्री फ़िल्टर बाईपास |
| कम | मामूली नीति उल्लंघन, सूचनात्मक | अनपेक्षित आउटपुट प्रारूप |
रिपोर्टिंग टेम्पलेट
एलएलएम-ए-जज
सुरक्षा और नीति अनुपालन के लिए एआई आउटपुट का मूल्यांकन करने के लिए एआई का उपयोग करें
मानव मूल्यांकन
बारीक सुरक्षा मूल्यांकन के लिए आउटपुट की विशेषज्ञ समीक्षा
स्वचालित स्कोरिंग
पैटर्न मिलान और नियम-आधारित मूल्यांकन
रेड टीम मेट्रिक्स
ट्रैक शोषण सफलता दर, झूठी सकारात्मक दर
उपचार वास्तुकला
रक्षा परतें
1. इनपुट फ़िल्टरिंग
- शीघ्र पैटर्न का पता लगाना
- एनकोडिंग पहचान
- लंबाई सीमा
- दर सीमित करना
2. गार्डरेल
- सभी अनुरोधों को अनुमति देने में विफल सत्यापन
- सामग्री फ़िल्टरिंग
- उपकरण उपयोग नीतियां
- पहुंच नियंत्रण
3. मॉडल हार्डनिंग
- सुरक्षा के लिए फाइन-ट्यूनिंग
- अनुपालन नोट्स:
- सिस्टम प्रॉम्प्ट इंजीनियरिंग
- तापमान/टॉप-पी ट्यूनिंग
4. सिस्टम डिज़ाइन
- विशेषाधिकार पृथक्करण
- ह्यूमन-इन-द-लूप
- लॉगिंग और निगरानी
- घटना प्रतिक्रिया
सत्यापन परीक्षण
फिक्स लागू करने के बाद, सत्यापित करने के लिए पुन: परीक्षण करें:
- मूल कमजोरियां अब शोषण योग्य नहीं हैं
- फिक्स नई कमजोरियों का परिचय नहीं देते
- सिस्टम कार्यक्षमता बरकरार है
- प्रदर्शन स्वीकार्य है
- गलत सकारात्मक दरें प्रबंधनीय हैं
रिपोर्टिंग टेम्पलेट
कार्यकारी सारांश
- स्कोप और उद्देश्य
- मुख्य निष्कर्षों का अवलोकन
- जोखिम रेटिंग सारांश
- प्राथमिकता सिफारिशें
तकनीकी विवरण
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- स्क्रीनशॉट और लॉग
- आक्रमण श्रृंखला आरेख
- कोड स्निपेट्स
सिफारिशें
- अल्पकालिक सुधार (त्वरित जीत)
- मध्यम अवधि के सुधार
- दीर्घकालिक वास्तुशिल्प परिवर्तन
- संसाधन आवश्यकताएं
- समयरेखा
परिशिष्ट
- टूल आउटपुट
- प्रयुक्त परीक्षण मामले
- संदर्भ
- शब्दावली
नैतिक विचार
प्राधिकरण
Always obtain explicit written permission before testing. Document scope boundaries.
स्कोप सीमाएं
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
डेटा हैंडलिंग
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
जिम्मेदार प्रकटीकरण
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
संबंधित संसाधन
अधिक जानने के लिए तैयार हैं?
एआई सुरक्षा विषयों की खोज जारी रखें। सभी दावों में उद्धरण शामिल हैं।