एआई हैकिंग
एआई सुरक्षा संसाधन

एआई रेड टीमिंग: पूर्ण कार्यप्रणाली गाइड

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • पढ़ने का समय: ~15 मिनट

एआई रेड टीमिंग क्या है?

एआई रेड टीमिंग अभ्यास है of एआई सिस्टम पर जानबूझकर, व्यवस्थित हमले to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

प्रॉम्प्ट इंजेक्शन

Manipulating AI behavior through malicious inputs that override system instructions

जेलब्रेकिंग

निषिद्ध सामग्री उत्पन्न करने के लिए सुरक्षा उपायों को दरकिनार

डेटा निष्कर्षण

प्रशिक्षण डेटा या आउटपुट से संवेदनशील जानकारी निकालना

मॉडल हेरफेर

बदलना विषाक्तता या फाइन-ट्यूनिंग हमलों के माध्यम से मॉडल व्यवहार

2026 में एआई रेड टीमिंग क्यों मायने रखती है

  • 180% increase in LLM-related security incidents (2025)
  • माइक्रोसॉफ्ट की एआई रेड टीम ने मूल्यांकन किया है 100+ GenAI उत्पाद और पाया कि कई प्रभावशाली विफलताएं आती हैं सरल तकनीक
  • एआई सिस्टम तेजी से संभाल रहे हैं संवेदनशील डेटा और महत्वपूर्ण निर्णय
  • नियामक आवश्यकताएं (ईयू एआई अधिनियम) जनादेश सभी संचारों में एजेंट की पहचान प्रमाणित करें उच्च जोखिम वाली प्रणालियों के लिए

एआई रेड टीम का निर्माण

आवश्यक कौशल

तकनीकी कौशल

  • एलएलएम आर्किटेक्चर की समझ ||
  • त्वरित इंजीनियरिंग ज्ञान
  • वेब एप्लिकेशन सुरक्षा
  • एपीआई सुरक्षा परीक्षण
  • स्क्रिप्टिंग (पायथन, बैश)

प्रतिकूल कौशल

  • रचनात्मक समस्या-समाधान
  • सोशल इंजीनियरिंग जागरूकता
  • मल्टी-मोडल हमले की सोच
  • अनुसंधान और टोही
  • दस्तावेज़ीकरण और रिपोर्टिंग

मालिकों और समय सीमा के साथ विशिष्ट कार्य

  • ओडब्ल्यूएएसपी एलएलएम शीर्ष 10
  • एमआईटीआरई एटलस फ्रेमवर्क
  • एआई/एमएल बुनियादी सिद्धांत
  • नैतिकता और जिम्मेदार खुलासा
  • उद्योग-विशिष्ट जोखिम

एंगेजमेंट मॉडल्स

मॉडल विवरण पेशेवर विपक्ष
आंतरिक टीम समर्पित इन-हाउस रेड टीम गहन उत्पाद ज्ञान, निरंतर परीक्षण बाहरी परिप्रेक्ष्य छूट सकता है
बाहरी सलाहकार तृतीय-पक्ष सुरक्षा फर्म ताजा परिप्रेक्ष्य, विशेष कौशल उच्च लागत, सीखने की अवस्था
हाइब्रिड आंतरिक + बाहरी सहयोग दोनों दुनिया के सर्वश्रेष्ठ समन्वय ओवरहेड
स्वचालित सीआई / सीडी एकीकृत परीक्षण || निरंतर, स्केलेबल ज्ञात पैटर्न तक सीमित

चरण 1: टोही और खोज

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 सिस्टम मैपिंग

  • आर्किटेक्चर समीक्षा: समझें कि एआई अन्य प्रणालियों के साथ कैसे एकीकृत होता है
  • डेटा प्रवाह: मानचित्र कैसे सिस्टम के माध्यम से डेटा चलता है
  • एपीआई एंडपॉइंट्स: सभी उजागर इंटरफेस की पहचान करें
  • तृतीय-पक्ष एकीकरण: दस्तावेज़ बाहरी सेवाएँ
  • उपयोगकर्ता भूमिकाएं: विभिन्न एक्सेस स्तरों को समझें

1.2 क्षमता जांच

  • मॉडल क्षमताएं: एआई क्या कर सकता है?
  • टूल एक्सेस: यह किन कार्यों को लागू कर सकता है? डेटा.
  • डेटा एक्सेस: यह कौन सी जानकारी पुनः प्राप्त कर सकता है?
  • आउटपुट चैनल: यह कैसे संचार करता है?
  • राज्य प्रबंधन: यह सत्रों को कैसे संभालता है?

मुख्य तकनीकें

  • सिस्टम प्रॉम्प्ट निष्कर्षण: सावधानीपूर्वक संकेत के माध्यम से सिस्टम निर्देशों को प्रकट करने का प्रयास
  • मॉडल फ़िंगरप्रिंटिंग: व्यवहार पैटर्न के माध्यम से अंतर्निहित मॉडल की पहचान करें
  • एपीआई डिस्कवरी: छिपे हुए या गैर-दस्तावेजीकृत समापन बिंदु ढूंढें
  • दस्तावेज़ीकरण समीक्षा: कार्यान्वयन विवरण के लिए सार्वजनिक दस्तावेज़ों का विश्लेषण करें

चरण 2: भेद्यता मानचित्रण

Identify and categorize potential attack vectors based on the discovered attack surface.

टैक्सोनॉमी पर हमला

प्रॉम्प्ट इंजेक्शन

  • डायरेक्ट इंजेक्शन
  • अप्रत्यक्ष इंजेक्शन
  • अन्य किरायेदारों को प्रभावित करने वाली सामग्री को इंजेक्ट करता है
  • संदर्भ अतिप्रवाह

जेलब्रेक हमले

  • रोल-प्लेइंग (डीएएन)
  • कैरेक्टर प्रतिरूपण
  • प्राधिकरण फ़्रेमिंग
  • एनकोडिंग बाईपास

डेटा निष्कर्षण

  • प्रशिक्षण डेटा पुनर्प्राप्ति
  • सिस्टम त्वरित रिसाव
  • बातचीत इतिहास पहुंच
  • एपीआई कुंजी एक्सपोजर

सेवा से इनकार

  • संसाधन थकावट
  • संदर्भ अतिप्रवाह
  • मॉडल हेरफेर
  • सिस्टम हैंग/क्रैश

टूल/फ़ंक्शन दुरुपयोग

  • अनधिकृत एपीआई कॉल
  • पैरामीटर हेरफेर
  • फंक्शन चेनिंग||डोमेन ज्ञान
  • विशेषाधिकार वृद्धि

मल्टी-मोडल हमले

  • छवि-आधारित इंजेक्शन
  • ऑडियो हेरफेर
  • क्रॉस-मोडल शोषण
  • एम्बेडेड सामग्री

मॉडल अटैक

  • प्रतिकूल उदाहरण
  • मॉडल व्युत्क्रम
  • सदस्यता अनुमान
  • मॉडल निष्कर्षण

आपूर्ति श्रृंखला

  • निर्भरता विषाक्तता
  • मॉडल हब समझौता
  • प्रशिक्षण डेटा विषाक्तता
  • तृतीय-पक्ष जोखिम

चरण 3: शोषण

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

शोषण पद्धति

  1. प्राथमिकता असाइनमेंट: गंभीरता और शोषण के आधार पर कमजोरियों को रैंक करें
  2. अवधारणा का प्रमाण: प्रत्येक भेद्यता के लिए कार्यशील कारनामे विकसित करें
  3. प्रभाव आकलन: सफल शोषण के वास्तविक दुनिया के परिणामों को निर्धारित करें
  4. श्रृंखला: परीक्षण करें कि क्या अधिक प्रभाव के लिए कई कमजोरियों को जोड़ा जा सकता है
  5. एनआईएसटी एआई जोखिम प्रबंधन शोषण के सभी प्रयासों, सफलताओं और असफलताओं को रिकॉर्ड करें

माइक्रोसॉफ्ट रेड टीम पाठ

100+ GenAI उत्पादों के परीक्षण के आधार पर, Microsoft की AI रेड टीम ने पाया:

  • सरल तकनीक कार्य: कई प्रभावशाली विफलताएं बुनियादी जेलब्रेक संकेतों से आती हैं
  • सिस्टम-स्तरीय सोच मायने रखती है: कमजोरियाँ अक्सर कई घटकों में फैली होती हैं
  • मानव रचनात्मकता जीतती है: स्वचालित उपकरण ज्ञात पैटर्न ढूंढते हैं; मनुष्य नए हमले ढूंढते हैं
  • निरंतर परीक्षण आवश्यक है: नई सुविधाएँ नए हमले की सतहों का परिचय देती हैं

चरण 4: दृढ़ता परीक्षण

Test whether attack effects persist beyond the initial interaction and can survive system resets.

सत्र दृढ़ता

  • क्या हेरफेर सत्र ताज़ा होने से बचता है?
  • क्या राज्य को नए सत्रों में पहले से लोड किया जा सकता है?
  • क्या पिछले संकेतों से लंबे समय तक चलने वाले प्रभाव हैं?

मॉडल दृढ़ता

  • क्या हमले भविष्य के मॉडल अपडेट को प्रभावित कर सकते हैं?
  • क्या फाइन-ट्यूनिंग कमजोरियों को संरक्षित करती है?
  • क्या जहर के हमले स्थायी हैं?

सिस्टम दृढ़ता

  • क्या कमजोरियां अपडेट से बच सकती हैं?
  • क्या पिछले दरवाजे तंत्र हैं?
  • क्या तैनाती भर में हमले जारी रहते हैं?

टूलिंग डीप डाइव

Garak

NVIDIA का ओपन-सोर्स एलएलएम भेद्यता स्कैनर

  • 40+ भेद्यता प्रकारों की जांच
  • सतत मॉडल मूल्यांकन
  • नियमित भेद्यता डेटाबेस अपडेट
  • सीआई/सीडी पाइपलाइनों के साथ एकीकरण
GitHub पर देखें →

PyRIT

माइक्रोसॉफ्ट का पायथन जोखिम पहचान उपकरण

  • व्यापक रेड टीम फ्रेमवर्क
  • मल्टीपल अटैक सरफेस सपोर्ट
  • स्वचालित आक्रमण पीढ़ी
  • स्कोरिंग और मूल्यांकन
GitHub पर देखें →

Promptfoo

एलएलएम परीक्षण और मूल्यांकन मंच

  • त्वरित परीक्षण ढांचा
  • सुरक्षा मूल्यांकन
  • प्रदर्शन बेंचमार्किंग
  • संस्करण तुलना
वेबसाइट देखें →

Rebuff

शीघ्र इंजेक्शन पहचान एसडीके

  • इंजेक्शन के प्रयासों का पता लगाना ||
  • मल्टी-लेयर रक्षा
  • कम झूठी सकारात्मक दर
  • आसान एकीकरण
GitHub पर देखें →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

पाइपलाइन एकीकरण बिंदु

1. प्री-कमिट

  • स्थानीय त्वरित सत्यापन
  • पैटर्न-आधारित इंजेक्शन पहचान
  • डेवलपर वर्कस्टेशन परीक्षण

2. पुल अनुरोध

  • स्वचालित भेद्यता स्कैनिंग
  • बेसलाइन तुलना
  • सुरक्षा गेट प्रवर्तन

3. प्री-प्रोडक्शन

  • सीवीई
  • रिग्रेशन परीक्षण
  • प्रदर्शन बेंचमार्किंग

4. उत्पादन

  • निरंतर निगरानी
  • विसंगति का पता लगाना
  • घटना प्रतिक्रिया एकीकरण

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

गंभीरता रेटिंग फ्रेमवर्क

गंभीरता मानदंड उदाहरण
महत्वपूर्ण रिमोट कोड निष्पादन, डेटा उल्लंघन, सिस्टम समझौता आरसीई की ओर ले जाने वाला पूर्ण त्वरित इंजेक्शन
उच्च अनधिकृत पहुंच, संवेदनशील डेटा एक्सपोजर System prompt extraction
मध्यम पॉलिसी बाईपास, सीमित डेटा पहुंच सामग्री फ़िल्टर बाईपास
कम मामूली नीति उल्लंघन, सूचनात्मक अनपेक्षित आउटपुट प्रारूप

रिपोर्टिंग टेम्पलेट

एलएलएम-ए-जज

सुरक्षा और नीति अनुपालन के लिए एआई आउटपुट का मूल्यांकन करने के लिए एआई का उपयोग करें

मानव मूल्यांकन

बारीक सुरक्षा मूल्यांकन के लिए आउटपुट की विशेषज्ञ समीक्षा

स्वचालित स्कोरिंग

पैटर्न मिलान और नियम-आधारित मूल्यांकन

रेड टीम मेट्रिक्स

ट्रैक शोषण सफलता दर, झूठी सकारात्मक दर

उपचार वास्तुकला

रक्षा परतें

1. इनपुट फ़िल्टरिंग

  • शीघ्र पैटर्न का पता लगाना
  • एनकोडिंग पहचान
  • लंबाई सीमा
  • दर सीमित करना

2. गार्डरेल

  • सभी अनुरोधों को अनुमति देने में विफल सत्यापन
  • सामग्री फ़िल्टरिंग
  • उपकरण उपयोग नीतियां
  • पहुंच नियंत्रण

3. मॉडल हार्डनिंग

  • सुरक्षा के लिए फाइन-ट्यूनिंग
  • अनुपालन नोट्स:
  • सिस्टम प्रॉम्प्ट इंजीनियरिंग
  • तापमान/टॉप-पी ट्यूनिंग

4. सिस्टम डिज़ाइन

  • विशेषाधिकार पृथक्करण
  • ह्यूमन-इन-द-लूप
  • लॉगिंग और निगरानी
  • घटना प्रतिक्रिया

सत्यापन परीक्षण

फिक्स लागू करने के बाद, सत्यापित करने के लिए पुन: परीक्षण करें:

  • मूल कमजोरियां अब शोषण योग्य नहीं हैं
  • फिक्स नई कमजोरियों का परिचय नहीं देते
  • सिस्टम कार्यक्षमता बरकरार है
  • प्रदर्शन स्वीकार्य है
  • गलत सकारात्मक दरें प्रबंधनीय हैं

रिपोर्टिंग टेम्पलेट

कार्यकारी सारांश

  • स्कोप और उद्देश्य
  • मुख्य निष्कर्षों का अवलोकन
  • जोखिम रेटिंग सारांश
  • प्राथमिकता सिफारिशें

तकनीकी विवरण

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • स्क्रीनशॉट और लॉग
  • आक्रमण श्रृंखला आरेख
  • कोड स्निपेट्स

सिफारिशें

  • अल्पकालिक सुधार (त्वरित जीत)
  • मध्यम अवधि के सुधार
  • दीर्घकालिक वास्तुशिल्प परिवर्तन
  • संसाधन आवश्यकताएं
  • समयरेखा

परिशिष्ट

  • टूल आउटपुट
  • प्रयुक्त परीक्षण मामले
  • संदर्भ
  • शब्दावली

नैतिक विचार

प्राधिकरण

Always obtain explicit written permission before testing. Document scope boundaries.

स्कोप सीमाएं

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

डेटा हैंडलिंग

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

जिम्मेदार प्रकटीकरण

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

अधिक जानने के लिए तैयार हैं?

एआई सुरक्षा विषयों की खोज जारी रखें। सभी दावों में उद्धरण शामिल हैं।

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.