اختراق الذكاء الاصطناعي
موارد أمان الذكاء الاصطناعي

الفريق الأحمر للذكاء الاصطناعي: دليل المنهجية الكامل

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • وقت القراءة: ~ 15 دقيقة

ما هو فريق الذكاء الاصطناعي الأحمر؟

الفريق الأحمر للذكاء الاصطناعي هو الممارسة المتبعة of الهجمات المتعمدة والمنهجية على أنظمة الذكاء الاصطناعي to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

الحقن الفوري

Manipulating AI behavior through malicious inputs that override system instructions

كسر الحماية

تجاوز إجراءات السلامة لإنشاء محتوى محظور

استخراج البيانات

استخراج المعلومات الحساسة من بيانات التدريب أو المخرجات

التلاعب بالنموذج

تغيير سلوك النموذج من خلال هجمات التسمم أو الضبط الدقيق

لماذا يعتبر الفريق الأحمر للذكاء الاصطناعي مهمًا في عام 2026

  • 180% increase in LLM-related security incidents (2025)
  • قام فريق الذكاء الاصطناعي الأحمر التابع لشركة Microsoft بتقييم أكثر من 100 منتج من منتجات GenAI ووجدت أن العديد من حالات الفشل المؤثرة تأتي من تقنيات بسيطة
  • تتعامل أنظمة الذكاء الاصطناعي بشكل متزايد البيانات الحساسة والقرارات الحاسمة
  • تفويض المتطلبات التنظيمية (قانون الذكاء الاصطناعي في الاتحاد الأوروبي) اختبار أمان الذكاء الاصطناعي للأنظمة عالية الخطورة

بناء فريق أحمر للذكاء الاصطناعي

المهارات المطلوبة

المهارات الفنية

  • فهم بنية LLM
  • المعرفة الهندسية السريعة
  • أمان تطبيقات الويب
  • اختبار أمان واجهة برمجة التطبيقات (API)
  • البرمجة النصية (بايثون، باش)

مهارات الخصومة

  • الحل الإبداعي للمشكلات
  • الوعي بالهندسة الاجتماعية
  • التفكير الهجومي متعدد الوسائط
  • البحث والاستطلاع
  • الوثائق وإعداد التقارير

معرفة المجال

  • أفضل 10 OWASP LLM
  • إطار عمل MITRE ATLAS
  • أساسيات الذكاء الاصطناعي/تعلم الآلة
  • Ethics and responsible disclosure
  • المخاطر الخاصة بالصناعة

نماذج المشاركة

النموذج الوصف الايجابيات السلبيات
الفريق الداخلي فريق أحمر داخلي مخصص معرفة عميقة بالمنتج واختبار مستمر قد تفوت المنظور الخارجي
مستشار خارجي شركة أمان تابعة لجهة خارجية منظور جديد، مهارات متخصصة تكلفة أعلى، منحنى التعلم
مختلطة التعاون الداخلي والخارجي الأفضل في كلا العالمين التنسيق العام
آليًا اختبار CI/CD المتكامل مستمرة وقابلة للتطوير يقتصر على الأنماط المعروفة

المرحلة 1: الاستطلاع والاكتشاف

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 رسم خرائط النظام

  • مراجعة البنية: فهم كيفية تكامل الذكاء الاصطناعي مع الأنظمة الأخرى
  • تدفق البيانات: تعيين كيفية انتقال البيانات عبر النظام
  • نقاط نهاية واجهة برمجة التطبيقات: تحديد جميع الواجهات المكشوفة
  • عمليات تكامل الطرف الثالث: توثيق الخدمات الخارجية
  • أدوار المستخدم: فهم مستويات الوصول المختلفة

1.2 اختبار القدرة

  • النموذج القدرات: ماذا يمكن أن يفعل الذكاء الاصطناعي؟
  • الوصول إلى الأداة: ما هي الوظائف التي يمكن أن تستدعيها؟
  • الوصول إلى البيانات: ما هي المعلومات التي يمكنه استرجاعها؟
  • قنوات الإخراج: كيف يتم التواصل؟
  • إدارة الحالة: كيف يتعامل مع الجلسات؟

التقنيات الأساسية

  • استخراج موجه النظام: محاولة الكشف عن تعليمات النظام من خلال المطالبة الدقيقة
  • بصمة النموذج: تحديد النموذج الأساسي من خلال أنماط السلوك
  • اكتشاف واجهة برمجة التطبيقات: البحث عن نقاط النهاية المخفية أو غير الموثقة
  • مراجعة الوثائق: تحليل المستندات العامة للحصول على تفاصيل التنفيذ

المرحلة 2: رسم خرائط الثغرات الأمنية

Identify and categorize potential attack vectors based on the discovered attack surface.

تصنيف الهجوم

الحقن الفوري

  • الحقن المباشر
  • الحقن غير المباشر
  • المكونات المعرضة للخطر أو المعرضة للخطر في سلسلة توريد LLM بما في ذلك النماذج وواجهات برمجة التطبيقات والمكونات الإضافية وخدمات الجهات الخارجية.
  • تجاوز السياق

هجمات الهروب من السجن

  • لعب الأدوار (DAN)
  • انتحال شخصية الأحرف
  • تأطير التفويض
  • تجاوز التشفير

استخراج البيانات

  • استرداد بيانات التدريب
  • تسرب موجه النظام
  • الوصول إلى سجل المحادثات
  • التعرض لمفتاح واجهة برمجة التطبيقات

رفض الخدمة

  • استنفاد الموارد
  • تجاوز السياق
  • معالجة النماذج
  • تعليق/تعطل النظام

إساءة استخدام الأداة/الوظيفة

  • استدعاءات API غير المصرح بها
  • التلاعب بالمعلمات
  • تسلسل الوظائف
  • تصعيد الامتيازات

الهجمات متعددة الوسائط

  • الحقن المعتمد على الصور
  • التلاعب بالصوت
  • عمليات استغلال الوسائط المتعددة
  • المحتوى المضمن

الهجمات النموذجية

  • أمثلة عدائية
  • انعكاس النموذج
  • استدلال العضوية
  • استخراج النموذج

سلسلة التوريد

  • تسمم التبعية
  • حل وسط مركز النموذج
  • تسمم بيانات التدريب
  • مخاطر الطرف الثالث

المرحلة 3: الاستغلال

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

منهجية الاستغلال

  1. تعيين الأولوية: تصنيف الثغرات الأمنية حسب الخطورة وقابلية الاستغلال
  2. إثبات المفهوم: تطوير عمليات استغلال العمل لكل ثغرة أمنية
  3. تقييم التأثير: تحديد العواقب الواقعية للاستغلال الناجح
  4. التسلسل: اختبار ما إذا كان من الممكن دمج عدة ثغرات أمنية لتحقيق تأثير أكبر
  5. الوثائق: تسجيل جميع محاولات الاستغلال والنجاحات والإخفاقات

دروس Microsoft Red Team

استنادًا إلى اختبار أكثر من 100 منتج من منتجات GenAI، وجد فريق الذكاء الاصطناعي التابع لـ Microsoft:

  • عمل التقنيات البسيطة: تأتي العديد من حالات الفشل المؤثرة من مطالبات كسر الحماية الأساسية
  • التفكير على مستوى النظام مهم: غالبًا ما تمتد الثغرات الأمنية إلى مكونات متعددة
  • الإنسان الإبداع يفوز: تبحث الأدوات الآلية عن أنماط معروفة؛ يجد البشر هجمات جديدة
  • الاختبار المستمر ضروري: تقدم الميزات الجديدة أسطح هجوم جديدة

المرحلة 4: اختبار الثبات

Test whether attack effects persist beyond the initial interaction and can survive system resets.

استمرار الجلسة

  • هل يستمر التلاعب في تحديث الجلسة؟
  • هل يمكن تحميل الحالة مسبقًا في جلسات جديدة؟
  • هل هناك تأثيرات باقية من المطالبات السابقة؟

استمرارية النموذج

  • هل يمكن أن تؤثر الهجمات على تحديثات النماذج المستقبلية؟
  • هل يحافظ الضبط الدقيق على الثغرات الأمنية؟
  • هل الهجمات السامة دائمة؟

استمرار النظام

  • هل يمكن للثغرات الأمنية النجاة من التحديثات؟
  • هل توجد آليات خلفية؟
  • هل تستمر الهجمات عبر عمليات النشر؟

الغوص العميق في الأدوات

Garak

أداة فحص الثغرات الأمنية مفتوحة المصدر من NVIDIA LLM

  • مسبارات لما يزيد عن 40 نوعًا من الثغرات الأمنية
  • التقييم المستمر للنموذج
  • تحديثات منتظمة لقاعدة بيانات الثغرات الأمنية
  • التكامل مع خطوط أنابيب CI/CD
العرض على GitHub →

PyRIT

أداة تعريف مخاطر Python من Microsoft

  • إطار عمل الفريق الأحمر الشامل
  • دعم سطح الهجوم المتعدد
  • إنشاء الهجوم الآلي
  • تسجيل النتائج والتقييم
العرض على GitHub →

Promptfoo

منصة اختبار وتقييم LLM

  • إطار عمل الاختبار السريع
  • تقييم السلامة
  • قياس الأداء
  • مقارنة الإصدارات
عرض موقع الويب →

Rebuff

SDK للكشف الفوري عن الحقن

  • الكشف عن محاولات الحقن
  • الدفاع متعدد الطبقات
  • معدل إيجابي كاذب منخفض
  • التكامل السهل
العرض على GitHub →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

نقاط تكامل خط الأنابيب

1. الالتزام المسبق

  • التحقق من صحة المطالبة المحلية
  • الكشف عن الحقن المستند إلى النمط
  • اختبار محطة عمل المطور

2. طلب السحب

  • الفحص التلقائي للثغرات الأمنية
  • مقارنة خط الأساس
  • إنفاذ البوابة الأمنية

3. مرحلة ما قبل الإنتاج

  • تقييم الفريق الأحمر الكامل
  • اختبار الانحدار
  • قياس الأداء

4. الإنتاج

  • المراقبة المستمرة
  • الشذوذ الكشف
  • تكامل الاستجابة للحوادث

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

إطار تقييم الخطورة

الخطورة المعايير مثال
الحرج تنفيذ التعليمات البرمجية عن بعد، وخرق البيانات، وتسوية النظام الإدخال السريع الكامل الذي يؤدي إلى RCE
عالية الوصول غير المصرح به، والكشف عن البيانات الحساسة استخراج موجه النظام
متوسط تجاوز السياسة، الوصول المحدود للبيانات تجاوز مرشح المحتوى
منخفضة انتهاكات طفيفة للسياسة، إعلامية تنسيق الإخراج غير المقصود

طرق التقييم

LLM-as-Judge

استخدام الذكاء الاصطناعي لتقييم مخرجات الذكاء الاصطناعي للسلامة والامتثال للسياسة

التقييم البشري

مراجعة الخبراء للمخرجات لتقييم الأمان الدقيق

تسجيل النقاط تلقائيًا

مطابقة الأنماط والتقييم المستند إلى القواعد

مقاييس الفريق الأحمر

تتبع معدل نجاح الاستغلال، معدل إيجابي كاذب

هندسة المعالجة

طبقات الدفاع

1. تصفية الإدخال

  • الكشف السريع عن الأنماط
  • التعرف على التشفير
  • حدود الطول
  • تحديد المعدل

2. حواجز الحماية

  • التحقق من صحة المخرجات
  • تصفية المحتوى
  • سياسات استخدام الأداة
  • عناصر التحكم في الوصول

3. تصلب النموذج

  • الضبط الدقيق للسلامة
  • تحسينات RLHF
  • هندسة موجه النظام
  • ضبط درجة الحرارة/أعلى الصفحة

4. تصميم النظام

  • فصل الامتياز
  • الإنسان داخل الحلقة
  • التسجيل والمراقبة
  • الاستجابة للحوادث

اختبار التحقق من الصحة

بعد تنفيذ الإصلاحات، أعد الاختبار للتحقق من:

  • لم تعد الثغرات الأمنية الأصلية موجودة قابلة للاستغلال
  • الإصلاحات لا تقدم ثغرات أمنية جديدة
  • وظيفة النظام تظل سليمة
  • الأداء مقبول
  • يمكن التحكم في المعدلات الإيجابية الكاذبة

قالب التقارير

الملخص التنفيذي

  • النطاق والأهداف
  • نظرة عامة على النتائج الرئيسية
  • ملخص تصنيف المخاطر
  • التوصيات ذات الأولوية

التفاصيل الفنية

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • لقطات الشاشة والسجلات
  • مخططات سلسلة الهجوم
  • مقتطفات التعليمات البرمجية

التوصيات

  • إصلاحات قصيرة المدى (مكاسب سريعة)
  • تحسينات متوسطة المدى
  • التغييرات الهيكلية طويلة المدى
  • متطلبات الموارد
  • المخطط الزمني

الملاحق

  • مخرجات الأداة
  • حالات الاختبار المستخدمة
  • المراجع
  • مسرد

الاعتبارات الأخلاقية

التفويض

Always obtain explicit written permission before testing. Document scope boundaries.

حدود النطاق

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

المحتوى المخفي:

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

الإفصاح المسؤول

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

هل أنت جاهز لمعرفة المزيد؟

مواصلة استكشاف موضوعات أمان الذكاء الاصطناعي.

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.