Yapay Zeka Hacking
AI Güvenlik Kaynakları

AI Kırmızı Ekip Oluşturma: Tam Metodoloji Kılavuzu

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • Okuma süresi: ~15 dakika

AI Kırmızı Takım Oluşturma nedir?

Yapay zeka kırmızı ekip uygulaması pratiktir Yapay zeka sistemlerine kasıtlı, sistematik saldırılar to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

Prompt Injection

Manipulating AI behavior through malicious inputs that override system instructions

Jailbreaking

Yasaklı içerik oluşturmak için güvenlik önlemlerini atlamak

Veri Çıkarma

Eğitim verilerinden veya çıktılardan hassas bilgileri çıkarma

Model Değiştirme

Model davranışını zehirleme veya ince ayar saldırıları yoluyla değiştirme

Yapay Zeka Kırmızı Takım Oluşturma 2026'da Neden Önemlidir

  • 180% increase in LLM-related security incidents (2025)
  • Microsoft'un Yapay Zeka Kırmızı Ekibi değerlendirdi 100'den fazla Nesil AI ürünü ve birçok etkili başarısızlığın basit teknikler
  • Yapay zeka sistemleri giderek daha fazla ele alıyor hassas veriler ve kritik kararlar
  • Düzenleyici gereklilikler (AB Yapay Zeka Yasası) zorunluluğu Yapay zeka güvenlik testi yüksek riskli sistemler için

Bir Yapay Zeka Kırmızı Takımı Oluşturma

Gerekli Beceriler

Teknik Beceriler

  • Yüksek Lisans mimarisini anlama
  • Hızlı mühendislik bilgisi
  • Web uygulaması güvenliği
  • API güvenlik testi
  • Komut dosyası oluşturma (Python, bash)

Çelişmeli Beceriler

  • Yaratıcı sorun çözme
  • Sosyal mühendislik farkındalığı
  • Çok modlu saldırı düşüncesi
  • Araştırma ve keşif
  • Belgeleme ve raporlama

Alan Bilgisi

  • OWASP LLM İlk 10
  • MITRE ATLAS çerçevesi
  • AI/ML temelleri
  • Etik ve sorumluluk ifşa
  • Sektöre özgü riskler

Engagement Models

Model Açıklama Artıları Eksileri
Dahili Ekip Şirket içi özel kırmızı ekip Derin ürün bilgisi, sürekli testler Harici bakış açısını kaçırabilir
Harici Danışman Üçüncü taraf güvenlik firması Yeni bakış açısı, özel beceriler Daha yüksek maliyet, öğrenme eğrisi
Karma Dahili + harici işbirliği Her iki dünyanın da en iyisi Koordinasyon yükü
Otomatik CI/CD entegre testi Sürekli, ölçeklenebilir Bilinen kalıplarla sınırlıdır

Aşama 1: Keşif ve Keşif

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 Sistem Haritalama

  • Mimari incelemesi: Yapay zekanın diğer sistemlerle nasıl entegre olduğunu anlayın
  • Veri akışı: Verilerin sistem içinde nasıl hareket ettiğini haritalayın
  • API uç noktaları: Açıkta kalan tüm arayüzleri tanımlama
  • Üçüncü taraf entegrasyonları: Harici hizmetleri belgeleyin
  • Kullanıcı rolleri: Farklı erişim düzeylerini anlayın

1.2 Yetenek Araştırması

  • Model yetenekleri: Yapay zeka ne yapabilir?
  • Araç erişimi: Hangi işlevleri çağırabilir?
  • Veri erişimi: Hangi bilgileri alabilir?
  • Çıkış kanalları: Nasıl iletişim kurar?
  • Devlet yönetimi: Oturumları nasıl yönetir?

Anahtar Teknikler

  • Sistem İstemi Çıkarma: Dikkatli yönlendirmeler yoluyla sistem talimatlarını ortaya çıkarmaya çalışın
  • Model Parmak İzi: Davranış kalıpları aracılığıyla temel modeli tanımlama
  • API Keşfi: Gizli veya belgelenmemiş uç noktaları bulun
  • Belge İncelemesi: Uygulama ayrıntıları için genel belgeleri analiz edin

Aşama 2: Güvenlik Açığı Haritalaması

Identify and categorize potential attack vectors based on the discovered attack surface.

Saldırı Taksonomisi

Prompt Injection

  • Doğrudan enjeksiyon
  • Dolaylı enjeksiyon
  • Çok turlu manipülasyon
  • Bağlam taşması

Jailbreak Saldırıları

  • Rol oynama (DAN)
  • Karakter kimliğine bürünme
  • Yetkilendirme çerçevesi
  • Kodlamayı atlama

Veri Çıkarma

  • Eğitim veri kurtarma
  • Sistem istemi sızıntısı
  • Konuşma geçmişine erişim
  • API anahtarına maruz kalma

Hizmet Reddi

  • Kaynak tükenmesi
  • Bağlam taşması
  • Model manipülasyonu
  • Sistem kilitlenmesi/çökmesi

Araç/İşlev Kötüye Kullanma

  • Yetkisiz API çağrıları
  • Parametre manipülasyonu
  • İşlev zinciri
  • Ayrıcalık artışı

Çok Modlu Saldırılar

  • Resim tabanlı enjeksiyon
  • Ses manipülasyonu
  • Çapraz modlu istismarlar
  • Gömülü içerik

Model Saldırıları

  • Karşıt örnekler
  • Modeli tersine çevirme
  • Üyelik çıkarımı
  • Model çıkarma

Tedarik Zinciri

  • Bağımlılık zehirlenmesi
  • Model merkezi güvenliği
  • Eğitim verileri zehirlenmesi
  • Üçüncü taraf riskleri

Aşama 3: Suistimal

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

Sömürme Metodolojisi

  1. Öncelik Ataması: Güvenlik açıklarını ciddiyet ve istismar edilebilirliğe göre sıralayın
  2. Kavram Kanıtı: Her güvenlik açığı için çalışan açıklardan yararlanın
  3. Etki Değerlendirmesi: Başarılı istismarın gerçek dünyadaki sonuçlarını belirleyin
  4. Zincirleme: Daha fazla etki için birden fazla güvenlik açığının birleştirilip birleştirilemeyeceğini test edin
  5. Belgeler: Tüm yararlanma girişimlerini, başarılarını ve başarısızlıklarını kaydedin

Microsoft Red Team Dersleri

Microsoft'un AI Kırmızı Ekibi, 100'den fazla GenAI ürününün testine dayanarak şunu buldu:

  • Basit teknikler işe yarar: Birçok etkili hata, temel jailbreak istemlerinden kaynaklanıyor
  • Sistem düzeyinde düşünme önemlidir: Güvenlik açıkları genellikle birden fazla bileşeni kapsar
  • İnsan yaratıcılığı kazanır: Otomatik araçlar bilinen kalıpları bulur; insanlar yeni saldırılar buluyor
  • Sürekli test önemlidir: Yeni özellikler, yeni saldırı yüzeylerini tanıtıyor

Aşama 4: Kalıcılık Testi

Test whether attack effects persist beyond the initial interaction and can survive system resets.

Oturum Kalıcılığı

  • Manipülasyon oturum yenilemeden sağ çıkabilir mi?
  • Durum yeni oturumlara önceden yüklenebilir mi?
  • Önceki istemlerin kalıcı etkileri var mı?

Model Kalıcılığı

  • Saldırılar gelecekteki model güncellemelerini etkileyebilir mi?
  • İnce ayar güvenlik açıklarını korur mu?
  • Zehir saldırıları kalıcı mıdır?

Sistem Kalıcılığı

  • Güvenlik açıkları güncellemelerden kurtulabilir mi?
  • Arka kapı mekanizmaları var mı?
  • Dağıtımlar genelinde saldırılar devam ediyor mu?

Araç Derinlemesine İnceleme

Garak

NVIDIA'nın açık kaynaklı Yüksek Lisans güvenlik açığı tarayıcısı

  • 40'tan fazla güvenlik açığı türünü araştırıyor
  • Sürekli model değerlendirmesi
  • Düzenli güvenlik açığı veritabanı güncellemeleri
  • CI/CD ardışık düzenleriyle entegrasyon
GitHub'da Görüntüle →

PyRIT

Microsoft'un Python Risk Tanımlama Aracı

  • Kapsamlı kırmızı ekip çerçevesi
  • Çoklu saldırı yüzeyi desteği
  • Otomatik saldırı oluşturma
  • Puanlama ve değerlendirme
GitHub'da Görüntüle →

Promptfoo

LLM test ve değerlendirme platformu

  • Hızlı test çerçevesi
  • Güvenlik değerlendirmesi
  • Performans karşılaştırması
  • Sürüm karşılaştırması
Web Sitesini Görüntüleyin →

Rebuff

Hızlı enjeksiyon algılama SDK'sı

  • Enjeksiyon girişimlerinin tespiti
  • Çok katmanlı savunma
  • Düşük hatalı pozitif oranı
  • Kolay entegrasyon
GitHub'da Görüntüle →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

Boru Hattı Entegrasyon Noktaları

1. Ön Taahhüt

  • Yerel istem doğrulama
  • Desen tabanlı enjeksiyon tespiti
  • Geliştirici iş istasyonu testi

2. Çekme İsteği

  • Otomatik güvenlik açığı taraması
  • Temel karşılaştırma
  • Güvenlik kapısı uygulaması

3. Üretim Öncesi

  • Tam kırmızı takım değerlendirmesi
  • Regresyon testi
  • Performans karşılaştırması

4. Üretim

  • Sürekli izleme
  • Anormallik tespiti
  • Olay yanıt entegrasyonu

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

Önem Derecelendirme Çerçevesi

Önem Düzeyi Kriter Örnek
Kritik Uzaktan kod yürütme, veri ihlali, sistem güvenliği RCE'ye yol açan tam istem enjeksiyonu
Yüksek Yetkisiz erişim, hassas verilerin açığa çıkması Sistem istemi çıkarma
Orta Politika atlama, sınırlı veri erişimi İçerik filtresini atlayın
Düşük Küçük politika ihlalleri, bilgilendirici İstenmeyen çıktı formatı

Değerlendirme Yöntemleri

Yargıç olarak Yüksek Lisans

Güvenlik ve politika uyumluluğu açısından yapay zeka çıktılarını değerlendirmek için yapay zeka kullanın

İnsan Değerlendirmesi

İncelikli güvenlik değerlendirmesi için çıktıların uzman incelemesi

Otomatik Puanlama

Desen eşleştirme ve kural tabanlı değerlendirme

Kırmızı Takım Metrikleri

Kullanım başarı oranını, hatalı pozitif oranı izleyin

İyileştirme Mimarisi

Savunma Katmanları

1. Giriş Filtreleme

  • İstem modeli algılama
  • Kodlama tanıma
  • Uzunluk sınırları
  • Hız sınırlama

2. Korkuluklar

  • Çıktı doğrulama
  • İçerik filtreleme
  • Araç kullanım politikaları
  • Erişim kontrolleri

3. Model Sağlamlaştırma

  • Güvenlik için ince ayar
  • RLHF iyileştirmeleri
  • Sistem istemi mühendisliği
  • Sıcaklık/en üst düzey ayarlama

4. Sistem Tasarımı

  • Ayrıcalık ayrımı
  • Döngüdeki insan
  • Günlüğe kaydetme ve izleme
  • Olay müdahalesi

Doğrulama Testi

Düzeltmeler uyguladıktan sonra, doğrulamak için yeniden test edin:

  • Orijinal güvenlik açıklarından artık yararlanılamaz
  • Düzeltmeler yeni güvenlik açıkları yaratmaz
  • Sistem işlevselliği bozulmadan kalır
  • Performans kabul edilebilir
  • Yanlış pozitif oranları yönetilebilir

Raporlama Şablonu

Yönetici Özeti

  • Kapsam ve hedefler
  • Önemli bulgulara genel bakış
  • Risk derecelendirme özeti
  • Öncelik önerileri

Teknik Ayrıntılar

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • Ekran görüntüleri ve günlükler
  • Saldırı zinciri diyagramları
  • Kod parçacıkları

Öneriler

  • Kısa vadeli düzeltmeler (hızlı kazançlar)
  • Orta vadeli iyileştirmeler
  • Uzun vadeli mimari değişiklikler
  • Kaynak gereksinimleri
  • Zaman Çizelgesi

Ekler

  • Araç çıktıları
  • Kullanılan test senaryoları
  • Referanslar
  • Sözlük

Etik Hususlar

Yetkilendirme

Always obtain explicit written permission before testing. Document scope boundaries.

Kapsam Sınırları

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

Veri İşleme

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

Sorumlu Açıklama

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

Daha Fazla Bilgi Edinmeye Hazır mısınız?

Yapay zeka güvenlik konularını keşfetmeye devam edin.

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.