AI Kırmızı Ekip Oluşturma: Tam Metodoloji Kılavuzu
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • Okuma süresi: ~15 dakika
AI Kırmızı Takım Oluşturma nedir?
Yapay zeka kırmızı ekip uygulaması pratiktir Yapay zeka sistemlerine kasıtlı, sistematik saldırılar to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
Prompt Injection
Manipulating AI behavior through malicious inputs that override system instructions
Jailbreaking
Yasaklı içerik oluşturmak için güvenlik önlemlerini atlamak
Veri Çıkarma
Eğitim verilerinden veya çıktılardan hassas bilgileri çıkarma
Model Değiştirme
Model davranışını zehirleme veya ince ayar saldırıları yoluyla değiştirme
Yapay Zeka Kırmızı Takım Oluşturma 2026'da Neden Önemlidir
- 180% increase in LLM-related security incidents (2025)
- Microsoft'un Yapay Zeka Kırmızı Ekibi değerlendirdi 100'den fazla Nesil AI ürünü ve birçok etkili başarısızlığın basit teknikler
- Yapay zeka sistemleri giderek daha fazla ele alıyor hassas veriler ve kritik kararlar
- Düzenleyici gereklilikler (AB Yapay Zeka Yasası) zorunluluğu Yapay zeka güvenlik testi yüksek riskli sistemler için
Bir Yapay Zeka Kırmızı Takımı Oluşturma
Gerekli Beceriler
Teknik Beceriler
- Yüksek Lisans mimarisini anlama
- Hızlı mühendislik bilgisi
- Web uygulaması güvenliği
- API güvenlik testi
- Komut dosyası oluşturma (Python, bash)
Çelişmeli Beceriler
- Yaratıcı sorun çözme
- Sosyal mühendislik farkındalığı
- Çok modlu saldırı düşüncesi
- Araştırma ve keşif
- Belgeleme ve raporlama
Alan Bilgisi
- OWASP LLM İlk 10
- MITRE ATLAS çerçevesi
- AI/ML temelleri
- Etik ve sorumluluk ifşa
- Sektöre özgü riskler
Engagement Models
| Model | Açıklama | Artıları | Eksileri |
|---|---|---|---|
| Dahili Ekip | Şirket içi özel kırmızı ekip | Derin ürün bilgisi, sürekli testler | Harici bakış açısını kaçırabilir |
| Harici Danışman | Üçüncü taraf güvenlik firması | Yeni bakış açısı, özel beceriler | Daha yüksek maliyet, öğrenme eğrisi |
| Karma | Dahili + harici işbirliği | Her iki dünyanın da en iyisi | Koordinasyon yükü |
| Otomatik | CI/CD entegre testi | Sürekli, ölçeklenebilir | Bilinen kalıplarla sınırlıdır |
Aşama 1: Keşif ve Keşif
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 Sistem Haritalama
- Mimari incelemesi: Yapay zekanın diğer sistemlerle nasıl entegre olduğunu anlayın
- Veri akışı: Verilerin sistem içinde nasıl hareket ettiğini haritalayın
- API uç noktaları: Açıkta kalan tüm arayüzleri tanımlama
- Üçüncü taraf entegrasyonları: Harici hizmetleri belgeleyin
- Kullanıcı rolleri: Farklı erişim düzeylerini anlayın
1.2 Yetenek Araştırması
- Model yetenekleri: Yapay zeka ne yapabilir?
- Araç erişimi: Hangi işlevleri çağırabilir?
- Veri erişimi: Hangi bilgileri alabilir?
- Çıkış kanalları: Nasıl iletişim kurar?
- Devlet yönetimi: Oturumları nasıl yönetir?
Anahtar Teknikler
- Sistem İstemi Çıkarma: Dikkatli yönlendirmeler yoluyla sistem talimatlarını ortaya çıkarmaya çalışın
- Model Parmak İzi: Davranış kalıpları aracılığıyla temel modeli tanımlama
- API Keşfi: Gizli veya belgelenmemiş uç noktaları bulun
- Belge İncelemesi: Uygulama ayrıntıları için genel belgeleri analiz edin
Aşama 2: Güvenlik Açığı Haritalaması
Identify and categorize potential attack vectors based on the discovered attack surface.
Saldırı Taksonomisi
Prompt Injection
- Doğrudan enjeksiyon
- Dolaylı enjeksiyon
- Çok turlu manipülasyon
- Bağlam taşması
Jailbreak Saldırıları
- Rol oynama (DAN)
- Karakter kimliğine bürünme
- Yetkilendirme çerçevesi
- Kodlamayı atlama
Veri Çıkarma
- Eğitim veri kurtarma
- Sistem istemi sızıntısı
- Konuşma geçmişine erişim
- API anahtarına maruz kalma
Hizmet Reddi
- Kaynak tükenmesi
- Bağlam taşması
- Model manipülasyonu
- Sistem kilitlenmesi/çökmesi
Araç/İşlev Kötüye Kullanma
- Yetkisiz API çağrıları
- Parametre manipülasyonu
- İşlev zinciri
- Ayrıcalık artışı
Çok Modlu Saldırılar
- Resim tabanlı enjeksiyon
- Ses manipülasyonu
- Çapraz modlu istismarlar
- Gömülü içerik
Model Saldırıları
- Karşıt örnekler
- Modeli tersine çevirme
- Üyelik çıkarımı
- Model çıkarma
Tedarik Zinciri
- Bağımlılık zehirlenmesi
- Model merkezi güvenliği
- Eğitim verileri zehirlenmesi
- Üçüncü taraf riskleri
Aşama 3: Suistimal
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
Sömürme Metodolojisi
- Öncelik Ataması: Güvenlik açıklarını ciddiyet ve istismar edilebilirliğe göre sıralayın
- Kavram Kanıtı: Her güvenlik açığı için çalışan açıklardan yararlanın
- Etki Değerlendirmesi: Başarılı istismarın gerçek dünyadaki sonuçlarını belirleyin
- Zincirleme: Daha fazla etki için birden fazla güvenlik açığının birleştirilip birleştirilemeyeceğini test edin
- Belgeler: Tüm yararlanma girişimlerini, başarılarını ve başarısızlıklarını kaydedin
Microsoft Red Team Dersleri
Microsoft'un AI Kırmızı Ekibi, 100'den fazla GenAI ürününün testine dayanarak şunu buldu:
- Basit teknikler işe yarar: Birçok etkili hata, temel jailbreak istemlerinden kaynaklanıyor
- Sistem düzeyinde düşünme önemlidir: Güvenlik açıkları genellikle birden fazla bileşeni kapsar
- İnsan yaratıcılığı kazanır: Otomatik araçlar bilinen kalıpları bulur; insanlar yeni saldırılar buluyor
- Sürekli test önemlidir: Yeni özellikler, yeni saldırı yüzeylerini tanıtıyor
Aşama 4: Kalıcılık Testi
Test whether attack effects persist beyond the initial interaction and can survive system resets.
Oturum Kalıcılığı
- Manipülasyon oturum yenilemeden sağ çıkabilir mi?
- Durum yeni oturumlara önceden yüklenebilir mi?
- Önceki istemlerin kalıcı etkileri var mı?
Model Kalıcılığı
- Saldırılar gelecekteki model güncellemelerini etkileyebilir mi?
- İnce ayar güvenlik açıklarını korur mu?
- Zehir saldırıları kalıcı mıdır?
Sistem Kalıcılığı
- Güvenlik açıkları güncellemelerden kurtulabilir mi?
- Arka kapı mekanizmaları var mı?
- Dağıtımlar genelinde saldırılar devam ediyor mu?
Araç Derinlemesine İnceleme
Garak
NVIDIA'nın açık kaynaklı Yüksek Lisans güvenlik açığı tarayıcısı
- 40'tan fazla güvenlik açığı türünü araştırıyor
- Sürekli model değerlendirmesi
- Düzenli güvenlik açığı veritabanı güncellemeleri
- CI/CD ardışık düzenleriyle entegrasyon
PyRIT
Microsoft'un Python Risk Tanımlama Aracı
- Kapsamlı kırmızı ekip çerçevesi
- Çoklu saldırı yüzeyi desteği
- Otomatik saldırı oluşturma
- Puanlama ve değerlendirme
Promptfoo
LLM test ve değerlendirme platformu
- Hızlı test çerçevesi
- Güvenlik değerlendirmesi
- Performans karşılaştırması
- Sürüm karşılaştırması
Rebuff
Hızlı enjeksiyon algılama SDK'sı
- Enjeksiyon girişimlerinin tespiti
- Çok katmanlı savunma
- Düşük hatalı pozitif oranı
- Kolay entegrasyon
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
Boru Hattı Entegrasyon Noktaları
1. Ön Taahhüt
- Yerel istem doğrulama
- Desen tabanlı enjeksiyon tespiti
- Geliştirici iş istasyonu testi
2. Çekme İsteği
- Otomatik güvenlik açığı taraması
- Temel karşılaştırma
- Güvenlik kapısı uygulaması
3. Üretim Öncesi
- Tam kırmızı takım değerlendirmesi
- Regresyon testi
- Performans karşılaştırması
4. Üretim
- Sürekli izleme
- Anormallik tespiti
- Olay yanıt entegrasyonu
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
Önem Derecelendirme Çerçevesi
| Önem Düzeyi | Kriter | Örnek |
|---|---|---|
| Kritik | Uzaktan kod yürütme, veri ihlali, sistem güvenliği | RCE'ye yol açan tam istem enjeksiyonu |
| Yüksek | Yetkisiz erişim, hassas verilerin açığa çıkması | Sistem istemi çıkarma |
| Orta | Politika atlama, sınırlı veri erişimi | İçerik filtresini atlayın |
| Düşük | Küçük politika ihlalleri, bilgilendirici | İstenmeyen çıktı formatı |
Değerlendirme Yöntemleri
Yargıç olarak Yüksek Lisans
Güvenlik ve politika uyumluluğu açısından yapay zeka çıktılarını değerlendirmek için yapay zeka kullanın
İnsan Değerlendirmesi
İncelikli güvenlik değerlendirmesi için çıktıların uzman incelemesi
Otomatik Puanlama
Desen eşleştirme ve kural tabanlı değerlendirme
Kırmızı Takım Metrikleri
Kullanım başarı oranını, hatalı pozitif oranı izleyin
İyileştirme Mimarisi
Savunma Katmanları
1. Giriş Filtreleme
- İstem modeli algılama
- Kodlama tanıma
- Uzunluk sınırları
- Hız sınırlama
2. Korkuluklar
- Çıktı doğrulama
- İçerik filtreleme
- Araç kullanım politikaları
- Erişim kontrolleri
3. Model Sağlamlaştırma
- Güvenlik için ince ayar
- RLHF iyileştirmeleri
- Sistem istemi mühendisliği
- Sıcaklık/en üst düzey ayarlama
4. Sistem Tasarımı
- Ayrıcalık ayrımı
- Döngüdeki insan
- Günlüğe kaydetme ve izleme
- Olay müdahalesi
Doğrulama Testi
Düzeltmeler uyguladıktan sonra, doğrulamak için yeniden test edin:
- Orijinal güvenlik açıklarından artık yararlanılamaz
- Düzeltmeler yeni güvenlik açıkları yaratmaz
- Sistem işlevselliği bozulmadan kalır
- Performans kabul edilebilir
- Yanlış pozitif oranları yönetilebilir
Raporlama Şablonu
Yönetici Özeti
- Kapsam ve hedefler
- Önemli bulgulara genel bakış
- Risk derecelendirme özeti
- Öncelik önerileri
Teknik Ayrıntılar
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- Ekran görüntüleri ve günlükler
- Saldırı zinciri diyagramları
- Kod parçacıkları
Öneriler
- Kısa vadeli düzeltmeler (hızlı kazançlar)
- Orta vadeli iyileştirmeler
- Uzun vadeli mimari değişiklikler
- Kaynak gereksinimleri
- Zaman Çizelgesi
Ekler
- Araç çıktıları
- Kullanılan test senaryoları
- Referanslar
- Sözlük
Etik Hususlar
Yetkilendirme
Always obtain explicit written permission before testing. Document scope boundaries.
Kapsam Sınırları
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
Veri İşleme
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
Sorumlu Açıklama
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
İlgili Kaynaklar
Daha Fazla Bilgi Edinmeye Hazır mısınız?
Yapay zeka güvenlik konularını keşfetmeye devam edin.