AI Red Teaming: Panduan Metodologi Lengkap
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • Waktu membaca: ~15 menit
Apa itu AI Red Teaming?
Tim merah AI adalah praktik serangan yang disengaja dan sistematis terhadap sistem AI to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
Injeksi Cepat
Manipulating AI behavior through malicious inputs that override system instructions
Jailbreaking
Melewati langkah-langkah keamanan untuk menghasilkan konten terlarang
Ekstraksi Data
Mengekstraksi informasi sensitif dari data atau keluaran pelatihan
Manipulasi Model
Mengubah model perilaku melalui keracunan atau serangan fine-tuning
Mengapa AI Red Teaming Penting pada tahun 2026
- 180% increase in LLM-related security incidents (2025)
- Tim Merah AI Microsoft telah menilai 100+ produk GenAI dan menemukan bahwa banyak kegagalan yang berdampak datang dari teknik sederhana
- Sistem AI semakin banyak menangani data sensitif dan keputusan penting
- Persyaratan peraturan (UU AI UE) mengamanatkan Pengujian keamanan AI untuk sistem berisiko tinggi
Membangun Tim Merah AI
Keterampilan yang Diperlukan
Keterampilan Teknis
- Pemahaman arsitektur LLM
- Pengetahuan teknik yang cepat
- Keamanan aplikasi web
- Pengujian keamanan API
- Scripting (Python, pesta)
Keterampilan Melawan
- Pemecahan masalah secara kreatif
- Kesadaran rekayasa sosial
- Pemikiran serangan multi-modal
- Penelitian dan pengintaian
- Dokumentasi dan pelaporan
Pengetahuan Domain
- OWASP LLM 10 Teratas
- Kerangka kerja MITRE ATLAS
- Dasar-dasar AI/ML
- Etika dan pengungkapan yang bertanggung jawab
- Risiko khusus industri
Model Keterlibatan
| Model | Deskripsi | Kelebihan | Kontra |
|---|---|---|---|
| Tim Internal | Tim merah internal yang berdedikasi | Pengetahuan produk yang mendalam, pengujian berkelanjutan | Mungkin kehilangan perspektif eksternal |
| Konsultan Eksternal | Perusahaan keamanan pihak ketiga | Perspektif baru, keterampilan khusus | Biaya lebih tinggi, kurva pembelajaran |
| Hibrida | Kolaborasi internal + eksternal | Terbaik dari kedua dunia | Koordinasi overhead |
| Otomatis | Pengujian terintegrasi CI/CD | Terus menerus, terukur | Terbatas pada pola yang diketahui |
Fase 1: Pengintaian & Penemuan
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 Pemetaan Sistem
- Tinjauan arsitektur: Pahami bagaimana AI berintegrasi dengan sistem lain
- Aliran data: Petakan bagaimana data berpindah melalui sistem
- Titik akhir API: Identifikasi semua antarmuka yang terbuka
- Integrasi pihak ketiga: Dokumentasikan layanan eksternal
- Peran pengguna: Pahami tingkat akses yang berbeda
1.2 Capability Probing
- Kemampuan model: Apa yang bisa dilakukan AI?
- Akses alat: Fungsi apa yang bisa dijalankan?
- Akses data: Informasi apa yang dapat diambilnya?
- Saluran keluaran: Bagaimana cara berkomunikasi?
- Manajemen negara: Bagaimana cara menangani sesi?
Teknik Utama
- Ekstraksi Prompt Sistem: Mencoba mengungkapkan instruksi sistem melalui perintah yang hati-hati
- Model Sidik Jari: Identifikasi model yang mendasari melalui pola perilaku
- Penemuan API: Temukan titik akhir yang tersembunyi atau tidak terdokumentasi
- Tinjauan Dokumentasi: Analisis dokumen publik untuk detail penerapan
Fase 2: Pemetaan Kerentanan
Identify and categorize potential attack vectors based on the discovered attack surface.
Serangan Taksonomi
Injeksi Cepat
- Injeksi langsung
- Injeksi tidak langsung
- Manipulasi multi-turn
- Context overflow
Serangan Jailbreak
- Permainan peran (DAN)
- Peniruan karakter
- Pembingkaian otorisasi
- Pengkodean bypass
Ekstraksi Data
- Pelatihan pemulihan data
- Kebocoran cepat sistem
- Akses riwayat percakapan
- Paparan kunci API
Penolakan Layanan
- Kelelahan sumber daya
- Context overflow
- Manipulasi model
- Sistem hang/crash
Penyalahgunaan Alat/Fungsi
- Panggilan API tidak sah
- Manipulasi parameter
- Rangkaian fungsi
- Eskalasi hak istimewa
Serangan Multi-Modal
- Berbasis gambar injeksi
- Manipulasi audio
- Eksploitasi lintas modal
- Konten tersemat
Serangan Model
- Contoh permusuhan
- Inversi model
- Inferensi keanggotaan
- Ekstraksi model
Rantai Pasokan
- Keracunan ketergantungan
- Kompromi hub model
- Pelatihan keracunan data
- Risiko pihak ketiga
Fase 3: Eksploitasi
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
Metodologi Eksploitasi
- Penetapan Prioritas: Peringkat kerentanan berdasarkan tingkat keparahan dan kemampuan eksploitasi
- Bukti Konsep: Kembangkan eksploitasi yang berfungsi untuk setiap kerentanan
- Penilaian Dampak: Tentukan konsekuensi dunia nyata dari eksploitasi yang berhasil
- Rantai: Uji apakah beberapa kerentanan dapat digabungkan untuk dampak yang lebih besar
- Dokumentasi: Catat semua upaya eksploitasi, keberhasilan, dan kegagalan
Pelajaran Tim Merah Microsoft
Berdasarkan pengujian 100+ produk GenAI, Tim Merah AI Microsoft menemukan:
- Teknik sederhana berhasil: Banyak kegagalan yang berdampak berasal dari perintah jailbreak dasar
- Pemikiran tingkat sistem penting: Kerentanan sering kali menjangkau beberapa komponen
- Kreativitas manusia unggul: Alat otomatis menemukan pola yang diketahui; manusia menemukan serangan baru
- Pengujian berkelanjutan sangat penting: Fitur baru memperkenalkan permukaan serangan baru
Fase 4: Pengujian Kegigihan
Test whether attack effects persist beyond the initial interaction and can survive system resets.
Kegigihan Sesi
- Apakah manipulasi bertahan dalam penyegaran sesi?
- Dapatkah status dimuat sebelumnya ke dalam sesi baru?
- Apakah ada efek yang tersisa dari perintah sebelumnya?
Kegigihan Model
- Dapatkah serangan memengaruhi pembaruan model di masa depan?
- Apakah penyesuaian menjaga kerentanan?
- Apakah serangan racun bersifat permanen?
Ketahanan Sistem
- Dapatkah kerentanan bertahan dari pembaruan?
- Apakah ada mekanisme pintu belakang?
- Apakah serangan terus terjadi di seluruh penerapan?
Peralatan Penyelaman Mendalam
Garak
Pemindai kerentanan LLM sumber terbuka NVIDIA
- Penyelidikan untuk 40+ jenis kerentanan
- Penilaian model berkelanjutan
- Pembaruan basis data kerentanan secara berkala
- Integrasi dengan saluran CI/CD
PyRIT
Alat Identifikasi Risiko Python Microsoft
- Kerangka kerja tim merah yang komprehensif
- Dukungan beberapa permukaan serangan
- Pembuatan serangan otomatis
- Penilaian dan evaluasi
Promptfoo
Platform pengujian dan evaluasi LLM
- Kerangka pengujian cepat
- Evaluasi keselamatan
- Pembandingan kinerja
- Perbandingan versi
Rebuff
SDK deteksi injeksi cepat
- Deteksi upaya injeksi
- Pertahanan multi-lapis
- Tingkat positif palsu yang rendah
- Integrasi yang mudah
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
Poin Integrasi Pipeline
1. Pra-Komit
- Validasi prompt lokal
- Deteksi injeksi berbasis pola
- Pengujian workstation pengembang
2. Permintaan Tarik
- Pemindaian kerentanan otomatis
- Perbandingan dasar
- Penegakan gerbang keamanan
3. Pra-Produksi
- Penilaian tim merah penuh
- Pengujian regresi
- Pembandingan kinerja
4. Produksi
- Pemantauan terus menerus
- Deteksi anomali
- Integrasi respons insiden
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
Kerangka Pemeringkatan Tingkat Keparahan
| Keparahan | Kriteria | Contoh |
|---|---|---|
| Kritis | Eksekusi kode jarak jauh, pelanggaran data, kompromi sistem | Injeksi cepat penuh yang mengarah ke RCE |
| Tinggi | Akses tidak sah, paparan data sensitif | Ekstraksi cepat sistem |
| Medium | Penghindaran kebijakan, akses data terbatas | Alat yang Direkomendasikan |
| Rendah | Pelanggaran kebijakan kecil, bersifat informasional | Format keluaran yang tidak diinginkan |
Metode Evaluasi
LLM-as-Judge
Gunakan AI untuk mengevaluasi keluaran AI demi keselamatan dan kepatuhan terhadap kebijakan
Evaluasi Manusia
Tinjauan ahli terhadap keluaran untuk penilaian keamanan bernuansa
Penilaian Otomatis
Pencocokan pola dan evaluasi berbasis aturan
Metrik Tim Merah
Melacak tingkat keberhasilan eksploitasi, tingkat positif palsu
Arsitektur Remediasi
Lapisan Pertahanan
1. Penyaringan Masukan
- Deteksi pola yang cepat
- Pengenalan pengodean
- Batas panjang
- Pembatasan tingkat
2. Pagar Pembatas
- Validasi keluaran
- Pemfilteran konten
- Kebijakan penggunaan alat
- Kontrol akses
3. Pengerasan Model
- Penyempurnaan demi keselamatan
- Peningkatan RLHF
- Rekayasa prompt sistem
- Penyetelan suhu/top-p
4. Desain Sistem
- Pemisahan hak istimewa
- Manusia dalam lingkaran
- Pencatatan log dan pemantauan
- Respons insiden
Pengujian Validasi
Setelah menerapkan perbaikan, uji ulang untuk memverifikasi:
- Kerentanan asli tidak lagi dapat dieksploitasi
- Perbaikan tidak menimbulkan kerentanan baru
- Fungsionalitas sistem tetap utuh
- Kinerja dapat diterima
- Tingkat positif palsu dapat dikelola
Templat Pelaporan
Ringkasan Eksekutif
- Cakupan dan tujuan
- Ikhtisar temuan utama
- Ringkasan peringkat risiko
- Rekomendasi prioritas
Detail Teknis
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- Tangkapan layar dan log
- Diagram rantai serangan
- Cuplikan kode
Rekomendasi
- Perbaikan jangka pendek (kemenangan cepat)
- Peningkatan jangka menengah
- Perubahan arsitektur jangka panjang
- Persyaratan sumber daya
- Garis Waktu
Lampiran
- Keluaran alat
- Kasus uji yang digunakan
- Referensi
- Glosarium
Pertimbangan Etis
Otorisasi
Always obtain explicit written permission before testing. Document scope boundaries.
Batas Cakupan
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
Penanganan Data
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
Pengungkapan yang Bertanggung Jawab
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
Sumber Daya Terkait
Siap Mempelajari Lebih Lanjut?
Terus jelajahi topik keamanan AI.