Peretasan AI
Sumber Daya Keamanan AI

AI Red Teaming: Panduan Metodologi Lengkap

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • Waktu membaca: ~15 menit

Apa itu AI Red Teaming?

Tim merah AI adalah praktik serangan yang disengaja dan sistematis terhadap sistem AI to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

Injeksi Cepat

Manipulating AI behavior through malicious inputs that override system instructions

Jailbreaking

Melewati langkah-langkah keamanan untuk menghasilkan konten terlarang

Ekstraksi Data

Mengekstraksi informasi sensitif dari data atau keluaran pelatihan

Manipulasi Model

Mengubah model perilaku melalui keracunan atau serangan fine-tuning

Mengapa AI Red Teaming Penting pada tahun 2026

  • 180% increase in LLM-related security incidents (2025)
  • Tim Merah AI Microsoft telah menilai 100+ produk GenAI dan menemukan bahwa banyak kegagalan yang berdampak datang dari teknik sederhana
  • Sistem AI semakin banyak menangani data sensitif dan keputusan penting
  • Persyaratan peraturan (UU AI UE) mengamanatkan Pengujian keamanan AI untuk sistem berisiko tinggi

Membangun Tim Merah AI

Keterampilan yang Diperlukan

Keterampilan Teknis

  • Pemahaman arsitektur LLM
  • Pengetahuan teknik yang cepat
  • Keamanan aplikasi web
  • Pengujian keamanan API
  • Scripting (Python, pesta)

Keterampilan Melawan

  • Pemecahan masalah secara kreatif
  • Kesadaran rekayasa sosial
  • Pemikiran serangan multi-modal
  • Penelitian dan pengintaian
  • Dokumentasi dan pelaporan

Pengetahuan Domain

  • OWASP LLM 10 Teratas
  • Kerangka kerja MITRE ATLAS
  • Dasar-dasar AI/ML
  • Etika dan pengungkapan yang bertanggung jawab
  • Risiko khusus industri

Model Keterlibatan

Model Deskripsi Kelebihan Kontra
Tim Internal Tim merah internal yang berdedikasi Pengetahuan produk yang mendalam, pengujian berkelanjutan Mungkin kehilangan perspektif eksternal
Konsultan Eksternal Perusahaan keamanan pihak ketiga Perspektif baru, keterampilan khusus Biaya lebih tinggi, kurva pembelajaran
Hibrida Kolaborasi internal + eksternal Terbaik dari kedua dunia Koordinasi overhead
Otomatis Pengujian terintegrasi CI/CD Terus menerus, terukur Terbatas pada pola yang diketahui

Fase 1: Pengintaian & Penemuan

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 Pemetaan Sistem

  • Tinjauan arsitektur: Pahami bagaimana AI berintegrasi dengan sistem lain
  • Aliran data: Petakan bagaimana data berpindah melalui sistem
  • Titik akhir API: Identifikasi semua antarmuka yang terbuka
  • Integrasi pihak ketiga: Dokumentasikan layanan eksternal
  • Peran pengguna: Pahami tingkat akses yang berbeda

1.2 Capability Probing

  • Kemampuan model: Apa yang bisa dilakukan AI?
  • Akses alat: Fungsi apa yang bisa dijalankan?
  • Akses data: Informasi apa yang dapat diambilnya?
  • Saluran keluaran: Bagaimana cara berkomunikasi?
  • Manajemen negara: Bagaimana cara menangani sesi?

Teknik Utama

  • Ekstraksi Prompt Sistem: Mencoba mengungkapkan instruksi sistem melalui perintah yang hati-hati
  • Model Sidik Jari: Identifikasi model yang mendasari melalui pola perilaku
  • Penemuan API: Temukan titik akhir yang tersembunyi atau tidak terdokumentasi
  • Tinjauan Dokumentasi: Analisis dokumen publik untuk detail penerapan

Fase 2: Pemetaan Kerentanan

Identify and categorize potential attack vectors based on the discovered attack surface.

Serangan Taksonomi

Injeksi Cepat

  • Injeksi langsung
  • Injeksi tidak langsung
  • Manipulasi multi-turn
  • Context overflow

Serangan Jailbreak

  • Permainan peran (DAN)
  • Peniruan karakter
  • Pembingkaian otorisasi
  • Pengkodean bypass

Ekstraksi Data

  • Pelatihan pemulihan data
  • Kebocoran cepat sistem
  • Akses riwayat percakapan
  • Paparan kunci API

Penolakan Layanan

  • Kelelahan sumber daya
  • Context overflow
  • Manipulasi model
  • Sistem hang/crash

Penyalahgunaan Alat/Fungsi

  • Panggilan API tidak sah
  • Manipulasi parameter
  • Rangkaian fungsi
  • Eskalasi hak istimewa

Serangan Multi-Modal

  • Berbasis gambar injeksi
  • Manipulasi audio
  • Eksploitasi lintas modal
  • Konten tersemat

Serangan Model

  • Contoh permusuhan
  • Inversi model
  • Inferensi keanggotaan
  • Ekstraksi model

Rantai Pasokan

  • Keracunan ketergantungan
  • Kompromi hub model
  • Pelatihan keracunan data
  • Risiko pihak ketiga

Fase 3: Eksploitasi

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

Metodologi Eksploitasi

  1. Penetapan Prioritas: Peringkat kerentanan berdasarkan tingkat keparahan dan kemampuan eksploitasi
  2. Bukti Konsep: Kembangkan eksploitasi yang berfungsi untuk setiap kerentanan
  3. Penilaian Dampak: Tentukan konsekuensi dunia nyata dari eksploitasi yang berhasil
  4. Rantai: Uji apakah beberapa kerentanan dapat digabungkan untuk dampak yang lebih besar
  5. Dokumentasi: Catat semua upaya eksploitasi, keberhasilan, dan kegagalan

Pelajaran Tim Merah Microsoft

Berdasarkan pengujian 100+ produk GenAI, Tim Merah AI Microsoft menemukan:

  • Teknik sederhana berhasil: Banyak kegagalan yang berdampak berasal dari perintah jailbreak dasar
  • Pemikiran tingkat sistem penting: Kerentanan sering kali menjangkau beberapa komponen
  • Kreativitas manusia unggul: Alat otomatis menemukan pola yang diketahui; manusia menemukan serangan baru
  • Pengujian berkelanjutan sangat penting: Fitur baru memperkenalkan permukaan serangan baru

Fase 4: Pengujian Kegigihan

Test whether attack effects persist beyond the initial interaction and can survive system resets.

Kegigihan Sesi

  • Apakah manipulasi bertahan dalam penyegaran sesi?
  • Dapatkah status dimuat sebelumnya ke dalam sesi baru?
  • Apakah ada efek yang tersisa dari perintah sebelumnya?

Kegigihan Model

  • Dapatkah serangan memengaruhi pembaruan model di masa depan?
  • Apakah penyesuaian menjaga kerentanan?
  • Apakah serangan racun bersifat permanen?

Ketahanan Sistem

  • Dapatkah kerentanan bertahan dari pembaruan?
  • Apakah ada mekanisme pintu belakang?
  • Apakah serangan terus terjadi di seluruh penerapan?

Peralatan Penyelaman Mendalam

Garak

Pemindai kerentanan LLM sumber terbuka NVIDIA

  • Penyelidikan untuk 40+ jenis kerentanan
  • Penilaian model berkelanjutan
  • Pembaruan basis data kerentanan secara berkala
  • Integrasi dengan saluran CI/CD
Lihat di GitHub →

PyRIT

Alat Identifikasi Risiko Python Microsoft

  • Kerangka kerja tim merah yang komprehensif
  • Dukungan beberapa permukaan serangan
  • Pembuatan serangan otomatis
  • Penilaian dan evaluasi
Lihat di GitHub →

Promptfoo

Platform pengujian dan evaluasi LLM

  • Kerangka pengujian cepat
  • Evaluasi keselamatan
  • Pembandingan kinerja
  • Perbandingan versi
Lihat Situs Web →

Rebuff

SDK deteksi injeksi cepat

  • Deteksi upaya injeksi
  • Pertahanan multi-lapis
  • Tingkat positif palsu yang rendah
  • Integrasi yang mudah
Lihat di GitHub →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

Poin Integrasi Pipeline

1. Pra-Komit

  • Validasi prompt lokal
  • Deteksi injeksi berbasis pola
  • Pengujian workstation pengembang

2. Permintaan Tarik

  • Pemindaian kerentanan otomatis
  • Perbandingan dasar
  • Penegakan gerbang keamanan

3. Pra-Produksi

  • Penilaian tim merah penuh
  • Pengujian regresi
  • Pembandingan kinerja

4. Produksi

  • Pemantauan terus menerus
  • Deteksi anomali
  • Integrasi respons insiden

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

Kerangka Pemeringkatan Tingkat Keparahan

Keparahan Kriteria Contoh
Kritis Eksekusi kode jarak jauh, pelanggaran data, kompromi sistem Injeksi cepat penuh yang mengarah ke RCE
Tinggi Akses tidak sah, paparan data sensitif Ekstraksi cepat sistem
Medium Penghindaran kebijakan, akses data terbatas Alat yang Direkomendasikan
Rendah Pelanggaran kebijakan kecil, bersifat informasional Format keluaran yang tidak diinginkan

Metode Evaluasi

LLM-as-Judge

Gunakan AI untuk mengevaluasi keluaran AI demi keselamatan dan kepatuhan terhadap kebijakan

Evaluasi Manusia

Tinjauan ahli terhadap keluaran untuk penilaian keamanan bernuansa

Penilaian Otomatis

Pencocokan pola dan evaluasi berbasis aturan

Metrik Tim Merah

Melacak tingkat keberhasilan eksploitasi, tingkat positif palsu

Arsitektur Remediasi

Lapisan Pertahanan

1. Penyaringan Masukan

  • Deteksi pola yang cepat
  • Pengenalan pengodean
  • Batas panjang
  • Pembatasan tingkat

2. Pagar Pembatas

  • Validasi keluaran
  • Pemfilteran konten
  • Kebijakan penggunaan alat
  • Kontrol akses

3. Pengerasan Model

  • Penyempurnaan demi keselamatan
  • Peningkatan RLHF
  • Rekayasa prompt sistem
  • Penyetelan suhu/top-p

4. Desain Sistem

  • Pemisahan hak istimewa
  • Manusia dalam lingkaran
  • Pencatatan log dan pemantauan
  • Respons insiden

Pengujian Validasi

Setelah menerapkan perbaikan, uji ulang untuk memverifikasi:

  • Kerentanan asli tidak lagi dapat dieksploitasi
  • Perbaikan tidak menimbulkan kerentanan baru
  • Fungsionalitas sistem tetap utuh
  • Kinerja dapat diterima
  • Tingkat positif palsu dapat dikelola

Templat Pelaporan

Ringkasan Eksekutif

  • Cakupan dan tujuan
  • Ikhtisar temuan utama
  • Ringkasan peringkat risiko
  • Rekomendasi prioritas

Detail Teknis

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • Tangkapan layar dan log
  • Diagram rantai serangan
  • Cuplikan kode

Rekomendasi

  • Perbaikan jangka pendek (kemenangan cepat)
  • Peningkatan jangka menengah
  • Perubahan arsitektur jangka panjang
  • Persyaratan sumber daya
  • Garis Waktu

Lampiran

  • Keluaran alat
  • Kasus uji yang digunakan
  • Referensi
  • Glosarium

Pertimbangan Etis

Otorisasi

Always obtain explicit written permission before testing. Document scope boundaries.

Batas Cakupan

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

Penanganan Data

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

Pengungkapan yang Bertanggung Jawab

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

Siap Mempelajari Lebih Lanjut?

Terus jelajahi topik keamanan AI.

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.