การแฮ็ก AI
แหล่งข้อมูลด้านความปลอดภัยของ AI

AI Red Teaming: คู่มือระเบียบวิธีฉบับสมบูรณ์

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • เวลาในการอ่าน: ~15 นาที

AI Red Teaming คืออะไร?

การสร้างทีมสีแดงของ AI คือแนวทางปฏิบัติของ จงใจโจมตีอย่างเป็นระบบบนระบบ AI to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

พร้อมท์การฉีด

Manipulating AI behavior through malicious inputs that override system instructions

การเจลเบรค

การข้ามมาตรการด้านความปลอดภัยเพื่อสร้างเนื้อหาที่ต้องห้าม

การแยกข้อมูล

การแยกข้อมูลที่ละเอียดอ่อนออกจากข้อมูลการฝึกอบรมหรือเอาท์พุต

การจัดการโมเดล

การเปลี่ยนแปลงพฤติกรรมของโมเดลผ่านการโจมตีแบบวางยาพิษหรือการปรับแต่ง

เหตุใด AI Red Teaming จึงมีความสำคัญในปี 2026

  • 180% increase in LLM-related security incidents (2025)
  • ทีม AI Red ของ Microsoft ได้ประเมินแล้ว ผลิตภัณฑ์ GenAI กว่า 100 รายการ และพบว่าความล้มเหลวที่ส่งผลกระทบจำนวนมากมาจาก เทคนิคง่ายๆ
  • ระบบ AI รับมือได้มากขึ้น ข้อมูลที่ละเอียดอ่อนและการตัดสินใจที่สำคัญ
  • ข้อกำหนดด้านกฎระเบียบ (EU AI Act) ข้อบังคับ การทดสอบความปลอดภัยของ AI สำหรับระบบที่มีความเสี่ยงสูง

การสร้างทีม AI Red

ทักษะที่จำเป็น

ทักษะทางเทคนิค

  • ความเข้าใจเกี่ยวกับสถาปัตยกรรม LLM
  • ความรู้ด้านวิศวกรรมที่รวดเร็ว
  • ความปลอดภัยของแอปพลิเคชันบนเว็บ
  • การทดสอบความปลอดภัยของ API
  • การเขียนสคริปต์ (Python, bash)

ทักษะฝ่ายตรงข้าม

  • การแก้ปัญหาอย่างสร้างสรรค์
  • การรับรู้ด้านวิศวกรรมสังคม
  • การคิดโจมตีหลายรูปแบบ
  • การวิจัยและการลาดตระเวน
  • เอกสารประกอบและการรายงาน

ความรู้เกี่ยวกับโดเมน

  • OWASP LLM 10 อันดับแรก
  • กรอบงาน MIRE ATLAS
  • พื้นฐานของ AI/ML
  • จริยธรรมและการเปิดเผยอย่างมีความรับผิดชอบ
  • ความเสี่ยงเฉพาะอุตสาหกรรม

โมเดลการมีส่วนร่วม

รุ่น คำอธิบาย ข้อดี ข้อเสีย
ทีมภายใน ทีมแดงภายในองค์กรโดยเฉพาะ ผลิตภัณฑ์แบบลึก ความรู้ การทดสอบอย่างต่อเนื่อง อาจพลาดมุมมองภายนอก
ที่ปรึกษาภายนอก บริษัทรักษาความปลอดภัยบุคคลที่สาม มุมมองใหม่ ทักษะเฉพาะทาง ต้นทุนที่สูงขึ้น ช่วงการเรียนรู้
ไฮบริด การทำงานร่วมกันทั้งภายในและภายนอก สิ่งที่ดีที่สุดในทั้งสองโลก ค่าใช้จ่ายในการประสานงาน
อัตโนมัติ การทดสอบแบบรวม CI/CD ต่อเนื่อง ปรับขนาดได้ จำกัดเฉพาะรูปแบบที่ทราบ

ระยะที่ 1: การลาดตระเวนและการค้นพบ

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 การแมประบบ

  • การตรวจสอบสถาปัตยกรรม: ทำความเข้าใจวิธีที่ AI ผสานรวมกับระบบอื่น ๆ
  • กระแสข้อมูล: แมปวิธีการเคลื่อนย้ายข้อมูลผ่านระบบ
  • จุดสิ้นสุด API: ระบุอินเทอร์เฟซที่เปิดเผยทั้งหมด
  • การบูรณาการของบุคคลที่สาม: บันทึกบริการภายนอก
  • บทบาทผู้ใช้: ทำความเข้าใจระดับการเข้าถึงต่างๆ

1.2 การตรวจสอบความสามารถ

  • ความสามารถของโมเดล: AI ทำอะไรได้บ้าง
  • การเข้าถึงเครื่องมือ: ฟังก์ชันใดบ้างที่สามารถเรียกใช้ได้
  • การเข้าถึงข้อมูล: สามารถดึงข้อมูลอะไรบ้าง
  • ช่องทางเอาท์พุท: มันสื่อสารอย่างไร
  • การจัดการสถานะ: จะจัดการเซสชันอย่างไร

เทคนิคหลัก

  • การแยกพร้อมท์ของระบบ: พยายามเปิดเผยคำแนะนำของระบบผ่านการแจ้งอย่างระมัดระวัง
  • โมเดลลายนิ้วมือ: ระบุโมเดลที่สำคัญผ่านรูปแบบพฤติกรรม
  • การค้นพบ API: ค้นหาจุดสิ้นสุดที่ซ่อนอยู่หรือไม่มีเอกสาร
  • การตรวจสอบเอกสาร: วิเคราะห์เอกสารสาธารณะสำหรับรายละเอียดการใช้งาน

ระยะที่ 2: การแมปช่องโหว่

Identify and categorize potential attack vectors based on the discovered attack surface.

อนุกรมวิธานการโจมตี

พร้อมท์การฉีด

  • การแทรกโดยตรง
  • การแทรกโดยอ้อม
  • การจัดการแบบหลายรอบ
  • บริบทล้น||ใช้หน้าต่างแบบเลื่อน

การโจมตีด้วยการแหกคุก

  • การเล่นตามบทบาท (DAN)
  • การเลียนแบบตัวละคร
  • การกำหนดกรอบการให้สิทธิ์
  • การเลี่ยงการเข้ารหัส

การแยกข้อมูล

  • การกู้คืนข้อมูลการฝึกอบรม
  • การรั่วไหลของการแจ้งเตือนของระบบ
  • การเข้าถึงประวัติการสนทนา
  • การเปิดเผยคีย์ API

การปฏิเสธการบริการ

  • การสิ้นเปลืองทรัพยากร
  • บริบทล้น||ใช้หน้าต่างแบบเลื่อน
  • การจัดการโมเดล
  • ระบบหยุดทำงาน/ขัดข้อง

การใช้เครื่องมือ/ฟังก์ชันในทางที่ผิด

  • การเรียก API ที่ไม่ได้รับอนุญาต
  • การจัดการพารามิเตอร์
  • การเชื่อมโยงฟังก์ชัน
  • การยกระดับสิทธิ์

การโจมตีหลายรูปแบบ

  • การแทรกตามรูปภาพ
  • การจัดการเสียง
  • การหาประโยชน์ข้ามโมดัล
  • เนื้อหาที่ฝังไว้

รูปแบบการโจมตี

  • ตัวอย่างฝ่ายตรงข้าม
  • การผกผันของโมเดล
  • การอนุมานการเป็นสมาชิก
  • การแยกโมเดล

ซัพพลายเชน

  • การวางยาพิษในการพึ่งพา
  • การประนีประนอมของฮับโมเดล
  • การวางพิษของข้อมูลการฝึกอบรม
  • ความเสี่ยงของบุคคลที่สาม

ระยะที่ 3: การใช้ประโยชน์

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

วิธีการแสวงหาประโยชน์

  1. การกำหนดลำดับความสำคัญ: จัดอันดับช่องโหว่ตามความรุนแรงและความสามารถในการหาประโยชน์
  2. หลักฐานของแนวคิด: พัฒนาการหาประโยชน์ในการทำงานสำหรับช่องโหว่แต่ละจุด
  3. การประเมินผลกระทบ: ระบุผลที่ตามมาในโลกแห่งความเป็นจริงของการแสวงหาผลประโยชน์ที่ประสบความสำเร็จ
  4. การเชื่อมโยง: ทดสอบว่าสามารถรวมช่องโหว่หลายรายการเข้าด้วยกันเพื่อสร้างผลกระทบที่มากขึ้นหรือไม่
  5. เอกสารประกอบ: บันทึกความพยายามในการแสวงหาประโยชน์ ความสำเร็จ และความล้มเหลวทั้งหมด

บทเรียนของ Microsoft Red Team

จากการทดสอบผลิตภัณฑ์ GenAI มากกว่า 100 รายการ ทีม AI Red ของ Microsoft พบว่า:

  • เทคนิคง่ายๆ ทำงาน: ความล้มเหลวที่ส่งผลกระทบหลายอย่างมาจากข้อความแจ้งการเจลเบรกพื้นฐาน
  • การคิดในระดับระบบมีความสำคัญ: ช่องโหว่มักขยายออกไปหลายองค์ประกอบ
  • ความคิดสร้างสรรค์ของมนุษย์มีชัย: เครื่องมืออัตโนมัติจะค้นหารูปแบบที่ทราบ มนุษย์พบการโจมตีรูปแบบใหม่
  • การทดสอบอย่างต่อเนื่องเป็นสิ่งจำเป็น: ฟีเจอร์ใหม่แนะนำพื้นที่การโจมตีใหม่ๆ

ระยะที่ 4: การทดสอบความคงอยู่

Test whether attack effects persist beyond the initial interaction and can survive system resets.

การคงอยู่ของเซสชัน

  • การจัดการจะรอดจากการรีเฟรชเซสชันหรือไม่
  • สามารถระบุสถานะล่วงหน้าในเซสชันใหม่ได้หรือไม่
  • มีผลกระทบที่ค้างอยู่จากการแจ้งเตือนครั้งก่อนหรือไม่

การคงอยู่ของโมเดล

  • การโจมตีสามารถส่งผลต่อการอัปเดตโมเดลในอนาคตได้หรือไม่
  • การปรับแต่งอย่างละเอียดจะรักษาช่องโหว่ไว้หรือไม่
  • การโจมตีด้วยพิษจะถาวรหรือไม่

System Persistence

  • ช่องโหว่จะรอดจากการอัปเดตได้หรือไม่
  • มีกลไกลับๆ หรือไม่
  • มีการโจมตีเกิดขึ้นตลอดการใช้งานหรือไม่

เจาะลึกการใช้เครื่องมือ

Garak

เครื่องสแกนช่องโหว่ LLM โอเพ่นซอร์สของ NVIDIA

  • โพรบสำหรับ 40+ ประเภทช่องโหว่
  • การประเมินโมเดลอย่างต่อเนื่อง
  • การอัปเดตฐานข้อมูลช่องโหว่เป็นประจำ
  • การบูรณาการกับไปป์ไลน์ CI/CD
ดูบน GitHub →

PyRIT

เครื่องมือระบุความเสี่ยง Python ของ Microsoft

  • เฟรมเวิร์กทีม Red ที่ครอบคลุม
  • รองรับพื้นผิวการโจมตีหลายรูปแบบ
  • การสร้างการโจมตีอัตโนมัติ
  • การให้คะแนนและการประเมินผล
ดูบน GitHub →

Promptfoo

แพลตฟอร์มการทดสอบและประเมินผล LLM

  • เฟรมเวิร์กการทดสอบแบบทันที
  • การประเมินความปลอดภัย
  • การเปรียบเทียบประสิทธิภาพ
  • การเปรียบเทียบเวอร์ชัน
ดูเว็บไซต์ →

Rebuff

SDK การตรวจจับการแทรกทันที

  • การตรวจจับความพยายามในการฉีด
  • การป้องกันหลายชั้น
  • อัตราผลบวกลวงต่ำ
  • บูรณาการอย่างง่ายดาย
ดูบน GitHub →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

Pipeline Integration Points

1. Pre-Commit

  • การตรวจสอบพร้อมท์ในพื้นที่
  • การตรวจจับการแทรกตามรูปแบบ
  • การทดสอบเวิร์กสเตชันสำหรับนักพัฒนา

2. คำขอดึง

  • การสแกนช่องโหว่อัตโนมัติ
  • การเปรียบเทียบพื้นฐาน
  • การบังคับใช้ประตูรักษาความปลอดภัย

3. ก่อนการผลิต

  • การประเมินทีมสีแดงเต็มรูปแบบ
  • การทดสอบการถดถอย
  • การเปรียบเทียบประสิทธิภาพ

4. การผลิต

  • มีการตรวจสอบอย่างต่อเนื่อง
  • การตรวจจับความผิดปกติ
  • การบูรณาการการตอบสนองต่อเหตุการณ์

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

ดูความเสี่ยง

ความรุนแรง เกณฑ์ ตัวอย่าง
สำคัญ การเรียกใช้โค้ดจากระยะไกล การละเมิดข้อมูล การบุกรุกระบบ การแทรกทันทีเต็มรูปแบบที่นำไปสู่ ​​RCE
สูง การเข้าถึงโดยไม่ได้รับอนุญาต การเปิดเผยข้อมูลที่ละเอียดอ่อน การแยกข้อความแจ้งเตือนของระบบ
ปานกลาง การเลี่ยงนโยบาย การเข้าถึงข้อมูลที่จำกัด บายพาสตัวกรองเนื้อหา
ต่ำ การละเมิดนโยบายเล็กน้อย ให้ข้อมูล รูปแบบเอาต์พุตที่ไม่ได้ตั้งใจ

วิธีการประเมินผล

LLM-as-Judge

ใช้ AI เพื่อประเมินเอาต์พุต AI เพื่อความปลอดภัยและการปฏิบัติตามนโยบาย

การประเมินโดยมนุษย์

การตรวจสอบโดยผู้เชี่ยวชาญของเอาต์พุตสำหรับการประเมินความปลอดภัยที่เหมาะสมยิ่ง

การให้คะแนนอัตโนมัติ

การจับคู่รูปแบบและการประเมินตามกฎ

Red Team Metrics

ติดตามอัตราความสำเร็จในการหาประโยชน์ อัตราผลบวกลวง

สถาปัตยกรรมการแก้ไข

เลเยอร์การป้องกัน

1. การกรองอินพุต

  • การตรวจจับรูปแบบทันที
  • การรับรู้การเข้ารหัส
  • ขีดจำกัดความยาว
  • การจำกัดอัตรา

2. Guardrails

  • การตรวจสอบความถูกต้องเอาต์พุต
  • การกรองเนื้อหา
  • นโยบายการใช้เครื่องมือ
  • การควบคุมการเข้าถึง

3. การแข็งตัวของโมเดล

  • การปรับแต่งอย่างละเอียดเพื่อความปลอดภัย
  • การปรับปรุง RLHF
  • วิศวกรรมพร้อมท์ของระบบ
  • การปรับอุณหภูมิ/ด้านบน

4. การออกแบบระบบ

  • การแยกสิทธิ์
  • Human-in-the-loop
  • การบันทึกและการตรวจสอบ
  • การตอบสนองต่อเหตุการณ์

การทดสอบการตรวจสอบความถูกต้อง

หลังจากดำเนินการแก้ไขแล้ว ให้ทดสอบอีกครั้งเพื่อตรวจสอบ:

  • ช่องโหว่ดั้งเดิมไม่สามารถหาประโยชน์ได้อีกต่อไป
  • การแก้ไขไม่ทำให้เกิดช่องโหว่ใหม่ๆ
  • ฟังก์ชันการทำงานของระบบยังคงเหมือนเดิม
  • ประสิทธิภาพเป็นที่ยอมรับ
  • อัตราผลบวกลวงสามารถจัดการได้

เทมเพลตการรายงาน

บทสรุปสำหรับผู้บริหาร

  • ขอบเขตและวัตถุประสงค์
  • ภาพรวมการค้นพบที่สำคัญ
  • สรุปการจัดอันดับความเสี่ยง
  • คำแนะนำในลำดับความสำคัญ

รายละเอียดทางเทคนิค

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • ภาพหน้าจอและบันทึก
  • แผนภาพลูกโซ่การโจมตี
  • ข้อมูลโค้ด

คำแนะนำ

  • การแก้ไขระยะสั้น (ชนะอย่างรวดเร็ว)
  • การปรับปรุงระยะกลาง
  • การเปลี่ยนแปลงทางสถาปัตยกรรมในระยะยาว
  • ข้อกำหนดด้านทรัพยากร
  • ไทม์ไลน์

ภาคผนวก

  • ผลลัพธ์ของเครื่องมือ
  • กรณีทดสอบที่ใช้
  • ข้อมูลอ้างอิง
  • อภิธานศัพท์

การพิจารณาด้านจริยธรรม

การให้สิทธิ์

Always obtain explicit written permission before testing. Document scope boundaries.

ขอบเขตขอบเขต

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

การจัดการข้อมูล

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

การเปิดเผยข้อมูลอย่างมีความรับผิดชอบ

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

พร้อมเรียนรู้เพิ่มเติมแล้วหรือยัง?

สำรวจหัวข้อความปลอดภัยของ AI ต่อไป

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.