AI Hacking
Tài nguyên bảo mật AI

AI Red Teaming: Hướng dẫn phương pháp hoàn chỉnh

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • Thời gian đọc: ~15 phút

AI Red Teaming là gì?

Nhóm AI đỏ là phương pháp thực hiện các cuộc tấn công có chủ ý, có hệ thống vào hệ thống AI to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

Prompt Insert

Manipulating AI behavior through malicious inputs that override system instructions

Bẻ khóa

Bỏ qua các biện pháp an toàn để tạo ra nội dung bị cấm

Trích xuất dữ liệu

Trích xuất thông tin nhạy cảm từ dữ liệu đào tạo hoặc đầu ra

Thao tác mô hình

Thay đổi hành vi của mô hình thông qua các cuộc tấn công đầu độc hoặc tinh chỉnh

Tại sao AI Red Teaming lại quan trọng vào năm 2026

  • 180% increase in LLM-related security incidents (2025)
  • Nhóm AI Red của Microsoft đã đánh giá 100+ sản ​​phẩm GenAI và nhận thấy rằng nhiều lỗi nghiêm trọng đến từ các kỹ thuật đơn giản
  • Các hệ thống AI ngày càng xử lý tốt hơn dữ liệu nhạy cảm và các quyết định quan trọng
  • Yêu cầu quy định (Đạo luật AI của EU) Thử nghiệm bảo mật AI dành cho các hệ thống có rủi ro cao

Xây dựng đội đỏ AI

Kỹ năng cần thiết

Kỹ năng kỹ thuật

  • Hiểu biết về kiến ​​trúc LLM
  • Cập nhật kiến ​​thức kỹ thuật
  • Bảo mật ứng dụng web
  • Thử nghiệm bảo mật API
  • Scripting (Python, bash)

Kỹ năng đối nghịch

  • Giải quyết vấn đề sáng tạo
  • Nhận thức về kỹ thuật xã hội
  • Tư duy tấn công đa phương thức
  • Nghiên cứu và trinh sát
  • Tài liệu và báo cáo

Kiến thức miền

  • OWASP LLM Top 10
  • Khung MITER ATLAS
  • Các nguyên tắc cơ bản về AI/ML
  • Đạo đức và tiết lộ có trách nhiệm
  • Rủi ro theo ngành

Mô hình tương tác

Mẫu Mô tả Ưu điểm Nhược điểm
Nhóm nội bộ Đội đỏ nội bộ chuyên trách Kiến thức sâu về sản phẩm, thử nghiệm liên tục Có thể bỏ lỡ quan điểm bên ngoài
Tư vấn bên ngoài Công ty bảo mật bên thứ ba Quan điểm mới, kỹ năng chuyên môn Chi phí cao hơn, lộ trình học tập
Kết hợp Hợp tác nội bộ và bên ngoài Tốt nhất cả hai thế giới Chi phí điều phối
Tự động Thử nghiệm tích hợp CI/CD Liên tục, có thể mở rộng Giới hạn ở các mẫu đã biết

Giai đoạn 1: Trinh sát & Khám phá

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 Bản đồ hệ thống

  • Xem xét kiến ​​trúc: Hiểu cách AI tích hợp với các hệ thống khác
  • Luồng dữ liệu: Ánh xạ cách dữ liệu di chuyển trong hệ thống
  • Điểm cuối API: Xác định tất cả các giao diện được hiển thị
  • Tích hợp của bên thứ ba: Ghi lại các dịch vụ bên ngoài
  • Vai trò của người dùng: Hiểu các cấp độ truy cập khác nhau

1.2 Khả năng thăm dò

  • Các khả năng của mô hình: AI có thể làm gì?
  • Quyền truy cập công cụ: Nó có thể gọi ra những chức năng gì?
  • Truy cập dữ liệu: Nó có thể truy xuất thông tin gì?
  • Kênh đầu ra: Nó giao tiếp như thế nào?
  • Quản lý trạng thái: Nó xử lý các phiên như thế nào?

Các kỹ thuật chính

  • Trích xuất lời nhắc hệ thống: Cố gắng tiết lộ hướng dẫn hệ thống thông qua lời nhắc cẩn thận
  • Xác định dấu vân tay mẫu: Xác định mô hình cơ bản thông qua các mẫu hành vi
  • Khám phá API: Tìm điểm cuối bị ẩn hoặc không có giấy tờ
  • Xem xét tài liệu: Phân tích các tài liệu công khai để biết chi tiết triển khai

Giai đoạn 2: Lập bản đồ lỗ hổng

Identify and categorize potential attack vectors based on the discovered attack surface.

Phân loại tấn công

Prompt Insert

  • Chèn trực tiếp
  • Tiêm gián tiếp
  • Thao túng nhiều lượt
  • Tràn bối cảnh

Các cuộc tấn công bẻ khóa

  • Nhập vai (DAN)
  • Mạo danh ký tự
  • Khung ủy quyền
  • Bỏ qua mã hóa

Trích xuất dữ liệu

  • Đào tạo phục hồi dữ liệu
  • Rò rỉ lời nhắc hệ thống
  • Quyền truy cập lịch sử hội thoại
  • Tiếp xúc với khóa API

Từ chối dịch vụ

  • Cạn kiệt tài nguyên
  • Tràn bối cảnh
  • Thao tác mô hình
  • Hệ thống treo/sự cố

Lạm dụng công cụ/chức năng

  • Cuộc gọi API trái phép
  • Thao tác tham số
  • Chuỗi chức năng
  • Leo thang đặc quyền

Các cuộc tấn công đa phương thức

  • Dựa trên hình ảnh tiêm
  • thao túng âm thanh
  • Khai thác đa phương thức
  • Nội dung được nhúng

Tấn công mô hình

  • Các ví dụ đối nghịch
  • Đảo ngược mô hình
  • Suy luận tư cách thành viên
  • Trích xuất mô hình

Chuỗi cung ứng

  • Đầu độc sự phụ thuộc
  • Thỏa hiệp trung tâm mô hình
  • Ngộ độc dữ liệu đào tạo
  • Rủi ro của bên thứ ba

Giai đoạn 3: Khai thác

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

Phương pháp khai thác

  1. Nhiệm vụ ưu tiên: Xếp hạng các lỗ hổng theo mức độ nghiêm trọng và khả năng khai thác
  2. Bằng chứng về khái niệm: Phát triển các cách khai thác hiệu quả cho từng lỗ hổng
  3. Đánh giá tác động: Xác định hậu quả thực tế của việc khai thác thành công
  4. Xâu chuỗi: Kiểm tra xem có thể kết hợp nhiều lỗ hổng để có tác động lớn hơn không
  5. Tài liệu: Ghi lại tất cả các nỗ lực khai thác, thành công và thất bại

Bài học của Microsoft Red Team

Dựa trên việc thử nghiệm hơn 100 sản phẩm GenAI, Nhóm Đỏ AI của Microsoft đã tìm thấy:

  • Các kỹ thuật đơn giản hoạt động: Nhiều lỗi nghiêm trọng đến từ các lời nhắc bẻ khóa cơ bản
  • Các vấn đề tư duy ở cấp hệ thống: Các lỗ hổng thường trải rộng trên nhiều thành phần
  • Sự sáng tạo của con người chiến thắng: Các công cụ tự động tìm ra các mẫu đã biết; con người tìm ra các cuộc tấn công mới
  • Kiểm tra liên tục là cần thiết: Các tính năng mới giới thiệu các bề mặt tấn công mới

Giai đoạn 4: Kiểm tra tính bền bỉ

Test whether attack effects persist beyond the initial interaction and can survive system resets.

Tính bền vững của phiên

  • Liệu thao tác có tồn tại khi làm mới phiên không?
  • Trạng thái có thể được tải trước vào các phiên mới không?
  • Có tác dụng kéo dài nào từ các lời nhắc trước đó không?

Tính kiên trì của mô hình

  • Các cuộc tấn công có thể ảnh hưởng đến cập nhật mô hình trong tương lai không?
  • Việc tinh chỉnh có bảo vệ các lỗ hổng không?
  • Các cuộc tấn công bằng chất độc có phải là vĩnh viễn không?

Tính bền vững của hệ thống

  • Liệu các lỗ hổng có thể tồn tại trong các bản cập nhật không?
  • Có cơ chế cửa sau không?
  • Các cuộc tấn công có tiếp diễn trong quá trình triển khai không?

Công cụ tìm hiểu sâu

Garak

Trình quét lỗ hổng LLM mã nguồn mở của NVIDIA

  • Các thăm dò dành cho Hơn 40 loại lỗ hổng
  • Đánh giá mô hình liên tục
  • Cập nhật cơ sở dữ liệu về lỗ hổng bảo mật thường xuyên
  • Tích hợp với quy trình CI/CD
Xem trên GitHub →

PyRIT

Công cụ nhận dạng rủi ro Python của Microsoft

  • Khung toàn diện của đội đỏ
  • Hỗ trợ nhiều bề mặt tấn công
  • Tạo cuộc tấn công tự động
  • Tính điểm và đánh giá
Xem trên GitHub →

Promptfoo

Nền tảng đánh giá và thử nghiệm LLM

  • Khung kiểm tra nhanh chóng
  • Đánh giá an toàn
  • Đo chuẩn hiệu suất
  • So sánh phiên bản
Xem trang web →

Rebuff

SDK phát hiện tiêm nhắc nhanh chóng

  • Phát hiện các nỗ lực chèn
  • Bảo vệ nhiều lớp
  • Tỷ lệ dương tính giả thấp
  • Dễ dàng tích hợp
Xem trên GitHub →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

Điểm tích hợp đường ống

1. Cam kết trước

  • Xác thực nhanh cục bộ
  • Phát hiện tiêm chích dựa trên mẫu
  • Thử nghiệm máy trạm dành cho nhà phát triển

2. Yêu cầu kéo

  • Tự động quét lỗ hổng
  • So sánh cơ bản
  • Thực thi cổng bảo mật

3. Tiền sản xuất

  • Đánh giá đầy đủ của nhóm đỏ
  • Kiểm tra hồi quy
  • Đo chuẩn hiệu suất

4. Sản xuất

  • Giám sát liên tục
  • Phát hiện bất thường
  • Tích hợp ứng phó sự cố

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

Khung xếp hạng mức độ nghiêm trọng

Mức độ nghiêm trọng Tiêu chí Ví dụ
Quan trọng Thực thi mã từ xa, vi phạm dữ liệu, thỏa hiệp hệ thống Chưa đưa vào đầy đủ thông tin dẫn đến RCE
Cao Truy cập trái phép, hiển thị dữ liệu nhạy cảm Trích xuất lời nhắc của hệ thống
Trung bình Bỏ qua chính sách, truy cập dữ liệu hạn chế Bỏ qua bộ lọc nội dung
Thấp Vi phạm chính sách nhỏ, cung cấp thông tin Định dạng đầu ra ngoài ý muốn

Phương pháp đánh giá

LLM-as-Judge

Sử dụng AI để đánh giá kết quả đầu ra AI để đảm bảo an toàn và tuân thủ chính sách

Đánh giá con người

Đánh giá của chuyên gia về kết quả đầu ra để đánh giá bảo mật theo nhiều sắc thái

Tính điểm tự động

So khớp mẫu và đánh giá dựa trên quy tắc

Số liệu của Red Team

Theo dõi tỷ lệ khai thác thành công, tỷ lệ dương tính giả

Kiến trúc khắc phục

Các lớp phòng thủ

1. Lọc đầu vào

  • Phát hiện mẫu nhắc nhở
  • Nhận dạng mã hóa
  • Giới hạn độ dài
  • Giới hạn tỷ lệ

2. Guardrails

  • Xác thực đầu ra
  • Lọc nội dung
  • Chính sách sử dụng công cụ
  • Kiểm soát quyền truy cập

3. Tăng cường mô hình

  • Tinh chỉnh để đảm bảo an toàn
  • Các cải tiến RLHF
  • Kỹ thuật nhắc nhở hệ thống
  • Điều chỉnh nhiệt độ/top-p

4. Thiết kế hệ thống

  • Tách đặc quyền
  • Con người trong vòng lặp
  • Ghi nhật ký và giám sát
  • Phản hồi sự cố

Kiểm tra xác thực

Sau khi triển khai các bản sửa lỗi, hãy kiểm tra lại để xác minh:

  • Các lỗ hổng ban đầu không còn có thể khai thác được nữa
  • Các bản sửa lỗi không gây ra lỗ hổng mới
  • Chức năng hệ thống vẫn còn nguyên
  • Hiệu suất chấp nhận được
  • Tỷ lệ dương tính giả có thể quản lý được

Mẫu báo cáo

Tóm tắt điều hành

  • Phạm vi và mục tiêu
  • Tổng quan về các phát hiện chính
  • Tóm tắt xếp hạng rủi ro
  • Đề xuất ưu tiên

Chi tiết kỹ thuật

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • Ảnh chụp màn hình và nhật ký
  • Sơ đồ chuỗi tấn công
  • Đoạn mã

Đề xuất

  • Sửa lỗi ngắn hạn (thắng nhanh)
  • Cải tiến trung hạn
  • Thay đổi kiến ​​trúc dài hạn
  • Yêu cầu tài nguyên
  • Dòng thời gian

Phụ lục

  • Đầu ra của công cụ
  • Các trường hợp thử nghiệm được sử dụng
  • Tài liệu tham khảo
  • Bảng thuật ngữ

Cân nhắc đạo đức

Ủy quyền

Always obtain explicit written permission before testing. Document scope boundaries.

Ranh giới phạm vi

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

Xử lý dữ liệu

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

Tiết lộ có trách nhiệm

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

Sẵn sàng tìm hiểu thêm?

Tiếp tục khám phá các chủ đề bảo mật AI.

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.