AI Red Teaming: Hướng dẫn phương pháp hoàn chỉnh
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • Thời gian đọc: ~15 phút
AI Red Teaming là gì?
Nhóm AI đỏ là phương pháp thực hiện các cuộc tấn công có chủ ý, có hệ thống vào hệ thống AI to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
Prompt Insert
Manipulating AI behavior through malicious inputs that override system instructions
Bẻ khóa
Bỏ qua các biện pháp an toàn để tạo ra nội dung bị cấm
Trích xuất dữ liệu
Trích xuất thông tin nhạy cảm từ dữ liệu đào tạo hoặc đầu ra
Thao tác mô hình
Thay đổi hành vi của mô hình thông qua các cuộc tấn công đầu độc hoặc tinh chỉnh
Tại sao AI Red Teaming lại quan trọng vào năm 2026
- 180% increase in LLM-related security incidents (2025)
- Nhóm AI Red của Microsoft đã đánh giá 100+ sản phẩm GenAI và nhận thấy rằng nhiều lỗi nghiêm trọng đến từ các kỹ thuật đơn giản
- Các hệ thống AI ngày càng xử lý tốt hơn dữ liệu nhạy cảm và các quyết định quan trọng
- Yêu cầu quy định (Đạo luật AI của EU) Thử nghiệm bảo mật AI dành cho các hệ thống có rủi ro cao
Xây dựng đội đỏ AI
Kỹ năng cần thiết
Kỹ năng kỹ thuật
- Hiểu biết về kiến trúc LLM
- Cập nhật kiến thức kỹ thuật
- Bảo mật ứng dụng web
- Thử nghiệm bảo mật API
- Scripting (Python, bash)
Kỹ năng đối nghịch
- Giải quyết vấn đề sáng tạo
- Nhận thức về kỹ thuật xã hội
- Tư duy tấn công đa phương thức
- Nghiên cứu và trinh sát
- Tài liệu và báo cáo
Kiến thức miền
- OWASP LLM Top 10
- Khung MITER ATLAS
- Các nguyên tắc cơ bản về AI/ML
- Đạo đức và tiết lộ có trách nhiệm
- Rủi ro theo ngành
Mô hình tương tác
| Mẫu | Mô tả | Ưu điểm | Nhược điểm |
|---|---|---|---|
| Nhóm nội bộ | Đội đỏ nội bộ chuyên trách | Kiến thức sâu về sản phẩm, thử nghiệm liên tục | Có thể bỏ lỡ quan điểm bên ngoài |
| Tư vấn bên ngoài | Công ty bảo mật bên thứ ba | Quan điểm mới, kỹ năng chuyên môn | Chi phí cao hơn, lộ trình học tập |
| Kết hợp | Hợp tác nội bộ và bên ngoài | Tốt nhất cả hai thế giới | Chi phí điều phối |
| Tự động | Thử nghiệm tích hợp CI/CD | Liên tục, có thể mở rộng | Giới hạn ở các mẫu đã biết |
Giai đoạn 1: Trinh sát & Khám phá
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 Bản đồ hệ thống
- Xem xét kiến trúc: Hiểu cách AI tích hợp với các hệ thống khác
- Luồng dữ liệu: Ánh xạ cách dữ liệu di chuyển trong hệ thống
- Điểm cuối API: Xác định tất cả các giao diện được hiển thị
- Tích hợp của bên thứ ba: Ghi lại các dịch vụ bên ngoài
- Vai trò của người dùng: Hiểu các cấp độ truy cập khác nhau
1.2 Khả năng thăm dò
- Các khả năng của mô hình: AI có thể làm gì?
- Quyền truy cập công cụ: Nó có thể gọi ra những chức năng gì?
- Truy cập dữ liệu: Nó có thể truy xuất thông tin gì?
- Kênh đầu ra: Nó giao tiếp như thế nào?
- Quản lý trạng thái: Nó xử lý các phiên như thế nào?
Các kỹ thuật chính
- Trích xuất lời nhắc hệ thống: Cố gắng tiết lộ hướng dẫn hệ thống thông qua lời nhắc cẩn thận
- Xác định dấu vân tay mẫu: Xác định mô hình cơ bản thông qua các mẫu hành vi
- Khám phá API: Tìm điểm cuối bị ẩn hoặc không có giấy tờ
- Xem xét tài liệu: Phân tích các tài liệu công khai để biết chi tiết triển khai
Giai đoạn 2: Lập bản đồ lỗ hổng
Identify and categorize potential attack vectors based on the discovered attack surface.
Phân loại tấn công
Prompt Insert
- Chèn trực tiếp
- Tiêm gián tiếp
- Thao túng nhiều lượt
- Tràn bối cảnh
Các cuộc tấn công bẻ khóa
- Nhập vai (DAN)
- Mạo danh ký tự
- Khung ủy quyền
- Bỏ qua mã hóa
Trích xuất dữ liệu
- Đào tạo phục hồi dữ liệu
- Rò rỉ lời nhắc hệ thống
- Quyền truy cập lịch sử hội thoại
- Tiếp xúc với khóa API
Từ chối dịch vụ
- Cạn kiệt tài nguyên
- Tràn bối cảnh
- Thao tác mô hình
- Hệ thống treo/sự cố
Lạm dụng công cụ/chức năng
- Cuộc gọi API trái phép
- Thao tác tham số
- Chuỗi chức năng
- Leo thang đặc quyền
Các cuộc tấn công đa phương thức
- Dựa trên hình ảnh tiêm
- thao túng âm thanh
- Khai thác đa phương thức
- Nội dung được nhúng
Tấn công mô hình
- Các ví dụ đối nghịch
- Đảo ngược mô hình
- Suy luận tư cách thành viên
- Trích xuất mô hình
Chuỗi cung ứng
- Đầu độc sự phụ thuộc
- Thỏa hiệp trung tâm mô hình
- Ngộ độc dữ liệu đào tạo
- Rủi ro của bên thứ ba
Giai đoạn 3: Khai thác
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
Phương pháp khai thác
- Nhiệm vụ ưu tiên: Xếp hạng các lỗ hổng theo mức độ nghiêm trọng và khả năng khai thác
- Bằng chứng về khái niệm: Phát triển các cách khai thác hiệu quả cho từng lỗ hổng
- Đánh giá tác động: Xác định hậu quả thực tế của việc khai thác thành công
- Xâu chuỗi: Kiểm tra xem có thể kết hợp nhiều lỗ hổng để có tác động lớn hơn không
- Tài liệu: Ghi lại tất cả các nỗ lực khai thác, thành công và thất bại
Bài học của Microsoft Red Team
Dựa trên việc thử nghiệm hơn 100 sản phẩm GenAI, Nhóm Đỏ AI của Microsoft đã tìm thấy:
- Các kỹ thuật đơn giản hoạt động: Nhiều lỗi nghiêm trọng đến từ các lời nhắc bẻ khóa cơ bản
- Các vấn đề tư duy ở cấp hệ thống: Các lỗ hổng thường trải rộng trên nhiều thành phần
- Sự sáng tạo của con người chiến thắng: Các công cụ tự động tìm ra các mẫu đã biết; con người tìm ra các cuộc tấn công mới
- Kiểm tra liên tục là cần thiết: Các tính năng mới giới thiệu các bề mặt tấn công mới
Giai đoạn 4: Kiểm tra tính bền bỉ
Test whether attack effects persist beyond the initial interaction and can survive system resets.
Tính bền vững của phiên
- Liệu thao tác có tồn tại khi làm mới phiên không?
- Trạng thái có thể được tải trước vào các phiên mới không?
- Có tác dụng kéo dài nào từ các lời nhắc trước đó không?
Tính kiên trì của mô hình
- Các cuộc tấn công có thể ảnh hưởng đến cập nhật mô hình trong tương lai không?
- Việc tinh chỉnh có bảo vệ các lỗ hổng không?
- Các cuộc tấn công bằng chất độc có phải là vĩnh viễn không?
Tính bền vững của hệ thống
- Liệu các lỗ hổng có thể tồn tại trong các bản cập nhật không?
- Có cơ chế cửa sau không?
- Các cuộc tấn công có tiếp diễn trong quá trình triển khai không?
Công cụ tìm hiểu sâu
Garak
Trình quét lỗ hổng LLM mã nguồn mở của NVIDIA
- Các thăm dò dành cho Hơn 40 loại lỗ hổng
- Đánh giá mô hình liên tục
- Cập nhật cơ sở dữ liệu về lỗ hổng bảo mật thường xuyên
- Tích hợp với quy trình CI/CD
PyRIT
Công cụ nhận dạng rủi ro Python của Microsoft
- Khung toàn diện của đội đỏ
- Hỗ trợ nhiều bề mặt tấn công
- Tạo cuộc tấn công tự động
- Tính điểm và đánh giá
Promptfoo
Nền tảng đánh giá và thử nghiệm LLM
- Khung kiểm tra nhanh chóng
- Đánh giá an toàn
- Đo chuẩn hiệu suất
- So sánh phiên bản
Rebuff
SDK phát hiện tiêm nhắc nhanh chóng
- Phát hiện các nỗ lực chèn
- Bảo vệ nhiều lớp
- Tỷ lệ dương tính giả thấp
- Dễ dàng tích hợp
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
Điểm tích hợp đường ống
1. Cam kết trước
- Xác thực nhanh cục bộ
- Phát hiện tiêm chích dựa trên mẫu
- Thử nghiệm máy trạm dành cho nhà phát triển
2. Yêu cầu kéo
- Tự động quét lỗ hổng
- So sánh cơ bản
- Thực thi cổng bảo mật
3. Tiền sản xuất
- Đánh giá đầy đủ của nhóm đỏ
- Kiểm tra hồi quy
- Đo chuẩn hiệu suất
4. Sản xuất
- Giám sát liên tục
- Phát hiện bất thường
- Tích hợp ứng phó sự cố
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
Khung xếp hạng mức độ nghiêm trọng
| Mức độ nghiêm trọng | Tiêu chí | Ví dụ |
|---|---|---|
| Quan trọng | Thực thi mã từ xa, vi phạm dữ liệu, thỏa hiệp hệ thống | Chưa đưa vào đầy đủ thông tin dẫn đến RCE |
| Cao | Truy cập trái phép, hiển thị dữ liệu nhạy cảm | Trích xuất lời nhắc của hệ thống |
| Trung bình | Bỏ qua chính sách, truy cập dữ liệu hạn chế | Bỏ qua bộ lọc nội dung |
| Thấp | Vi phạm chính sách nhỏ, cung cấp thông tin | Định dạng đầu ra ngoài ý muốn |
Phương pháp đánh giá
LLM-as-Judge
Sử dụng AI để đánh giá kết quả đầu ra AI để đảm bảo an toàn và tuân thủ chính sách
Đánh giá con người
Đánh giá của chuyên gia về kết quả đầu ra để đánh giá bảo mật theo nhiều sắc thái
Tính điểm tự động
So khớp mẫu và đánh giá dựa trên quy tắc
Số liệu của Red Team
Theo dõi tỷ lệ khai thác thành công, tỷ lệ dương tính giả
Kiến trúc khắc phục
Các lớp phòng thủ
1. Lọc đầu vào
- Phát hiện mẫu nhắc nhở
- Nhận dạng mã hóa
- Giới hạn độ dài
- Giới hạn tỷ lệ
2. Guardrails
- Xác thực đầu ra
- Lọc nội dung
- Chính sách sử dụng công cụ
- Kiểm soát quyền truy cập
3. Tăng cường mô hình
- Tinh chỉnh để đảm bảo an toàn
- Các cải tiến RLHF
- Kỹ thuật nhắc nhở hệ thống
- Điều chỉnh nhiệt độ/top-p
4. Thiết kế hệ thống
- Tách đặc quyền
- Con người trong vòng lặp
- Ghi nhật ký và giám sát
- Phản hồi sự cố
Kiểm tra xác thực
Sau khi triển khai các bản sửa lỗi, hãy kiểm tra lại để xác minh:
- Các lỗ hổng ban đầu không còn có thể khai thác được nữa
- Các bản sửa lỗi không gây ra lỗ hổng mới
- Chức năng hệ thống vẫn còn nguyên
- Hiệu suất chấp nhận được
- Tỷ lệ dương tính giả có thể quản lý được
Mẫu báo cáo
Tóm tắt điều hành
- Phạm vi và mục tiêu
- Tổng quan về các phát hiện chính
- Tóm tắt xếp hạng rủi ro
- Đề xuất ưu tiên
Chi tiết kỹ thuật
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- Ảnh chụp màn hình và nhật ký
- Sơ đồ chuỗi tấn công
- Đoạn mã
Đề xuất
- Sửa lỗi ngắn hạn (thắng nhanh)
- Cải tiến trung hạn
- Thay đổi kiến trúc dài hạn
- Yêu cầu tài nguyên
- Dòng thời gian
Phụ lục
- Đầu ra của công cụ
- Các trường hợp thử nghiệm được sử dụng
- Tài liệu tham khảo
- Bảng thuật ngữ
Cân nhắc đạo đức
Ủy quyền
Always obtain explicit written permission before testing. Document scope boundaries.
Ranh giới phạm vi
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
Xử lý dữ liệu
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
Tiết lộ có trách nhiệm
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
Tài nguyên liên quan
Sẵn sàng tìm hiểu thêm?
Tiếp tục khám phá các chủ đề bảo mật AI.