AI Hacking
Tài nguyên bảo mật AI

Bảo mật AI đa phương thức

Security guide for vision models, audio systems, and cross-modal attack vectors - Updated August 2026

85%
Các mô hình tầm nhìn dễ bị tấn công bởi các bản vá đối nghịch
(Nghiên cứu ngành)
$12B+
Các tổn thất do gian lận deepfake dự kiến ​​vào năm 2027
(Deloitte 2025)
135%
Gia tăng kỹ thuật xã hội được AI hỗ trợ
(IBM X-Force 2025)
👁️

Bảo mật AI đa phương thức

Multi-modal AI systems process text, images, audio, and video simultaneously. This creates unique attack surfaces where data in one modality can influence behavior in another. Learn about emerging threats and defenses for these complex systems.

📸 Tấn công mô hình tầm nhìn

Các bản vá đối thủ

Small, crafted perturbations that fool image classifiers when printed or displayed. Can cause autonomous vehicles to misidentify stop signs, or bypass content filters.

Ví dụ: Adding a small sticker pattern to a stop sign causes AI to classify it as "speed limit 45"
Mức độ nghiêm trọng: Cao | CVSS: 7.5

Tiêm nhanh trong hình ảnh

Hidden text embedded in images that is invisible to humans but extracted by OCR and processed by vision-language models.

Ví dụ: White text on white background, or text hidden in image metadata that gets processed
Mức độ nghiêm trọng: Trung bình | CVSS: 6.8

Lọc dữ liệu thông qua xử lý hình ảnh

Vision models can be manipulated to encode and transmit sensitive information through image pixel patterns.

Ví dụ: Model outputs steganographic data in image descriptions containing system prompts
Mức độ nghiêm trọng: Trung bình | CVSS: 5.3

Ngộ độc dữ liệu đào tạo

Corrupted image datasets used to train vision models can introduce backdoors or alter model behavior.

Ví dụ: Poisoned images with specific triggers cause misclassification when triggered
Mức độ nghiêm trọng: Trung bình | CVSS: 6.2

🔒 Phòng thủ mô hình tầm nhìn

  • Xử lý trước đầu vào: Áp dụng khử nhiễu, nén JPEG hoặc đào tạo đối thủ
  • Đào tạo đối nghịch: Đưa các ví dụ đối nghịch vào dữ liệu đào tạo
  • Chuẩn hóa pixel: Kẹp các giá trị để loại bỏ những nhiễu loạn không thể nhận thấy
  • Tường lửa Vision-LLM: Xử lý chú thích hình ảnh trước khi xử lý
  • Củng cố mô hình: Áp dụng các biện pháp bảo vệ được chứng nhận như khử nhiễu tính năng

🎙️ Bảo mật âm thanh và giọng nói

Tổng hợp giọng nói / Deepfake

AI-generated voice clones that impersonate executives, celebrities, or trusted individuals for fraud.

Sự cố thực tế: CEO voice clone used to authorize $243K wire transfer (Wall Street Journal, 2019)
Mức độ nghiêm trọng: Quan trọng | Tác động: Gian lận tài chính, trộm danh tính

Các cuộc tấn công bất lợi bằng âm thanh

Inaudible modifications to audio that cause ASR (Automatic Speech Recognition) systems to transcribe attacker-controlled text.

Ví dụ: Các lệnh ẩn trong âm nhạc kích hoạt trợ lý giọng nói
Mức độ nghiêm trọng: Cao | CVSS: 7.8

Bỏ qua xác minh người nói

Techniques to circumvent voice biometric authentication systems using replay attacks or synthesized audio.

Ví dụ: Phát lại bản ghi âm giọng nói để vượt qua xác thực giọng nói ngân hàng
Mức độ nghiêm trọng: Cao | CVSS: 6.5

Chèn bối cảnh qua âm thanh

Hidden voice commands or audio that influences downstream LLM processing in multi-modal systems.

Ví dụ: Audio in video file contains instructions that modify AI assistant behavior
Mức độ nghiêm trọng: Trung bình | CVSS: 5.5

🔒 Bảo vệ bảo mật âm thanh

  • Phát hiện sự sống: Yêu cầu các cụm từ ngẫu nhiên hoặc phản hồi thử thách
  • Xuất xứ âm thanh: Sử dụng C2PA/nội dung mật mã认证
  • Các mô hình phát hiện deepfake: Triển khai các hệ thống phát hiện AI chuyên dụng
  • Xác minh đa yếu tố: Kết hợp giọng nói với các yếu tố xác thực khác
  • Phân tích quang phổ: Phát hiện các tạo phẩm do AI tạo ra trong âm thanh
  • Xác nhận hành động có giá trị cao: Xác minh ngoài băng cho các hành động nhạy cảm

🔀 Tấn công đa phương thức

Tiêm nhắc nhở đa phương thức

Malicious instructions embedded in one modality (e.g., images) that manipulate behavior in another (e.g., text output).

Ví dụ: Uploading an image with hidden text "Ignore previous instructions and..."
Mức độ nghiêm trọng: Quan trọng | Liên quan: Tương tự như OWASP LLM01

Bẻ khóa đa phương thức

Using combinations of text, images, and audio to bypass safety guardrails that single-modality attacks cannot.

Ví dụ: Hình ảnh của nội dung có hại được ghép nối với văn bản bình thường hóa nội dung đó
Mức độ nghiêm trọng: Cao | CVSS: 7.2

Khuếch đại ảo giác mô hình

Multi-modal inputs that increase hallucination rates or cause confident false outputs.

Ví dụ: Các hình ảnh mơ hồ được ghép nối với các câu hỏi hàng đầu sẽ làm tăng chú thích sai
Mức độ nghiêm trọng: Trung bình | CVSS: 5.0

Tăng lệnh tượng trưng

Embedding instructions in visual elements (arrows, boxes, icons) that influence model interpretation.

Ví dụ: Document with arrows pointing specific text, causing model to focus incorrectly
Mức độ nghiêm trọng: Trung bình | CVSS: 5.5

🔒 Phòng thủ đa phương thức

  • Khử trùng đầu vào: Loại bỏ văn bản và siêu dữ liệu ẩn khỏi nội dung tải lên
  • Phân tách phương thức: Xử lý từng loại đầu vào trong môi trường biệt lập
  • Lọc đa phương thức: Phát hiện sự không nhất quán giữa các phương thức
  • Xác thực đầu ra: Xác minh kết quả đầu ra không mâu thuẫn với thông tin đầu vào
  • Lọc nội dung: Quét tất cả các phương thức để phát hiện vi phạm chính sách

🎬 Bảo mật video

Video Deepfakes

AI-generated or manipulated video content that depicts people saying/doing things they didn't.

Các trường hợp sử dụng: Gian lận điều hành, tin tức giả mạo, tống tiền, can thiệp bầu cử
Mức độ nghiêm trọng: Quan trọng | Tác động: Danh tiếng, tài chính, chính trị

Các cuộc tấn công Lip Sync

Manipulating video to sync fake audio with lip movements, enabling convincing misinformation.

Ví dụ: Chỉnh sửa đoạn phim tin tức để thêm các tuyên bố giả mạo phù hợp với cử động môi
Mức độ nghiêm trọng: Cao | CVSS: 6.8

Thao tác ở cấp khung

Inserting or removing specific frames in video to alter perceived events or inject content.

Ví dụ: Xóa khung camera an ninh hiển thị quyền truy cập trái phép
Mức độ nghiêm trọng: Trung bình | CVSS: 5.5

🔒 Bảo vệ tính toàn vẹn video

  • C2PA standard: Triển khai thông tin xác thực nội dung cho nguồn gốc video
  • Hình chìm mờ: Thêm hình mờ vô hình vào nội dung xác thực
  • Phát hiện deepfake: Sử dụng các mô hình phát hiện chuyên dụng trước khi xử lý
  • Phân tích khung: Phát hiện tạm thời sự không nhất quán
  • Ghi nhật ký chuỗi khối: Ghi lại hàm băm video để xác minh

🛡️ Chiến lược phòng thủ đa phương thức toàn diện

🔍 Lớp phát hiện

  • Các mô hình phát hiện deepfake
  • Trình phát hiện ví dụ đối nghịch
  • Phát hiện bất thường trên mỗi phương thức
  • Kiểm tra tính nhất quán giữa các phương thức

🧹 Lớp khử trùng

  • Loại bỏ văn bản ẩn khỏi hình ảnh
  • Xóa tính năng ẩn âm thanh
  • Chuẩn hóa các giá trị pixel
  • Lọc siêu dữ liệu được nhúng

⚖️ Lớp xác thực

  • Xác minh chéo dữ liệu đầu vào đa phương thức
  • Kiểm tra thông tin mâu thuẫn
  • Xác thực dựa trên các nguồn đáng tin cậy
  • Gắn cờ kết quả đầu ra không chắc chắn

📋 Danh sách kiểm tra bảo mật đa phương thức

  • Xử lý đầu vào: Vệ sinh tất cả hình ảnh, âm thanh và video do người dùng tải lên
  • Nội dung ẩn: Quét văn bản vô hình, kỹ thuật ghi mật mã và siêu dữ liệu
  • Phương thức chéo: Xác thực tính nhất quán giữa các loại đầu vào khác nhau
  • Lọc đầu ra: Kiểm tra tất cả các đầu ra xem có vi phạm an toàn không
  • Xác thực: Sử dụng xác minh đa yếu tố cho các hành động có giá trị cao
  • Xuất xứ: Triển khai thông tin xác thực nội dung/C2PA nếu có thể
  • Giám sát: Ghi nhật ký và giám sát các mẫu đa phương thức bất thường
  • Đào tạo: Bao gồm các ví dụ đa phương thức đối nghịch trong đào tạo mô hình
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.