OWASP Top 10 for LLM Applications 2025/2026
The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes
Nhận thức về rủi ro nghiêm trọng
Tính năng tiêm nhắc nhở vẫn là lỗ hổng số 1. Xem Hướng dẫn tiêm nhắc nhở toàn diện của chúng tôi →
OWASP LLM Top 10 2026: What's Changing
The 2025 version is still the active standard, but the 2026 draft introduces significant changes:
- NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
- NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
- NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
- Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
- Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks
Prompt Insert
Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.
Các loại tấn công
- Tiêm trực tiếp: Lời nhắc độc hại của người dùng ghi đè hướng dẫn hệ thống
- Indirect Injection: Hidden instructions in external documents, web content, or API responses
- Thao tác bối cảnh: Khai thác bối cảnh hội thoại để thay đổi hành vi
- Các cuộc tấn công bẻ khóa: Vượt qua các bộ lọc an toàn thông qua lời nhắc sáng tạo
Ví dụ về tấn công
Ignore previous instructions and...Văn bản được nhúng trong các ký tự unicode vô hìnhTăng nhắc nhở thông qua XSS được lưu trữ trong nội dung webDAN (Do Anything Now) style jailbreaks
Chiến lược giảm thiểu
- Thực hiện xác thực và vệ sinh đầu vào nghiêm ngặt
- Sử dụng phân tách đặc quyền giữa thông tin đầu vào của người dùng và lời nhắc hệ thống
- Áp dụng lọc đầu ra trước khi hiển thị kết quả
- Giám sát các kiểu chèn trong nhật ký
- Triển khai biện pháp bảo vệ chuyên sâu với nhiều lớp bảo mật
Tiết lộ thông tin nhạy cảm
LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.
Các loại tấn công
- Trích xuất dữ liệu đào tạo: Khôi phục dữ liệu nhạy cảm từ bộ nhớ mô hình
- Rò rỉ PII: Tiết lộ thông tin nhận dạng cá nhân
- Tiết lộ khóa/thông tin xác thực API: Tiết lộ bí mật trong phản hồi
- Tiết lộ logic kinh doanh: Lộ các thuật toán hoặc quy trình độc quyền
Ví dụ về tấn công
Trích xuất địa chỉ email thông qua lời nhắc cụ thểLộ thông tin xác thực SQL trong thông báo lỗiTiết lộ PII của khách hàng từ dữ liệu đào tạoLộ lời nhắc của hệ thống nội bộ
Chiến lược giảm thiểu
- Triển khai lọc đầu vào/đầu ra mạnh mẽ
- Thực thi quy trình dọn dẹp dữ liệu
- Áp dụng chính sách chọn không tham gia của người dùng đối với việc sử dụng dữ liệu
- Sử dụng các kỹ thuật bảo mật khác biệt
- Hạn chế quyền truy cập và khả năng hiển thị lời nhắc của hệ thống
Các lỗ hổng trong chuỗi cung ứng
Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.
Các loại tấn công
- Xáo trộn mô hình: Các mô hình được đào tạo trước đã bị xâm phạm
- Lỗ hổng phụ thuộc PyPI/npm: Thư viện không an toàn
- Dữ liệu tinh chỉnh độc hại: Bộ dữ liệu đào tạo bị nhiễm độc
- Nhà cung cấp API bị xâm phạm: Dịch vụ LLM không đáng tin cậy
Ví dụ về tấn công
Trọng lượng mô hình cửa sau từ nguồn không đáng tin cậyKhai thác thư viện máy biến áp dễ bị tổn thươngDữ liệu đào tạo bị nhiễm độc với trình kích hoạt ẩnKho lưu trữ tài liệu RAG bị xâm phạm
Chiến lược giảm thiểu
- Xác minh tính toàn vẹn của mô hình thông qua tổng kiểm tra và chữ ký
- Duy trì SBOM (Danh sách vật liệu phần mềm)
- Sử dụng các trung tâm mô hình đáng tin cậy và xác minh nguồn gốc
- Quét các phần phụ thuộc để tìm các lỗ hổng đã biết
- Triển khai quản lý vòng đời mô hình
Ngộ độc dữ liệu và mô hình
Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.
Các loại tấn công
- Ngộ độc dữ liệu đào tạo: Làm hỏng dữ liệu đào tạo mô hình
- Tinh chỉnh ngộ độc: Tiêm các cửa hậu thông qua tinh chỉnh
- Ngộ độc RAG: Làm ô nhiễm cơ sở kiến thức truy xuất
- Thao tác nhúng: Làm hỏng cơ sở dữ liệu vectơ
Ví dụ về tấn công
Chèn các ví dụ sai lệch để thay đổi hành vi của mô hìnhTạo trình kích hoạt cửa sau trong dữ liệu đào tạoĐầu độc các tập dữ liệu công khai được sử dụng để đào tạoĐưa thông tin sai lệch vào tài liệu RAG
Chiến lược giảm thiểu
- Xác minh nguồn gốc dữ liệu và tính toàn vẹn của chuỗi cung ứng
- Thực hiện xác thực dữ liệu và phát hiện sự bất thường
- Sử dụng quy trình vệ sinh dữ liệu
- Áp dụng các biện pháp bảo vệ tinh chỉnh mạnh mẽ
- Giám sát sự trôi dạt hành vi của mô hình
Xử lý đầu ra không đúng
Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.
Các loại tấn công
- XSS thông qua đầu ra LLM: Tập lệnh chéo trang từ phản hồi mô hình
- Chèn SQL: Các truy vấn độc hại được tạo bởi LLM
- In lệnh: LLM tạo ra các lệnh hệ thống không an toàn
- Truyền tải đường dẫn: LLM tiết lộ hoặc truy cập trái phép. đường dẫn
Ví dụ về tấn công
LLM tạo JavaScript thực thi trong trình duyệtMô hình xuất ra các truy vấn SQL độc hạiTạo mã bao gồm các lệnh gọi hệ thống không an toànTiết lộ đường dẫn tệp trong các phản hồi
Chiến lược giảm thiểu
- Triển khai xác thực và dọn dẹp đầu ra
- Sử dụng tính năng lọc nội dung nhận biết ngữ cảnh
- Áp dụng các biện pháp kiểm soát bảo mật tương tự như đầu vào của người dùng
- Kết quả đầu ra LLM của Sandbox trước khi sử dụng tiếp theo
- Bật chế độ mã hóa an toàn khi tạo mã
Đại lý quá mức
Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.
Các loại tấn công
- Quyền truy cập chức năng không giới hạn: Quyền API quá mức
- Hành động tự trị: Thực hiện các hành động mà không có sự chấp thuận của con người
- Lạm dụng công cụ: Khai thác các công cụ bên ngoài tích hợp
- Thao tác chuỗi suy nghĩ: Thay đổi quy trình lý luận
Ví dụ về tấn công
LLM với quyền truy cập API của quản trị viên thực hiện các thay đổi trái phépTự động thực hiện các giao dịch tài chínhXóa tài nguyên mà không cần xác nhậnThao tác dữ liệu người dùng mà không có sự đồng ý
Chiến lược giảm thiểu
- Triển khai các biện pháp kiểm soát truy cập đặc quyền tối thiểu
- Yêu cầu con người trong vòng lặp thực hiện các hành động quan trọng
- Áp dụng giới hạn tốc độ cho các hoạt động nhạy cảm
- Ghi nhật ký và giám sát tất cả các hành động tự động
- Sử dụng các giới hạn phạm vi khi truy cập công cụ
Rò rỉ lời nhắc hệ thống
Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.
Các loại tấn công
- Trích xuất lời nhắc trực tiếp: Kỹ thuật xã hội để hiển thị lời nhắc
- Tràn bối cảnh: Kỹ thuật tràn để hiển thị thông báo hệ thống
- Khai thác vai trò: Lừa LLM tiết lộ hướng dẫn
- Rò rỉ nhật ký: Lộ lời nhắc trong nhật ký hoặc lỗi
Ví dụ về tấn công
Yêu cầu LLM lặp lại 'văn bản trước đó' để trích xuất lời nhắc hệ thốngSử dụng tính năng tràn cửa sổ ngữ cảnh để bỏ qua phân tích cú pháp hướng dẫnNhắc nhở ghi đè vai trò hệ thốngTìm lời nhắc trong nhật ký ứng dụng
Chiến lược giảm thiểu
- Làm xáo trộn các lời nhắc của hệ thống nếu có thể
- Triển khai các kỹ thuật cách ly nhanh chóng
- Sử dụng quy trình xử lý riêng biệt cho các hướng dẫn nhạy cảm
- Giám sát các nỗ lực trích xuất nhanh chóng
- Áp dụng tính năng lọc nhật ký nghiêm ngặt
Điểm yếu của Vector và Nhúng
Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.
Các loại tấn công
- Chèn RAG: Nội dung độc hại trong tài liệu được truy xuất
- Thỏa hiệp Vector DB: Tấn công lưu trữ vectơ
- Trích xuất nhúng: Đánh cắp các biểu diễn nhúng
- Thao tác bối cảnh: Làm hỏng kết quả truy xuất
Ví dụ về tấn công
Các tài liệu bị nhiễm độc đang được truy xuất dưới dạng kết quả hàng đầuCơ sở dữ liệu vectơ truy cập trái phépTrích xuất dữ liệu đào tạo từ các phần nhúngThao tác truy xuất thông qua các cuộc tấn công nhúng
Chiến lược giảm thiểu
- Xác thực và vệ sinh tất cả tài liệu đầu vào RAG
- Triển khai các biện pháp kiểm soát truy cập cơ sở dữ liệu vector
- Sử dụng mã hóa nhúng nếu có
- Áp dụng xếp hạng lại bằng các bộ lọc bảo mật
- Giám sát việc truy xuất các điểm bất thường
Thông tin sai lệch
LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.
Các loại tấn công
- Ảo giác: Tự tin nhưng sai sự thật kết quả đầu ra
- Lỗi thực tế: Thông tin không chính xác được trình bày dưới dạng thực tế
- Khuếch đại sai lệch: Củng cố các thành kiến hiện có
- Thao túng: Cố tình tạo ra kết quả sai lệch
Ví dụ về tấn công
Trích dẫn các tài liệu nghiên cứu không tồn tạiCung cấp lời khuyên y tế không chính xácTạo ra hoạt động tuyển dụng thiên vị khuyến nghịTạo tin tức hoặc đánh giá giả mạo
Chiến lược giảm thiểu
- Triển khai các quy trình kiểm tra thực tế
- Sử dụng tính điểm tin cậy và ước tính độ không chắc chắn
- Áp dụng xác minh nguồn cho các kết quả đầu ra quan trọng
- Thêm nguồn gốc nội dung và phân bổ
- Gắn nhãn rõ ràng cho nội dung do AI tạo ra
Mức tiêu thụ không giới hạn
Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.
Các loại tấn công
- Lạm dụng tỷ lệ API: Cuộc gọi API quá mức làm cạn kiệt hạn ngạch
- Cạn kiệt tài nguyên: Tối đa hóa tài nguyên điện toán
- Khai thác chi phí: Lạm dụng trả tiền cho mỗi mã thông báo dẫn đến tính phí
- Tấn công suy luận: Trích xuất mô hình thông qua các truy vấn quá mức
Ví dụ về tấn công
Các cuộc tấn công tự động tiêu tốn toàn bộ hạn ngạch APISpam có độ dài tối đa gây ra tình trạng cạn kiệt điện toánTrích xuất mô hình thông qua hàng triệu truy vấnVòng lặp nhắc nhở đệ quy tiêu tốn tài nguyên
Chiến lược giảm thiểu
- Triển khai hạn ngạch và giới hạn tỷ lệ nghiêm ngặt
- Thêm giới hạn mã thông báo đầu vào/đầu ra
- Giám sát các kiểu sử dụng để phát hiện các điểm bất thường
- Sử dụng các biện pháp kiểm soát chi phí và cảnh báo ngân sách
- Áp dụng các biện pháp kiểm soát thời gian chờ cho các hoạt động kéo dài
Khung kiểm tra OWASP
Thực hiện theo phương pháp có cấu trúc này để kiểm tra từng lỗ hổng:
1. Trinh sát
- Kiến trúc hệ thống bản đồ và luồng dữ liệu
- Xác định các điểm đầu vào và giao diện API
- Các công cụ và plugin tích hợp tài liệu
- Xem lại lời nhắc và cấu hình hệ thống
2. Bản đồ lỗ hổng
- Kiểm tra từng danh mục OWASP một cách có hệ thống
- Bề mặt tấn công tài liệu và điểm truy nhập
- Xác định các cơ chế bảo vệ tại chỗ
- Các phần phụ thuộc của bản đồ và dịch vụ của bên thứ ba
3. Khai thác
- Tiến hành các cuộc tấn công bằng chứng khái niệm
- Khả năng khai thác và tác động của tài liệu
- Thử nghiệm chuỗi nhiều lỗ hổng
- Đánh giá tính khả thi của cuộc tấn công trong thế giới thực
4. Báo cáo
- Ưu tiên phát hiện theo mức độ rủi ro
- Cung cấp các đề xuất khắc phục
- Bao gồm mã bằng chứng về khái niệm
- Đề xuất cải tiến phòng thủ
Tài nguyên chính thức
- Trang chính thức của OWASP LLM Top 10 2025
- Tải xuống OWASP LLM Top 10 2025 PDF
- Dự án bảo mật OWASP LLM
- OWASP Agentic AI Security
Nguồn & Thống kê
- Báo cáo trạng thái bảo mật AI của OWASP 2025 - 73% of organizations have critical AI vulnerabilities
- An ninh mạng Thụy Sĩ - Thống kê bảo mật AI 2026 - Hơn 40 số liệu thống kê được tuyển chọn
- Báo cáo về mối đe dọa toàn cầu của CrowdStrike 2026 - AI-enabled attacks up 89%
- Darktrace Trạng thái an ninh mạng AI 2026 - Khảo sát hơn 1.500 nhà lãnh đạo bảo mật
- Chỉ số thông minh về mối đe dọa của IBM X-Force 2026 - Các cuộc tấn công do AI tăng tốc