AI 해킹
AI 보안 리소스

OWASP Top 10 for LLM Applications 2025/2026

The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes

73%
AI 배포에는 심각한 취약점이 있습니다
(OWASP AI 보안 상태, 2025)
41%
엔터프라이즈 AI에 인증되지 않은 API가 있음
(CodeWall Research, 2025)
Virtually 100%
LLM 배포에서 활용 가능한 프롬프트 삽입
(OWASP LLM 상위 10, 2025)
⚠

중요한 위험 인식

프롬프트 삽입은 여전히 ​​#1 취약점입니다. 포괄적인 프롬프트 삽입 가이드 보기 →

🔮

OWASP LLM Top 10 2026: What's Changing

The 2025 version is still the active standard, but the 2026 draft introduces significant changes:

  • NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
  • NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
  • NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
  • Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
  • Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks

Track OWASP LLM Top 10 2026 progress →

LLM01

프롬프트 주입

Critical

Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.

공격 유형
  • 직접 주입: 시스템 지침을 무시하는 악의적인 사용자 프롬프트
  • Indirect Injection: Hidden instructions in external documents, web content, or API responses
  • 컨텍스트 조작: 대화 컨텍스트를 활용하여 행동 변경
  • 탈옥 공격: 창의적인 프롬프트를 통해 안전 필터 우회
공격 예
  • Ignore previous instructions and...
  • 보이지 않는 유니코드 문자에 포함된 텍스트
  • 웹 콘텐츠에 저장된 XSS를 통해 신속한 주입
  • DAN (Do Anything Now) style jailbreaks
완화 전략
  • 엄격한 입력 확인 및 삭제 구현
  • 사용자 입력과 시스템 간의 권한 분리 사용 프롬프트
  • 결과를 표시하기 전에 출력 필터링 적용
  • 로그의 주입 패턴 모니터링
  • 다중 보안 계층으로 심층 방어 구현
LLM02

민감한 정보 공개

Critical

LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.

공격 유형
  • 교육 데이터 추출: 모델 메모리에서 민감한 데이터 복구
  • PII 유출: 개인 식별 정보 노출
  • API 키/자격 증명 노출: 응답에서 비밀 공개
  • 비즈니스 논리 공개: 독점 알고리즘 또는 프로세스 노출
공격 예
  • 특정 프롬프트를 통해 이메일 주소 추출
  • 오류 메시지에서 SQL 자격 증명 공개
  • 훈련 데이터에서 고객 PII 공개
  • 내부 시스템 프롬프트 노출
완화 전략
  • 강력한 입력/출력 필터링 구현
  • 데이터 삭제 파이프라인 시행
  • 데이터 사용에 대한 사용자 옵트아웃 정책 적용
  • 차등 개인 정보 보호 기술 사용
  • 시스템 프롬프트 액세스 및 가시성 제한
LLM03

공급망 취약점

High

Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.

공격 유형
  • 모델 변조: 사전 학습된 모델 손상
  • PyPI/npm 종속성 취약성: 안전하지 않은 라이브러리
  • 악성 미세 조정 데이터: 중독된 훈련 데이터 세트
  • 침해된 API 제공자: 신뢰할 수 없는 LLM 서비스
공격 예
  • 신뢰할 수 없는 소스에서 백도어된 모델 가중치
  • 취약한 변환기 라이브러리 악용
  • 숨겨진 트리거가 있는 중독된 훈련 데이터
  • 손상된 RAG 문서 저장소
완화 전략
  • 체크섬 및 서명을 통해 모델 무결성 확인
  • SBOM(소프트웨어 BOM) 유지
  • 신뢰할 수 있는 모델 허브를 사용하고 출처 확인
  • 알려진 취약점에 대한 종속성 검사
  • 모델 수명주기 관리 구현
LLM04

데이터 및 모델 중독

High

Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.

공격 유형
  • 훈련 데이터 중독: 모델 훈련 데이터 손상
  • 미세 조정 중독: 미세 조정을 통한 백도어 주입
  • RAG 중독: 검색 지식 기반 오염
  • 임베딩 조작: 벡터 데이터베이스 손상
공격 예
  • 편향된 예를 삽입하여 모델 동작 변경
  • 훈련 데이터에서 백도어 트리거 생성
  • 훈련에 사용되는 공개 데이터세트 중독
  • RAG 문서에 잘못된 정보 삽입
완화 전략
  • 데이터 출처 및 공급망 무결성 확인
  • 데이터 검증 및 이상 탐지 구현
  • 데이터 삭제 파이프라인 사용
  • 강력한 미세 조정 보호 장치 적용
  • 모델 행동 드리프트 모니터링
LLM05

부적절한 출력 처리

High

Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.

공격 유형
  • LLM을 통한 XSS 출력: 모델 응답에서 크로스 사이트 스크립팅
  • SQL 주입: LLM에 의해 생성된 악성 쿼리
  • 명령 주입: LLM이 안전하지 않은 시스템 명령을 생성함
  • 경로 탐색: LLM이 무단으로 공개하거나 액세스하는 경우 경로
공격 예
  • 브라우저에서 실행되는 LLM 생성 JavaScript
  • 악성 SQL 쿼리 출력 모델
  • 안전하지 않은 시스템 호출을 포함한 코드 생성
  • 응답에서 파일 경로 공개
완화 전략
  • 출력 유효성 검사 및 삭제 구현
  • 컨텍스트 인식 콘텐츠 필터링 사용
  • 사용자 입력과 동일한 보안 제어 적용
  • 다운스트림 사용 전 샌드박스 LLM 출력
  • 코드 생성에서 보안 코딩 모드 활성화
LLM06

과도한 에이전시

High

Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.

공격 유형
  • 무제한 기능 액세스: 과도한 API 권한
  • 자율 작업: 사람의 승인 없이 작업 수행
  • 도구 남용: 통합 외부 도구 활용
  • 사고 사슬 조작: 추론 프로세스 변경
공격 예
  • 관리 API 액세스를 사용하여 무단 변경을 수행하는 LLM
  • 금융 거래 자동 실행
  • 확인 없이 리소스 삭제
  • 동의 없이 사용자 데이터 조작
완화 전략
  • 최소 권한 액세스 제어 구현
  • 중요한 작업에 인간 참여 필요
  • 민감한 작업에 속도 제한 적용
  • 모든 자율 작업을 기록하고 모니터링합니다
  • 도구 액세스에 범위 제한 사용
LLM07

시스템 프롬프트 유출

Medium

Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.

공격 유형
  • 직접 프롬프트 추출: 프롬프트를 표시하는 소셜 엔지니어링
  • 컨텍스트 오버플로: 시스템 메시지를 노출하는 오버플로 기술
  • 역할극 악용: LLM을 속여 지침 공개
  • 로그 유출: 로그 또는 오류에 프롬프트 노출
공격 예
  • 시스템 프롬프트 추출을 위해 LLM에 '이전 텍스트'를 반복하도록 요청
  • 컨텍스트 창 오버플로를 사용하여 명령 구문 분석 우회
  • 시스템 역할을 재정의하기 위한 프롬프트 주입
  • 애플리케이션 로그에서 프롬프트 찾기
완화 전략
  • 가능한 경우 시스템 프롬프트 난독화
  • 즉시 격리 기술 구현
  • 민감한 지침에는 별도 처리 사용
  • 프롬프트 추출 시도 모니터링
  • 엄격한 로그 필터링 적용
LLM08

벡터 및 임베딩 약점

Medium

Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.

공격 유형
  • RAG 주입: 검색된 문서의 악성 콘텐츠
  • 벡터 DB 손상: 벡터 저장소 공격
  • 임베딩 추출: 임베딩 표현 도용
  • 컨텍스트 조작: 검색 결과 손상
공격 예
  • 중독된 문서가 상위 결과로 검색됨
  • 벡터 데이터베이스 무단 액세스
  • 임베딩에서 훈련 데이터 추출
  • 임베딩 공격을 통한 검색 조작
완화 전략
  • 모든 RAG 입력 문서를 검증하고 삭제합니다.
  • 벡터 데이터베이스 액세스 제어 구현
  • 가능한 경우 내장 암호화 사용
  • 보안 필터를 사용하여 재순위 적용
  • 이상 검색 모니터링
LLM09

잘못된 정보

Medium

LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.

공격 유형
  • 환각: 확신하지만 거짓입니다. 출력
  • 사실 오류: 잘못된 정보가 사실로 제시됨
  • 편향 증폭: 기존 편향 강화
  • 조작: 의도적으로 오해를 불러일으키는 출력
공격 예
  • 존재하지 않는 연구 논문 인용
  • 잘못된 의학적 조언 제공
  • 생성 편향된 채용 권장사항
  • 가짜 뉴스 또는 리뷰 생성
완화 전략
  • 사실 확인 파이프라인 구현
  • 신뢰도 점수 및 불확실성 추정 사용
  • 중요한 출력에 소스 확인 적용
  • 콘텐츠 출처 및 속성 추가
  • AI 생성 콘텐츠에 명확하게 라벨을 지정하세요
LLM10

무한한 소비

Medium

Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.

공격 유형
  • API 비율 남용: 할당량을 소진시키는 과도한 API 호출
  • 리소스 고갈: 컴퓨팅 리소스 최대화
  • 비용 악용: 토큰당 지불 남용으로 인해 요금 청구
  • 추론 공격: 과도한 쿼리를 통해 모델 추출
공격 예
  • 전체 API 할당량을 소비하는 자동화된 공격
  • 컴퓨팅 소모를 유발하는 최대 길이의 프롬프트 스팸
  • 수백만 개의 쿼리를 통해 모델 추출
  • 리소스를 소비하는 재귀적 프롬프트 루프
완화 전략
  • 엄격한 속도 제한 및 할당량 구현
  • 입력/출력 토큰 제한 추가
  • 이상 현상에 대한 사용 패턴 모니터링
  • 비용 통제 및 예산 알림 사용
  • 장기 실행 작업에 시간 초과 제어 적용

OWASP 테스트 프레임워크

각 취약점을 테스트하려면 다음 구조적 접근 방식을 따르세요:

1. 정찰

  • 지도 시스템 아키텍처 및 데이터 흐름
  • 입력 지점 및 API 인터페이스 식별
  • 통합 도구 및 플러그인 문서화
  • 시스템 프롬프트 및 구성 검토

2. 취약점 매핑

  • 각 OWASP 범주를 체계적으로 테스트
  • 문서 공격 표면 및 진입점
  • 방어 메커니즘 식별
  • 문서화된 프롬프트 삽입 및 AI 취약점 공개.

3. 착취

  • 개념 증명 공격 수행
  • 문서 악용 가능성 및 영향
  • 여러 취약점 연결 테스트
  • 실제 공격 타당성 평가

4. 보고

  • 위험 수준에 따라 결과의 우선순위 지정
  • 수정 권장 사항 제공
  • 개념 증명 코드 포함
  • 방어 개선 제안

공식 리소스

소스 및 통계

AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.