AI ハッキング
AI セキュリティ リソース

OWASP Top 10 for LLM Applications 2025/2026

The definitive list of critical security risks in LLM applications - Updated August 2026 with 2026 predicted changes

73%
AI 導入には重大な脆弱性がある
(OWASP State of AI Security、2025)
41%
エンタープライズ AI には認証されていない API がある
(CodeWall Research、2025)
Virtually 100%
LLM 導入で悪用可能なプロンプト インジェクション
(OWASP LLM トップ 10、2025)
⚠

重大なリスク認識

プロンプト インジェクションが依然として最大の脆弱性です。 包括的なプロンプト インジェクション ガイドを参照 →

🔮

OWASP LLM Top 10 2026: What's Changing

The 2025 version is still the active standard, but the 2026 draft introduces significant changes:

  • NEW: Agent Hijacking — Goal manipulation in autonomous agent workflows (merges with Agentic ASI01)
  • NEW: Multi-Modal Injection — Prompt injection via images, audio, and video in multimodal AI systems
  • NEW: Memory Persistence — Poisoning long-term agent memory/cache across sessions
  • Elevated: System Prompt Leakage — Moving from LLM07 to higher priority due to agent context exposure
  • Broadened: Excessive Agency — Expanded to cover MCP tool abuse, OAuth delegation attacks

Track OWASP LLM Top 10 2026 progress →

LLM01

プロンプト インジェクション

Critical

Manipulating LLM behavior through crafted inputs that override original instructions. Includes both direct (user input) and indirect (external data) injection.

攻撃の種類
  • ダイレクト インジェクション: システム指示を無効にする悪意のあるユーザー プロンプト
  • Indirect Injection: Hidden instructions in external documents, web content, or API responses
  • コンテキスト操作: 会話コンテキストを悪用して動作を変更
  • 脱獄攻撃: クリエイティブなプロンプトによる安全フィルターのバイパス
攻撃の例
  • Ignore previous instructions and...
  • 目に見えない Unicode 文字に埋め込まれたテキスト
  • Web コンテンツに保存された XSS を介したプロンプト インジェクション
  • DAN (Do Anything Now) style jailbreaks
軽減戦略
  • 厳格な入力検証とサニタイズを実装
  • ユーザー入力とシステムの間で権限を分離します。プロンプト
  • 結果を表示する前に出力フィルタリングを適用します
  • ログ内の挿入パターンを監視
  • 複数のセキュリティ層で多層防御を実装
LLM02

機密情報の開示

Critical

LLMs inadvertently revealing private, confidential, or proprietary information through model outputs.

攻撃の種類
  • トレーニング データ抽出: モデル メモリから機密データを回復
  • PII 漏洩: 個人を特定できる情報の公開
  • API キー/認証情報の公開: 応答で秘密を明らかにする
  • ビジネス ロジックの開示: 独自のアルゴリズムまたはプロセスの公開
攻撃の例
  • 特定のプロンプトによる電子メール アドレスの抽出
  • エラー メッセージで SQL 資格情報を明らかにする
  • トレーニング データからの顧客 PII の開示
  • 内部システム プロンプトを公開
軽減戦略
  • 堅牢な入出力フィルタリングの実装
  • データサニタイズパイプラインの強制
  • データ使用に対するユーザー オプトアウト ポリシーの適用
  • 差分プライバシー手法を使用
  • システム プロンプト アクセスと可視性を制限する
LLM03

サプライ チェーンの脆弱性

High

Compromised or vulnerable components in the LLM supply chain including models, APIs, plugins, and third-party services.

攻撃の種類
  • モデルの改ざん: 侵害された事前トレーニング済みモデル
  • PyPI/npm 依存関係の脆弱性: 安全でないライブラリ
  • 悪意のある微調整データ: 汚染されたトレーニング データセット
  • 侵害された API プロバイダー: 信頼できない LLM サービス
攻撃の例
  • 信頼できないソースからのバックドア モデルの重み
  • 脆弱なトランスフォーマー ライブラリの悪用
  • 隠しトリガーによる汚染されたトレーニング データ
  • 侵害された RAG ドキュメント ストア
軽減戦略
  • チェックサムと署名を通じてモデルの整合性を検証
  • SBOM (ソフトウェア部品表) の維持
  • 信頼できるモデル ハブを使用し、来歴を検証する
  • 既知の脆弱性の依存関係をスキャン
  • モデルのライフサイクル管理を実装する
LLM04

データとモデルのポイズニング

High

Introducing malicious or biased data into training pipelines, fine-tuning data, or RAG knowledge bases to compromise model integrity.

攻撃の種類
  • トレーニング データ ポイズニング: モデル トレーニング データの破損
  • ポイズニングの微調整: 微調整によるバックドアの注入
  • RAG ポイズニング: 取得ナレッジ ベースの汚染
  • 埋め込み操作: ベクター データベースの破損
攻撃の例
  • モデルの動作を変更するための偏ったサンプルの挿入
  • トレーニング データでのバックドア トリガーの作成
  • トレーニングに使用されるパブリック データセットの汚染
  • RAG ドキュメントへの虚偽の情報の挿入
軽減戦略
  • データの出所とサプライ チェーンの整合性を検証
  • データ検証と異常検出の実装
  • データ サニタイズ パイプラインを使用する
  • 強力な微調整セーフガードを適用
  • モデル動作のドリフトを監視
LLM05

不適切な出力処理

High

Failing to validate, sanitize, or properly handle LLM outputs before passing them to downstream systems or users.

攻撃の種類
  • LLM 経由の XSS 出力:モデル応答からのクロスサイト スクリプティング
  • SQL インジェクション: LLM によって生成された悪意のあるクエリ
  • コマンド インジェクション: LLM が安全でないシステム コマンドを生成
  • パス トラバーサル: LLM による不正なパスの暴露またはアクセス
攻撃の例
  • ブラウザで実行される JavaScript を生成する LLM
  • 悪意のある SQL クエリを出力するモデル
  • 安全でないシステム コールを含むコード生成
  • 応答でのファイル パス開示
軽減戦略
  • 出力検証とサニタイズを実装
  • コンテキスト認識型コンテンツ フィルタリングを使用する
  • ユーザー入力と同じセキュリティ制御を適用
  • ダウンストリームで使用する前にサンドボックス LLM 出力を使用します。
  • コード生成でセキュア コーディング モードを有効にする
LLM06

過剰なエージェンシー

High

Granting LLM systems too much functionality, autonomy, permissions, or enabling unauthorized or harmful actions.

攻撃の種類
  • 無制限の関数アクセス: 過剰な API 権限
  • 自律的なアクション: 人間の承認なしでアクションを実行
  • ツールの悪用: 統合された外部ツールの悪用
  • 思考連鎖操作: 推論プロセスの変更
攻撃の例
  • 管理者 API アクセスによる LLM が不正な変更を実行
  • 金融取引の自動実行
  • 確認なしでリソースを削除
  • 同意なしのユーザー データの操作
軽減戦略
  • 最小限の特権アクセス制御を実装する
  • 重要なアクションには人間参加が必要
  • 機密性の高い操作にレート制限を適用する
  • すべての自律的なアクションを記録および監視
  • ツール アクセスでスコープ制限を使用
LLM07

システム プロンプト リーク

Medium

Exposing confidential system prompts, instructions, or internal logic through manipulation or inadequate protections.

攻撃の種類
  • 直接プロンプト抽出: ソーシャル エンジニアリングによりプロンプトを明らかにする
  • コンテキスト オーバーフロー: システム メッセージを公開するオーバーフロー技術
  • ロールプレイ悪用: LLM を騙して指示を明らかにする
  • ログ漏洩: ログまたはエラー内のプロンプトを公開
攻撃の例
  • システム プロンプトを抽出するために LLM に「前のテキスト」を繰り返すよう要求
  • コンテキスト ウィンドウ オーバーフローを使用して命令解析をバイパス
  • システム ロールをオーバーライドするためのプロンプト インジェクション
  • アプリケーション ログでのプロンプトの検索
軽減戦略
  • 可能な場合はシステム プロンプトを難読化
  • 迅速な分離技術を実装
  • 機密性の高い命令には別の処理を使用する
  • プロンプト抽出試行の監視
  • 厳密なログ フィルタリングを適用する
LLM08

ベクターおよび埋め込みの弱点

Medium

Security vulnerabilities in Retrieval-Augmented Generation (RAG) systems, vector databases, and embedding pipelines.

攻撃の種類
  • RAG インジェクション: 取得したドキュメント内の悪意のあるコンテンツ
  • ベクター DB 侵害: ベクター ストレージへの攻撃
  • 埋め込み抽出: 埋め込み表現の盗用
  • コンテキスト操作: 取得結果の破損
攻撃の例
  • 毒入りドキュメントが上位の結果として取得されている
  • ベクター データベースの不正アクセス
  • 埋め込みからトレーニング データを抽出
  • 埋め込み攻撃による取得操作
軽減戦略
  • すべての RAG 入力ドキュメントを検証およびサニタイズ
  • ベクター データベースのアクセス制御を実装
  • 利用可能な場合は埋め込み暗号化を使用
  • Apply reranking with security filters
  • 異常の取得を監視
LLM09

誤情報

Medium

LLMs generating false, misleading, or biased content that appears credible, leading to informed decisions based on incorrect information.

攻撃の種類
  • 幻覚: 自信はあるが、誤った出力
  • 事実誤認: 事実として提示された誤った情報
  • バイアス増幅: 既存のバイアスの強化
  • 操作: 誤解を招く出力を意図的に作成
攻撃の例
  • 存在しない研究論文の引用
  • 誤った医療アドバイスの提供
  • 偏った採用推奨の生成
  • フェイク ニュースまたはレビューの作成
軽減戦略
  • ファクトチェック パイプラインの実装
  • 信頼度スコアリングと不確実性推定を使用
  • 重要な出力に対してソース検証を適用
  • コンテンツの出所と帰属を追加
  • AI が生成したコンテンツに明確にラベルを付ける
LLM10

無制限の消費

Medium

Allowing excessive or uncontrolled resource usage by LLM applications, leading to denial of service, financial exploitation, or service degradation.

攻撃の種類
  • API レートの悪用: クォータを使い果たす過剰な API コール
  • リソース枯渇: コンピューティング リソースの最大化
  • コストの悪用: 料金請求につながるペイパートークンの悪用
  • 推論攻撃: 過剰なクエリによるモデルの抽出
攻撃の例
  • API クォータ全体を消費する自動化された攻撃
  • コンピューティング枯渇を引き起こす最大長のプロンプト スパム
  • 数百万のクエリを通じてモデルを抽出
  • リソースを消費する再帰的プロンプト ループ
軽減戦略
  • 厳格なレート制限とクォータを実装
  • 入力/出力トークン制限を追加
  • 異常の使用パターンを監視
  • コスト管理と予算アラートの使用
  • 長時間実行オペレーションにタイムアウト制御を適用

OWASP テスト フレームワーク

各脆弱性をテストするには、この構造化されたアプローチに従ってください:

1。偵察

  • システム アーキテクチャとデータ フローをマップする
  • 入力ポイントと API インターフェイスの特定
  • 統合ツールとプラグインを文書化
  • システム プロンプトと構成を確認する

2。脆弱性マッピング

  • 各 OWASP カテゴリを体系的にテスト
  • 攻撃対象領域とエントリ ポイントを文書化
  • 適切な防御メカニズムを特定
  • 依存関係とサードパーティ サービスをマップ

3。悪用

  • 概念実証攻撃の実行
  • ドキュメントの悪用可能性と影響
  • 複数のテストを連鎖させる脆弱性
  • 実際の攻撃の実行可能性を評価

4。レポート

  • リスク レベルごとに調査結果の優先順位付け
  • 修復推奨事項を提供
  • 概念実証コードを含む
  • 防御改善の提案
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.