AI 侵入テスト手法
AI システムセキュリティを評価するための構造化された倫理的なフレームワーク
計画
Define the objectives, scope, legal permissions, and constraints of the AI pentest. This ensures the engagement is safe, authorized, and aligned with organizational goals.
主なアクティビティ:
- 明示的な書面による承認を取得
- システム境界、目標、成功基準を定義する
- 安全なデータ処理および保持ポリシーを確立
- 関与規則とエスカレーション手順に同意する
- コンプライアンス/規制要件の特定 (GDPR、HIPAA、など)
偵察
Gather information about the AI system, its architecture, and its surrounding ecosystem to identify possible attack surfaces.
主なアクティビティ:
- システム コンポーネントと統合のマッピング
- ドキュメント公開 API エンドポイントとインターフェイス
- モデル タイプ、トレーニング データ ソース、パイプラインを識別する
- 認証、ロギング、監視制御を評価
- ドキュメント、パブリック リポジトリ、および関連メタデータを確認
脆弱性分析
Identify weaknesses in the AI model, its deployment environment, and supporting infrastructure. Focus on both technical and AI-specific vulnerabilities.
主なアクティビティ:
- プロンプト インジェクションとプロンプト リークのテスト
- データポイズニングとモデル回避のリスクを評価
- 敵対的な例に対する堅牢性を評価
- 安全でないデフォルト設定をチェック
- 機密情報漏洩のモデル出力を分析
悪用
Safely test vulnerabilities in a controlled manner to validate findings without causing harm or disruption to the system.
主なアクティビティ:
- 合意された保護措置の下で概念実証のエクスプロイト試行を実施
- Simulate real-world attack scenarios (adversarial prompts, model extraction)
- 攻撃ベクトルとシステムの動作を文書化する
- 機密性、整合性、可用性への影響を検証
- 監視およびロールバック メカニズムの維持
レポート作成
Communicate findings clearly and responsibly, with actionable recommendations for remediation and risk mitigation.
主なアクティビティ:
- 重大度、可能性、ビジネスへの影響に基づいて検出結果に優先順位を付ける
- 明確な修復ガイダンスと安全な構成アドバイスを提供
- サニタイズされたテスト ケースと概念実証の詳細を含めます
- 監視と検出の改善を推奨
- 人間とエージェントの信頼の悪用
倫理的考慮事項
- 常に正式な認可と範囲の下で運用
- 明示的な同意なしに運用システムをテストしない
- 常にユーザーのプライバシーとデータの所有権を尊重
- 業務運営への中断を最小限に抑える
- 調整された脆弱性開示慣行に従う