AI 事件响应手册
Step-by-step procedures for responding to AI security incidents including LLM breaches, agent compromise, and prompt injection - Updated October 2026
$4.2M
平均AI安全事件成本
(IBM 数据泄露成本 2025)
29 min
电子犯罪平均爆发时间
(CrowdStrike 2026)
47 days
平均 AI 漏洞补丁时间
(Ponemon Institute)
🚨
关键:快速行动
AI incidents can spread rapidly. Average eCrime breakout time is 29 minutes. Have this playbook ready BEFORE incidents occur.
事件分类
关键 - P0
- 通过 AI 系统确认数据泄露
- AI 基础设施上的远程代码执行
- 完成模型盗窃或提取
- 对生产人工智能系统的未经授权的访问
- 具有数据影响的主动提示注入
响应时间: 立即 - 在 15 分钟内激活事件团队
HIGH - P1
- 可疑的提示注入攻击
- 不寻常的 API 调用模式
- 身份验证绕过尝试
- 矢量数据库篡改
- 在定义的参数之外执行的代理
响应时间: 1小时内
中 - P2
- 提示中的潜在敏感数据
- 异常模型行为或幻觉
- 失败的攻击尝试(被阻止)
- AI 输出违反策略
响应时间: 4 小时内
低 - P3
- 轻微策略违规
- 可疑但不确定的活动
- 测试/误报报告
响应时间: 24小时内
第 1 阶段:识别和分类(0-30) min)
检测触发器
自动警报
- 异常 API 使用高峰
- 不寻常的响应模式
- 失败的身份验证尝试
- 速率限制违规
- 毒性检测触发器
手动报告
- 用户报告可疑输出
- 客户投诉
- 员工安全问题
- 第三方通知
立即分类清单
- 确认事件: 这是真正的安全事件还是误报?
- 严重程度分类: 基于影响力的 P0-P3
- 保留证据: 立即开始记录所有内容
- 通知团队: 警报事件响应领导
- 文档时间表: 在第一个指标出现时记录
第 2 阶段:遏制(30 分钟 - 2 小时)
LLM API 遏制
- 轮换API密钥: 立即轮换任何可能受损的凭证
- 速率限制: 对受影响的端点应用激进的速率限制
- IP 封锁: 在 API 网关阻止恶意源 IP
- 功能标志: 禁用有风险的功能(文件上传、代码执行)
- 只读模式: 考虑受影响系统的只读模式
特工遏制
- 终止代理进程: 立即停止受损代理
- 撤销工具访问权限: 禁用代理对敏感工具的访问
- 隔离 MCP 服务器: 断开可疑的MCP服务器连接
- 会话失效: 强制注销所有活动会话
- 网络分段: 将 AI 系统与关键网络隔离
数据遏制
- 审核日志: 保留所有访问日志以进行取证分析
- 数据库快照: 拍摄时间点快照
- 矢量数据库: 隔离和检查向量数据库
- 备份完整性: 验证最近的备份没有受到损害
第 3 阶段:调查(2-24 小时)
日志分析
收集和分析:
- API 请求/响应日志: 带有时间戳的所有 LLM API 调用
- 身份验证日志: 登录尝试、令牌使用
- 应用程序日志: 来自 AI 处理服务的服务器日志
- 网络日志: 流量模式、源 IP
- 用户活动日志: 谁访问了什么以及何时访问
攻击向量分析
提示注入
- 识别注入模式
- 跟踪注入源
- 评估操纵影响
- 文档攻击技术
数据泄露
- 识别访问的数据
- 确定渗漏方法
- 评估数据敏感性
- 计算记录计数
代理妥协
- 识别受损操作
- 跟踪工具滥用
- 评估未经授权的访问
- 文档横向移动
证据保存
- 创建取证副本: 受影响系统的逐位副本
- 哈希验证: 计算和记录文件哈希
- 监管链: 记录谁访问了哪些证据
- 安全存储: 将证据存储在安全、访问受控的位置
- 创建时间线: 建立详细的事件时间表
第 4 阶段:修复(24-72 小时)
立即修复
LLM 漏洞
- 修补输入验证差距
- 更新内容过滤
- 加强输出清理
- 添加注入检测
代理问题
- 减少代理权限
- 添加审批工作流程
- 实施更严格的边界
- 更新工具访问控制
基础设施修复
- 凭证重置: 强制重置密码,轮换所有 API 密钥
- 访问审查: 审核和清理权限
- 网络强化: 更新防火墙规则,分段网络
- 监控更新: 使用新的检测规则增强监控
- 备份验证: 验证干净备份、测试恢复
第5阶段:通知和报告
内部报告
- 执行摘要: 领导层的 1 页事件概述
- 技术报告: 安全团队的详细技术发现
- 时间线: 包含关键事件的完整事件时间表
- 吸取的教训: 哪些进展顺利,哪些需要改进
- 行动项目: 具有所有者和截止日期的特定任务
外部通知
监管机构
- GDPR:向 DPA 提供 72 小时通知
- 欧盟AI法案:向主管当局报告
- 行业监管机构(金融、医疗保健)
- 国家违规通知法
受影响方
- 客户通知(如果数据受影响)
- 业务合作伙伴通知
- CVE 披露(如果适用)
- 公开披露(如果需要)
第 6 阶段:事件后活动
根本原因分析
- 5 个原因分析: 深入探究根本原因
- 攻击路径映射: 攻击者如何成功?
- 控制失败: 哪些控件不起作用?
- 检测差距: 为什么没有早点发现这个问题?
- 流程问题: 响应过程在哪里失败?
改进措施
技术
- 实施缺失的安全控制
- 更新检测规则
- 修补漏洞
- 增强监控
流程
- 更新事件响应程序
- 改进通信协议
- 增强培训计划
- 记录新剧本
预防
- 红队测试
- 桌面练习
- 安全意识培训
- 架构审查
紧急快速参考
关键事件行动
- 立即轮换API密钥
- 禁用受影响的终端节点
- 保留所有日志
- 在 15 分钟内通知 CISO
- 开始证据收集
升级联系人
- 安全团队:[内部 Slack #]
- 待命工程师:[pagerduty]
- CISO:[直线]
- 法律:[legal@company]
- 公关/通信:[pr@company]
事件前准备清单
- 手册: 常见 AI 事件的记录事件响应程序
- 团队: 训练有素的事件响应团队,具有明确的角色
- 工具: 记录、监控和取证工具准备就绪
- 通信: 记录的联系人列表和升级路径
- 实践: 定期桌面练习和模拟
- 保留: 足够的日志保留(建议 90 天以上)
- 备份: 使用经过测试的恢复程序验证备份