AI Red Teaming: Guia de metodologia completo
Comprehensive methodology for testing AI systems - from reconnaissance to remediation
Updated: August 2026 • Tempo de leitura: ~15 min
O que é AI Red Teaming?
AI red teaming é a prática de ataques deliberados e sistemáticos em sistemas de IA to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:
Injeção de prompt
Manipulating AI behavior through malicious inputs that override system instructions
Jailbreaking
Ignorando medidas de segurança para gerar conteúdo proibido
Extração de dados
Extração de informações confidenciais de dados ou saídas de treinamento
Manipulação de modelo
Alterando modelar comportamento por meio de envenenamento ou ataques de ajuste fino
Por que a AI Red Teaming é importante em 2026
- 180% increase in LLM-related security incidents (2025)
- A AI Red Team da Microsoft avaliou Mais de 100 produtos GenAI e descobri que muitas falhas impactantes vêm de técnicas simples
- Os sistemas de IA lidam cada vez mais dados confidenciais e decisões críticas
- Mandato de requisitos regulamentares (Lei de IA da UE) Testes de segurança de IA para sistemas de alto risco
Construindo uma equipe vermelha de IA
Habilidades necessárias
Habilidades técnicas
- Compreensão da arquitetura LLM
- Conhecimento imediato de engenharia
- Segurança de aplicativos da Web
- Testes de segurança de API
- Scripting (Python, bash)
Habilidades adversas
- Solução criativa de problemas
- Consciência de engenharia social
- Pensamento de ataque multimodal
- Pesquisa e reconhecimento
- Documentação e relatórios
Conhecimento do domínio
- OWASP LLM Top 10
- Estrutura MITRE ATLAS
- Fundamentos de IA/ML
- Ética e divulgação responsável
- Riscos específicos do setor
Modelos de engajamento
| Modelo | Descrição | Prós | Contras |
|---|---|---|---|
| Equipe interna | Equipe vermelha interna dedicada | Profundo conhecimento do produto, testes contínuos | Pode perder a perspectiva externa |
| Consultor externo | Empresa de segurança terceirizada | Nova perspectiva, habilidades especializadas | Maior custo, curva de aprendizado |
| Híbrido | Colaboração interna + externa | O melhor dos dois mundos | Sobrecarga de coordenação |
| Automatizado | Testes integrados de CI/CD | Contínua, escalável | Limitado a padrões conhecidos |
Fase 1: Reconhecimento e descoberta
The initial phase focuses on understanding the target AI system and mapping its attack surface.
1.1 Mapeamento do sistema
- Revisão da arquitetura: Entenda como a IA se integra a outros sistemas
- Fluxo de dados: Mapear como os dados se movem pelo sistema
- Endpoints de API: Identificar todas as interfaces expostas
- Integrações de terceiros: Documente serviços externos
- Funções do usuário: Entenda os diferentes níveis de acesso
1.2 Capability Probing
- Recursos do modelo: O que a IA pode fazer?
- Acesso a ferramentas: Quais funções ele pode invocar?
- Acesso aos dados: Quais informações ele pode recuperar?
- Canais de saída: Como ele se comunica?
- Gerenciamento de estado: Como ele lida com as sessões?
Técnicas-chave
- Extração de prompt do sistema: Tentativa de revelar instruções do sistema por meio de prompts cuidadosos
- Impressão digital do modelo: Identificar o modelo subjacente por meio de padrões de comportamento
- Descoberta de API: Encontre endpoints ocultos ou não documentados
- Revisão da documentação: Analisar documentos públicos para obter detalhes de implementação
Fase 2: Mapeamento de vulnerabilidades
Identify and categorize potential attack vectors based on the discovered attack surface.
Taxonomia de ataque
Injeção de prompt
- Injeção direta
- Injeção indireta
- Manipulação multi-turno
- Excesso de contexto
Ataques de jailbreak
- Role-playing (DAN)
- Implantações de LLM vulneráveis à injeção de prompt
- Enquadramento de autorização
- Desvio de codificação
Extração de dados
- Recuperação de dados de treinamento
- Vazamento imediato do sistema
- Acesso ao histórico de conversas
- Exposição da chave de API
Negação de serviço
- Esgotamento de recursos
- Excesso de contexto
- Manipulação de modelo
- Travamento/travamento do sistema
Abuso de ferramentas/funções
- Chamadas de API não autorizadas
- Manipulação de parâmetros
- Encadeamento de funções
- Escalonamento de privilégios
Ataques multimodais
- Injeção baseada em imagem
- Manipulação de áudio
- Explorações intermodais
- Conteúdo incorporado
Ataques de modelo
- Exemplos adversários
- Inversão de modelo
- Inferência de membros
- Extração de modelo
Cadeia de suprimentos
- Envenenamento por dependência
- Comprometimento do hub do modelo
- Treinamento de envenenamento de dados
- Riscos de terceiros
Fase 3: Exploração
Attempt to actively exploit identified vulnerabilities to determine their real-world impact.
Metodologia de exploração
- Atribuição de prioridade: Classificar vulnerabilidades por gravidade e capacidade de exploração
- Prova de conceito: Desenvolver explorações funcionais para cada vulnerabilidade
- Avaliação de impacto: Determine as consequências reais da exploração bem-sucedida
- Encadeamento: Teste se múltiplas vulnerabilidades podem ser combinadas para maior impacto
- Documentação: Registre todas as tentativas de exploração, sucessos e falhas
Lições da equipe vermelha da Microsoft
Com base em testes de mais de 100 produtos GenAI, a equipe AI Red da Microsoft descobriu:
- Técnicas simples funcionam: Muitas falhas impactantes vêm de prompts básicos de jailbreak
- O pensamento no nível do sistema é importante: As vulnerabilidades geralmente abrangem vários componentes
- A criatividade humana vence: Ferramentas automatizadas encontram padrões conhecidos; humanos encontram novos ataques
- Testes contínuos são essenciais: Novos recursos introduzem novas superfícies de ataque
Fase 4: Teste de persistência
Test whether attack effects persist beyond the initial interaction and can survive system resets.
Persistência de sessão
- A manipulação sobrevive à atualização da sessão?
- O estado pode ser pré-carregado em novas sessões?
- Existem efeitos persistentes de prompts anteriores?
Persistência do modelo
- Os ataques podem influenciar futuras atualizações de modelos?
- O ajuste fino preserva as vulnerabilidades?
- Os ataques venenosos são permanentes?
Persistência do sistema
- As vulnerabilidades podem sobreviver a atualizações?
- Existem mecanismos de backdoor?
- Os ataques persistem nas implantações?
Aprofundamento de ferramentas
Garak
Scanner de vulnerabilidade LLM de código aberto da NVIDIA
- Sondas para mais de 40 tipos de vulnerabilidade
- Avaliação contínua do modelo
- Atualizações regulares do banco de dados de vulnerabilidades
- Integração com pipelines de CI/CD
PyRIT
Ferramenta de identificação de risco Python da Microsoft
- Estrutura abrangente da equipe vermelha
- Suporte a múltiplas superfícies de ataque
- Geração automatizada de ataques
- Pontuação e avaliação
Promptfoo
Plataforma de teste e avaliação LLM
- Estrutura de teste de prompt
- Avaliação de segurança
- Benchmarking de desempenho
- Comparação de versões
Rebuff
SDK de detecção de injeção imediata
- Detecção de tentativas de injeção
- Defesa multicamadas
- Baixa taxa de falsos positivos
- Fácil integração
CI/CD Integration
Embed AI security testing into your development pipeline to catch vulnerabilities before production.
Pontos de integração de pipeline
1. Pré-comprometimento
- Validação de prompt local
- Detecção de injeção baseada em padrão
- Testes de estação de trabalho do desenvolvedor
2. Pull Request
- Verificação automatizada de vulnerabilidades
- Comparação de linha de base
- Aplicação do portão de segurança
3. Pré-produção
- Avaliação completa da equipe vermelha
- Testes de regressão
- Benchmarking de desempenho
4. Produção
- Monitoramento contínuo
- Detecção de anomalias
- Integração de resposta a incidentes
Example: GitHub Actions Integration
```yaml
name: AI Security Scan
on: [pull_request]
jobs:
garak-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v3
- name: Run Garak
run: |
pip install garak
garak --model_type chat --target_url http://localhost:8000
- name: Upload results
uses: actions/upload-artifact@v3
with:
name: garak-results
path: results.json
```
Scoring & Triage
Estrutura de classificação de gravidade
| Gravidade | Critérios | Exemplo |
|---|---|---|
| Crítica | Execução remota de código, violação de dados, comprometimento do sistema | Injeção imediata completa levando a RCE |
| Alto | Acesso não autorizado, exposição de dados confidenciais | Extração de prompt do sistema |
| Média | Ignoração de política, acesso limitado a dados | Ignorar filtro de conteúdo |
| Baixo | Pequenas violações de política, informativas | Formato de saída não intencional |
Métodos de avaliação
LLM-as-Judge
Use IA para avaliar resultados de IA para segurança e conformidade com políticas
Avaliação Humana
Revisão especializada de saídas para avaliação de segurança diferenciada
Pontuação automatizada
Correspondência de padrões e avaliação baseada em regras
Métricas da equipe vermelha
Rastrear taxa de sucesso de exploração, taxa de falsos positivos
Arquitetura de remediação
Camadas de defesa
1. Filtragem de entrada
- Detecção de padrões de prompt
- Reconhecimento de codificação
- Limites de comprimento
- Limitação de taxa
2. Guardrails
- Validação de saída
- Filtragem de conteúdo
- Políticas de uso de ferramentas
- Controles de acesso
3. Proteção de modelo
- Ajuste para segurança
- Melhorias de RLHF
- Engenharia de prompt do sistema
- Ajuste de temperatura/top-p
4. Design do sistema
- Separação de privilégios
- Human-in-the-loop
- Registro e monitoramento
- Resposta a incidentes
Teste de validação
Depois de implementar as correções, teste novamente para verificar:
- Vulnerabilidades originais não são mais exploráveis
- As correções não introduzem novas vulnerabilidades
- A funcionalidade do sistema permanece intacta
- O desempenho é aceitável
- Taxas de falsos positivos são gerenciáveis
Modelo de relatório
Resumo executivo
- Escopo e objetivos
- Visão geral das principais descobertas
- Resumo da classificação de risco
- Recomendações prioritárias
Detalhes técnicos
- Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
- Capturas de tela e registros
- Diagramas de cadeia de ataque
- Trechos de código
Recomendações
- Correções de curto prazo (ganhos rápidos)
- Melhorias de médio prazo
- Mudanças arquitetônicas de longo prazo
- Requisitos de recursos
- Linha do tempo
Apêndices
- Saídas da ferramenta
- Casos de teste usados
- Referências
- Glossário
Considerações éticas
Autorização
Always obtain explicit written permission before testing. Document scope boundaries.
Limites de escopo
Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.
Manipulação de dados
Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.
Divulgação responsável
Allow reasonable time for remediation before public disclosure. Coordinate with vendors.
References & Resources
Related Articles
Recursos relacionados
Pronto para saber mais?
Continue explorando tópicos de segurança de IA.