AI Hacking
Recursos de segurança de IA

AI Red Teaming: Guia de metodologia completo

Comprehensive methodology for testing AI systems - from reconnaissance to remediation

Updated: August 2026 • Tempo de leitura: ~15 min

O que é AI Red Teaming?

AI red teaming é a prática de ataques deliberados e sistemáticos em sistemas de IA to identify vulnerabilities before real-world adversaries can exploit them. Unlike traditional penetration testing, which focuses on infrastructure and code, AI red teaming addresses unique risks inherent to machine learning systems:

Injeção de prompt

Manipulating AI behavior through malicious inputs that override system instructions

Jailbreaking

Ignorando medidas de segurança para gerar conteúdo proibido

Extração de dados

Extração de informações confidenciais de dados ou saídas de treinamento

Manipulação de modelo

Alterando modelar comportamento por meio de envenenamento ou ataques de ajuste fino

Por que a AI Red Teaming é importante em 2026

  • 180% increase in LLM-related security incidents (2025)
  • A AI Red Team da Microsoft avaliou Mais de 100 produtos GenAI e descobri que muitas falhas impactantes vêm de técnicas simples
  • Os sistemas de IA lidam cada vez mais dados confidenciais e decisões críticas
  • Mandato de requisitos regulamentares (Lei de IA da UE) Testes de segurança de IA para sistemas de alto risco

Construindo uma equipe vermelha de IA

Habilidades necessárias

Habilidades técnicas

  • Compreensão da arquitetura LLM
  • Conhecimento imediato de engenharia
  • Segurança de aplicativos da Web
  • Testes de segurança de API
  • Scripting (Python, bash)

Habilidades adversas

  • Solução criativa de problemas
  • Consciência de engenharia social
  • Pensamento de ataque multimodal
  • Pesquisa e reconhecimento
  • Documentação e relatórios

Conhecimento do domínio

  • OWASP LLM Top 10
  • Estrutura MITRE ATLAS
  • Fundamentos de IA/ML
  • Ética e divulgação responsável
  • Riscos específicos do setor

Modelos de engajamento

Modelo Descrição Prós Contras
Equipe interna Equipe vermelha interna dedicada Profundo conhecimento do produto, testes contínuos Pode perder a perspectiva externa
Consultor externo Empresa de segurança terceirizada Nova perspectiva, habilidades especializadas Maior custo, curva de aprendizado
Híbrido Colaboração interna + externa O melhor dos dois mundos Sobrecarga de coordenação
Automatizado Testes integrados de CI/CD Contínua, escalável Limitado a padrões conhecidos

Fase 1: Reconhecimento e descoberta

The initial phase focuses on understanding the target AI system and mapping its attack surface.

1.1 Mapeamento do sistema

  • Revisão da arquitetura: Entenda como a IA se integra a outros sistemas
  • Fluxo de dados: Mapear como os dados se movem pelo sistema
  • Endpoints de API: Identificar todas as interfaces expostas
  • Integrações de terceiros: Documente serviços externos
  • Funções do usuário: Entenda os diferentes níveis de acesso

1.2 Capability Probing

  • Recursos do modelo: O que a IA pode fazer?
  • Acesso a ferramentas: Quais funções ele pode invocar?
  • Acesso aos dados: Quais informações ele pode recuperar?
  • Canais de saída: Como ele se comunica?
  • Gerenciamento de estado: Como ele lida com as sessões?

Técnicas-chave

  • Extração de prompt do sistema: Tentativa de revelar instruções do sistema por meio de prompts cuidadosos
  • Impressão digital do modelo: Identificar o modelo subjacente por meio de padrões de comportamento
  • Descoberta de API: Encontre endpoints ocultos ou não documentados
  • Revisão da documentação: Analisar documentos públicos para obter detalhes de implementação

Fase 2: Mapeamento de vulnerabilidades

Identify and categorize potential attack vectors based on the discovered attack surface.

Taxonomia de ataque

Injeção de prompt

  • Injeção direta
  • Injeção indireta
  • Manipulação multi-turno
  • Excesso de contexto

Ataques de jailbreak

  • Role-playing (DAN)
  • Implantações de LLM vulneráveis ​​à injeção de prompt
  • Enquadramento de autorização
  • Desvio de codificação

Extração de dados

  • Recuperação de dados de treinamento
  • Vazamento imediato do sistema
  • Acesso ao histórico de conversas
  • Exposição da chave de API

Negação de serviço

  • Esgotamento de recursos
  • Excesso de contexto
  • Manipulação de modelo
  • Travamento/travamento do sistema

Abuso de ferramentas/funções

  • Chamadas de API não autorizadas
  • Manipulação de parâmetros
  • Encadeamento de funções
  • Escalonamento de privilégios

Ataques multimodais

  • Injeção baseada em imagem
  • Manipulação de áudio
  • Explorações intermodais
  • Conteúdo incorporado

Ataques de modelo

  • Exemplos adversários
  • Inversão de modelo
  • Inferência de membros
  • Extração de modelo

Cadeia de suprimentos

  • Envenenamento por dependência
  • Comprometimento do hub do modelo
  • Treinamento de envenenamento de dados
  • Riscos de terceiros

Fase 3: Exploração

Attempt to actively exploit identified vulnerabilities to determine their real-world impact.

Metodologia de exploração

  1. Atribuição de prioridade: Classificar vulnerabilidades por gravidade e capacidade de exploração
  2. Prova de conceito: Desenvolver explorações funcionais para cada vulnerabilidade
  3. Avaliação de impacto: Determine as consequências reais da exploração bem-sucedida
  4. Encadeamento: Teste se múltiplas vulnerabilidades podem ser combinadas para maior impacto
  5. Documentação: Registre todas as tentativas de exploração, sucessos e falhas

Lições da equipe vermelha da Microsoft

Com base em testes de mais de 100 produtos GenAI, a equipe AI Red da Microsoft descobriu:

  • Técnicas simples funcionam: Muitas falhas impactantes vêm de prompts básicos de jailbreak
  • O pensamento no nível do sistema é importante: As vulnerabilidades geralmente abrangem vários componentes
  • A criatividade humana vence: Ferramentas automatizadas encontram padrões conhecidos; humanos encontram novos ataques
  • Testes contínuos são essenciais: Novos recursos introduzem novas superfícies de ataque

Fase 4: Teste de persistência

Test whether attack effects persist beyond the initial interaction and can survive system resets.

Persistência de sessão

  • A manipulação sobrevive à atualização da sessão?
  • O estado pode ser pré-carregado em novas sessões?
  • Existem efeitos persistentes de prompts anteriores?

Persistência do modelo

  • Os ataques podem influenciar futuras atualizações de modelos?
  • O ajuste fino preserva as vulnerabilidades?
  • Os ataques venenosos são permanentes?

Persistência do sistema

  • As vulnerabilidades podem sobreviver a atualizações?
  • Existem mecanismos de backdoor?
  • Os ataques persistem nas implantações?

Aprofundamento de ferramentas

Garak

Scanner de vulnerabilidade LLM de código aberto da NVIDIA

  • Sondas para mais de 40 tipos de vulnerabilidade
  • Avaliação contínua do modelo
  • Atualizações regulares do banco de dados de vulnerabilidades
  • Integração com pipelines de CI/CD
Veja no GitHub →

PyRIT

Ferramenta de identificação de risco Python da Microsoft

  • Estrutura abrangente da equipe vermelha
  • Suporte a múltiplas superfícies de ataque
  • Geração automatizada de ataques
  • Pontuação e avaliação
Veja no GitHub →

Promptfoo

Plataforma de teste e avaliação LLM

  • Estrutura de teste de prompt
  • Avaliação de segurança
  • Benchmarking de desempenho
  • Comparação de versões
Ver site →

Rebuff

SDK de detecção de injeção imediata

  • Detecção de tentativas de injeção
  • Defesa multicamadas
  • Baixa taxa de falsos positivos
  • Fácil integração
Veja no GitHub →

CI/CD Integration

Embed AI security testing into your development pipeline to catch vulnerabilities before production.

Pontos de integração de pipeline

1. Pré-comprometimento

  • Validação de prompt local
  • Detecção de injeção baseada em padrão
  • Testes de estação de trabalho do desenvolvedor

2. Pull Request

  • Verificação automatizada de vulnerabilidades
  • Comparação de linha de base
  • Aplicação do portão de segurança

3. Pré-produção

  • Avaliação completa da equipe vermelha
  • Testes de regressão
  • Benchmarking de desempenho

4. Produção

  • Monitoramento contínuo
  • Detecção de anomalias
  • Integração de resposta a incidentes

Example: GitHub Actions Integration

```yaml
name: AI Security Scan
on: [pull_request]

jobs:
  garak-scan:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v3
      - name: Run Garak
        run: |
          pip install garak
          garak --model_type chat --target_url http://localhost:8000
      - name: Upload results
        uses: actions/upload-artifact@v3
        with:
          name: garak-results
          path: results.json
```

Scoring & Triage

Estrutura de classificação de gravidade

Gravidade Critérios Exemplo
Crítica Execução remota de código, violação de dados, comprometimento do sistema Injeção imediata completa levando a RCE
Alto Acesso não autorizado, exposição de dados confidenciais Extração de prompt do sistema
Média Ignoração de política, acesso limitado a dados Ignorar filtro de conteúdo
Baixo Pequenas violações de política, informativas Formato de saída não intencional

Métodos de avaliação

LLM-as-Judge

Use IA para avaliar resultados de IA para segurança e conformidade com políticas

Avaliação Humana

Revisão especializada de saídas para avaliação de segurança diferenciada

Pontuação automatizada

Correspondência de padrões e avaliação baseada em regras

Métricas da equipe vermelha

Rastrear taxa de sucesso de exploração, taxa de falsos positivos

Arquitetura de remediação

Camadas de defesa

1. Filtragem de entrada

  • Detecção de padrões de prompt
  • Reconhecimento de codificação
  • Limites de comprimento
  • Limitação de taxa

2. Guardrails

  • Validação de saída
  • Filtragem de conteúdo
  • Políticas de uso de ferramentas
  • Controles de acesso

3. Proteção de modelo

  • Ajuste para segurança
  • Melhorias de RLHF
  • Engenharia de prompt do sistema
  • Ajuste de temperatura/top-p

4. Design do sistema

  • Separação de privilégios
  • Human-in-the-loop
  • Registro e monitoramento
  • Resposta a incidentes

Teste de validação

Depois de implementar as correções, teste novamente para verificar:

  • Vulnerabilidades originais não são mais exploráveis
  • As correções não introduzem novas vulnerabilidades
  • A funcionalidade do sistema permanece intacta
  • O desempenho é aceitável
  • Taxas de falsos positivos são gerenciáveis

Modelo de relatório

Resumo executivo

  • Escopo e objetivos
  • Visão geral das principais descobertas
  • Resumo da classificação de risco
  • Recomendações prioritárias

Detalhes técnicos

  • Each vulnerability with: ID, Description, Severity, Impact, Steps to Reproduce, Proof of Concept, Remediation
  • Capturas de tela e registros
  • Diagramas de cadeia de ataque
  • Trechos de código

Recomendações

  • Correções de curto prazo (ganhos rápidos)
  • Melhorias de médio prazo
  • Mudanças arquitetônicas de longo prazo
  • Requisitos de recursos
  • Linha do tempo

Apêndices

  • Saídas da ferramenta
  • Casos de teste usados
  • Referências
  • Glossário

Considerações éticas

Autorização

Always obtain explicit written permission before testing. Document scope boundaries.

Limites de escopo

Never exceed agreed-upon testing parameters. Report immediately if unintended systems are affected.

Manipulação de dados

Handle any accessed data responsibly. Don't exfiltrate more than necessary for proof.

Divulgação responsável

Allow reasonable time for remediation before public disclosure. Coordinate with vendors.

Pronto para saber mais?

Continue explorando tópicos de segurança de IA.

Prompt Injection RAG Security MCP Security Security Tools Certifications
AH
AI Hacking Team

The AI Hacking team researches and documents AI/LLM security vulnerabilities, red teaming techniques, and defensive strategies. Our guides are based on real-world pentesting experience and continuous monitoring of the AI security landscape.

Stay Ahead of AI Security

Get the latest AI/LLM security research, OWASP updates, and new vulnerabilities delivered straight to your inbox.