EcoTrust
    Agentic CTEM14 min de leitura

    Agentes de IA no pentest: validação ofensiva contínua no CTEM

    Equipe EcoTrust·Publicado em ·Atualizado em

    O que são agentes de IA no pentest

    Agentes de IA no pentest são sistemas que recebem um alvo e um escopo, planejam o ataque em etapas, usam ferramentas reais (scanners, navegadores, frameworks de exploração) e adaptam a estratégia a cada resposta do ambiente, até provar ou descartar que uma falha é explorável. No programa de exposição, eles servem para validar continuamente o que a priorização colocou no topo da fila.

    Durante anos, o teste de intrusão foi um evento: um projeto anual, com escopo fechado, que gera um relatório e envelhece no dia seguinte ao deploy. Entre um teste e outro, o ambiente muda, aplicações novas entram em produção e vulnerabilidades novas são publicadas. A pergunta "isso é explorável aqui, hoje?" fica sem resposta por meses.

    Agentes ofensivos mudam a frequência dessa pergunta. Para o panorama do teste automatizado em si, veja o guia de pentest com IA. Aqui o foco é outro: como agentes ofensivos se encaixam dentro de um programa de gestão contínua de exposição a ameaças (CTEM), o que eles fazem bem, onde ainda falham e quais regras de engajamento são inegociáveis.

    Leia também: Pentest: o que é, tipos, metodologias e quando realizar

    Resumo em 5 pontos

    1. Agente ofensivo não é scanner: ele formula hipóteses, encadeia técnicas e só reporta o que conseguiu comprovar.
    2. No CTEM, ele mora na fase de validação: confirma explorabilidade do que foi priorizado e re-testa depois da correção.
    3. Não substitui o pentester: lógica de negócio, criatividade e responsabilidade técnica pelo laudo continuam humanas.
    4. Precisa de regras de engajamento escritas: escopo, limites de taxa, janelas, ações proibidas, aprovação humana e kill switch.
    5. A evidência é o produto: requisição, resposta e caminho de ataque reproduzível, que viram fila de correção.

    Por que agentes ofensivos entraram no programa de exposição

    O primeiro motivo é a velocidade do atacante. Segundo o relatório State of Exploitation 2026 da VulnCheck, 28,96% das vulnerabilidades sabidamente exploradas em 2025 foram atacadas no dia da publicação da CVE ou antes dele. Um teste anual não acompanha esse ritmo; uma validação contínua tem chance.

    O segundo é a maturidade técnica. Em 2025, o XBOW, um sistema autônomo de testes ofensivos, chegou ao primeiro lugar do ranking dos Estados Unidos na plataforma de bug bounty HackerOne depois de enviar mais de 1.000 relatos de vulnerabilidade em poucos meses. Segundo a própria empresa, 132 desses achados foram confirmados e corrigidos pelos donos dos programas e 303 estavam triados até a publicação. É um sinal de que agentes já encontram falhas reais em sistemas reais, ainda que o número de relatos aceitos seja bem menor que o de enviados.

    O terceiro é que o atacante também usa agentes. Em novembro de 2025, a Anthropic relatou ter interrompido uma campanha de espionagem, atribuída por ela a um grupo patrocinado pelo Estado chinês (GTG-1002), em que a IA executou cerca de 80% a 90% das etapas táticas contra aproximadamente 30 alvos. O relato é do próprio fabricante e parte da comunidade de segurança questionou o grau de autonomia descrito. O próprio documento registra uma limitação importante: o modelo frequentemente exagerava resultados e chegou a inventar credenciais, o que obrigou os operadores a validar tudo manualmente.

    Por fim, o mercado se reorganizou. Em março de 2025, o Gartner publicou o Market Guide for Adversarial Exposure Validation (AEV), que junta numa só categoria o breach and attack simulation (BAS), o pentest automatizado e o red teaming automatizado. O Gartner projeta que, até 2027, 40% das organizações terão iniciativas formais de validação de exposição.

    Leia também: Validação de exposição e BAS: como usar no CTEM

    O que um agente ofensivo faz, etapa por etapa

    Um agente de pentest bem construído segue a mesma lógica de um profissional, com a diferença de que roda continuamente e registra cada passo:

    1. Reconhecimento: mapeia domínios, subdomínios, portas, serviços e tecnologias do alvo dentro do escopo autorizado.
    2. Enumeração: navega a aplicação, descobre rotas e APIs não documentadas e, quando recebe credenciais, explora a área autenticada.
    3. Formulação de hipóteses: a partir do que encontrou, decide que classes de falha testar (injeção, controle de acesso, configuração, componentes vulneráveis).
    4. Exploração controlada: executa testes dentro dos limites definidos e observa a resposta do sistema.
    5. Encadeamento: combina achados de baixa severidade em um caminho que leva a um ativo crítico, como faz um atacante real.
    6. Confirmação independente: separa a hipótese do modelo da prova. Um achado só é reportado se a exploração for reproduzível por uma verificação determinística.
    7. Evidência e recomendação: registra payload, requisição, resposta e passos para reproduzir, com orientação de correção.
    8. Re-teste: depois da correção, repete o caminho para confirmar que ele foi de fato fechado.

    A etapa 6 é a que separa um bom agente de uma fonte de ruído. O raciocínio de um modelo de linguagem é probabilístico, e o caso GTG-1002 mostra o que acontece quando ninguém confere: achados inventados que parecem reais.

    Agente ofensivo, BAS, scanner e pentest humano: onde cada um entra

    Os métodos de validação se complementam. A tabela resume o que cada um entrega:

    CritérioScanner de vulnerabilidadesBASAgente ofensivoPentest humano
    Pergunta que respondeQue falhas conhecidas existem?Meus controles detectam e bloqueiam?Esta exposição é explorável aqui?Até onde um atacante criativo chega?
    Frequência típicaContínuaContínua ou semanalContínua ou por eventoAnual ou por projeto
    Prova de exploraçãoNãoSimuladaSim, com evidênciaSim, com laudo
    Encadeamento de falhasNãoPor cenário pré-definidoSim, adaptativoSim, criativo
    Lógica de negócioNãoNãoLimitadaForte
    Risco operacionalBaixoBaixoMédio, exige regrasMédio, com equipe experiente
    Responsável pelo laudoFerramentaFerramentaFerramenta, revisada por humanoProfissional certificado

    A conclusão prática: o agente ofensivo ocupa o espaço entre o scanner, que acha muito e prova pouco, e o pentest humano, que prova muito mas raramente. Ele não elimina nenhum dos dois.

    Leia também: Avaliação de vulnerabilidades vs pentest: qual a diferença

    Onde os agentes ofensivos entram no ciclo CTEM

    No CTEM, a validação é a fase que pergunta se a exposição priorizada é real no contexto da empresa. Agentes ofensivos atuam em três momentos do ciclo:

    • Depois da priorização: recebem a fila de exposições críticas e testam se cada uma é alcançável e explorável. O que se comprova sobe na fila com evidência; o que não se comprova é registrado com o motivo.
    • Em eventos: uma CVE crítica publicada, uma aplicação nova em produção ou uma mudança de perímetro disparam uma validação pontual, sem esperar o próximo ciclo anual.
    • Depois da mobilização: quando a correção é aplicada, o agente repete o ataque. O ciclo só fecha quando o caminho deixa de funcionar.

    Esse circuito fecha a lacuna mais comum dos programas de vulnerabilidade: a fila de correção baseada em severidade teórica. Com evidência de exploração anexada, a conversa com o time de infraestrutura ou de desenvolvimento muda de "o scanner disse" para "aqui está a requisição que expõe os dados".

    O mesmo raciocínio vale para o lado defensivo do ciclo. O guia de agentes de IA na gestão de vulnerabilidades mostra como agentes operam descoberta, priorização e mobilização, e a análise de caminhos de ataque explica como combinar achados em rotas até ativos críticos.

    Limites: o que agentes ofensivos ainda não fazem bem

    Vender agente ofensivo como "pentester autônomo completo" é exagero. Os limites atuais são concretos:

    • Lógica de negócio: falhas que dependem de entender o processo (aprovar o próprio pedido, burlar um limite de crédito, combinar dois fluxos legítimos) ainda são território humano.
    • Alucinação de achados: sem verificação independente, o agente pode reportar exploração que não aconteceu.
    • Escopo e impacto: um agente sem limites pode sair do escopo, gerar carga excessiva ou executar ação destrutiva em produção.
    • Prompt injection: páginas e respostas do alvo podem conter instruções que tentam desviar o agente. O risco está mapeado no OWASP Top 10 para aplicações agênticas.
    • Responsabilidade e regulação: quando o teste é exigido por regulador, auditoria ou contrato, alguém precisa assinar o escopo, a metodologia e o laudo. Esse papel continua humano.
    • Credenciais do próprio agente: o agente guarda acessos privilegiados ao ambiente de teste. Se ele for comprometido, vira o atacante.

    Regras de engajamento para agentes ofensivos

    A Cloud Security Alliance trata a supervisão humana em pentest agêntico como requisito de arquitetura, não como boa prática opcional: humanos definem o escopo e aprovam ações de alto impacto, e o próprio agente não pode decidir quais de suas ações precisam de aprovação. Na prática, um programa de validação com agentes deveria ter, por escrito:

    1. Escopo técnico fechado: lista de alvos autorizados (domínios, faixas de IP, aplicações) aplicada pela plataforma, não só pelo prompt.
    2. Janelas e limites de taxa: quando o agente pode rodar e com que intensidade, para não degradar produção.
    3. Lista de ações proibidas: exclusão ou alteração de dados, negação de serviço, persistência, movimentação para fora do escopo.
    4. Aprovação humana para ações de alto impacto: exploração que altera estado ou toca sistemas críticos espera um "aprovar".
    5. Identidade própria e privilégio mínimo: credenciais de teste dedicadas, com rotação e sem reuso de contas reais.
    6. Kill switch: capacidade de interromper todos os agentes de uma vez.
    7. Trilha completa: cada requisição e cada decisão registrada, para auditoria e para investigar comportamento inesperado.
    8. Verificação independente dos achados: nenhum resultado sai do agente direto para o relatório sem confirmação reproduzível.
    9. Integração com a fila de correção: achado validado vira tarefa com dono e prazo, e o re-teste é agendado automaticamente.

    O desenho completo de autonomia graduada, registro de agentes e identidades não humanas está no guia de governança de agentes de IA e human-in-the-loop.

    O mercado de validação ofensiva agêntica

    A categoria cresceu rápido. Alguns exemplos com informação pública, sem ranking:

    • XBOW: sistema autônomo de testes ofensivos que liderou o ranking dos Estados Unidos da HackerOne em 2025.
    • Horizon3.ai NodeZero: plataforma de pentest autônomo que encadeia vulnerabilidades entre hosts e usa o fluxo "encontrar, corrigir, verificar", em que o teste é repetido depois da correção.
    • Check Point Agentic Exposure Validation: lançado em maio de 2026, usa agentes que raciocinam como atacantes para provar o que é explorável a partir da superfície externa.
    • PentAGI: projeto open source que orquestra agentes para testes de intrusão, útil para equipes que querem experimentar em laboratório.

    Ao comparar, olhe menos para a demonstração e mais para os controles: como o escopo é imposto, como os achados são confirmados, o que exige aprovação e como a evidência chega à fila de correção. O guia de como avaliar agentes de IA para segurança traz o roteiro completo.

    Como a EcoTrust aborda a validação ofensiva

    A EcoTrust é fabricante de uma plataforma de IA agêntica para cibersegurança, e a validação é uma das fases do Agentic CTEM, que roda sobre o EcoTrust OS. Aplicando os critérios deste artigo, de forma factual:

    • O que existe hoje: o AppSec testa aplicações web em execução com um agente que navega, mapeia e testa de ponta a ponta sem definição manual de escopo, virtualiza um usuário autenticado e executa 27 categorias de vulnerabilidades, com cobertura do OWASP Top 10:2025. Cada achado vem com evidência técnica completa: payload, requisição, resposta do servidor e código de correção recomendado.
    • O que não é: o AppSec é DAST autenticado com evidência de exploração. A EcoTrust não o apresenta como pentest autônomo completo de rede e aplicação, nem como substituto do teste conduzido por especialistas.
    • Da evidência à correção: os achados seguem para o Flow, que dá dono, prazo e histórico a cada exposição até o fechamento, e o AutoPatch encerra o ciclo com re-scan que confirma que a vulnerabilidade foi fechada, não apenas que o patch foi instalado.
    • Controles do runtime: no EcoTrust OS, o agente planeja, pede aprovação, executa e mostra o resultado; nada toca o ambiente sem o "aprovar". Há isolamento entre organizações, rastreabilidade de cada ação com segredos mascarados, observabilidade sobre o raciocínio dos agentes e kill switch.
    • Quando é preciso um especialista: para o teste exigido por regulador ou para explorar lógica de negócio, o serviço de Pentest de Rede e Aplicação segue metodologias OWASP e PTES, e seus achados alimentam a plataforma para acompanhamento até o fechamento.

    Perguntas Frequentes

    Agentes de IA vão substituir o pentester?

    Não no horizonte visível. Eles absorvem o trabalho repetitivo de reconhecimento, enumeração e teste de classes conhecidas de falha, e fazem isso com frequência que nenhuma equipe humana alcança. Lógica de negócio, criatividade, julgamento de impacto e responsabilidade pelo laudo continuam com o profissional.

    Qual a diferença entre agente ofensivo e BAS?

    O BAS executa cenários de ataque pré-definidos para medir se os controles detectam e bloqueiam. O agente ofensivo decide o próximo passo a partir do que encontra e tenta provar que uma exposição específica é explorável. No mercado, os dois convergem na categoria de validação adversarial de exposição.

    É seguro rodar agentes ofensivos em produção?

    Pode ser, desde que existam escopo imposto pela plataforma, limites de taxa, lista de ações proibidas, aprovação humana para ações de alto impacto, kill switch e trilha completa. Sem essas regras, o risco operacional é real.

    Pentest feito por agente vale para auditoria e regulador?

    Depende da exigência. Muitos reguladores e contratos pedem um teste com responsável técnico, metodologia declarada e laudo assinado. Agentes podem apoiar e aumentar a cobertura, mas o teste formal costuma continuar sob responsabilidade de especialistas.

    Com que frequência rodar validação com agentes?

    De forma contínua para as exposições no topo da fila e por evento sempre que surgir uma CVE crítica, uma aplicação nova ou uma mudança de perímetro. O re-teste após cada correção é o que fecha o ciclo.

    Conclusão: o agente ofensivo é o motor da validação, não o fim do pentest

    Agentes de IA tornaram possível responder com frequência a pergunta que o pentest anual responde uma vez por ano: esta exposição é explorável aqui, hoje? Dentro de um programa CTEM, eles confirmam o que a priorização apontou, anexam evidência à fila de correção e re-testam depois do conserto.

    O valor depende das regras. Escopo imposto, verificação independente dos achados, aprovação humana no que tem impacto e trilha completa são o que separa validação contínua de um atacante automatizado sem supervisão. Com essas regras, agentes ofensivos e especialistas humanos deixam de competir e passam a cobrir partes diferentes do mesmo problema.

    Leia também: Análise de caminhos de ataque: como o atacante enxerga sua rede


    Referências

    • XBOW, "The road to Top 1: How XBOW did it", 2025. xbow.com
    • CSO Online, "The top red teamer in the US is an AI bot", 2025. csoonline.com
    • Gartner, "Market Guide for Adversarial Exposure Validation", 2025. gartner.com
    • Anthropic, "Disrupting the first reported AI-orchestrated cyber espionage campaign", 2025. anthropic.com
    • VulnCheck, "State of Exploitation 2026", 2026. vulncheck.com
    • Cloud Security Alliance, "Best Practices to Achieve the Benefits of Agentic AI in Pentesting", 2025. cloudsecurityalliance.org
    • Horizon3.ai, "NodeZero autonomous pentesting", 2026. horizon3.ai
    • Check Point Software, "Check Point Software Launches Agentic Exposure Validation", 2026. checkpoint.com
    • PentAGI, repositório open source, 2025. github.com/vxcontrol/pentagi
    • OWASP GenAI Security Project, "OWASP Top 10 for Agentic Applications for 2026", 2025. genai.owasp.org

    Conheça nosso serviço de Pentest

    Fale com especialistas da EcoTrust e veja como podemos ajudar sua empresa na prática.

    Conhecer o serviço

    Artigos Relacionados