Pentest com IA: o que o teste automatizado já faz e onde falha
O que é pentest com IA
Pentest com IA é o teste de invasão em que agentes de inteligência artificial executam parte do trabalho ofensivo: mapear a aplicação, decidir o que testar, tentar a exploração e confirmar se a falha é real, com o especialista humano definindo escopo, validando achados e respondendo pelo laudo. É diferente de um scanner, que só compara assinaturas e versões.
Até pouco tempo atrás, "pentest automatizado" era quase um eufemismo para varredura de vulnerabilidades com relatório bonito. Isso mudou rápido. Em 2025, um sistema autônomo chegou ao topo do ranking de pesquisadores dos Estados Unidos na HackerOne, uma das maiores plataformas de bug bounty do mundo, à frente de milhares de hackers humanos.
O avanço é real, mas a pergunta que interessa a quem contrata não é se a IA consegue achar falhas. É quais falhas ela acha bem, quais ela ainda perde e quem responde pelo resultado. Este artigo separa o que o pentest com IA já entrega, o que continua exigindo um especialista e como avaliar uma oferta que use IA no teste. Para a base do tema, veja o guia Pentest: o que é e tipos de teste.
Leia também: Pentest contínuo e PTaaS: o que é, como funciona e quando usar
Resumo em 5 pontos
- A IA já encontra falhas reais em escala. O caso XBOW na HackerOne mostrou volume e velocidade que nenhum time humano acompanha.
- Volume não é o mesmo que precisão. Parte relevante dos relatórios automatizados é duplicada ou informativa e precisa de triagem humana.
- Lógica de negócio e encadeamento seguem humanos. Entender o que a aplicação deveria fazer ainda depende de quem conhece o negócio.
- Aplicação feita com IA pede teste frequente. Código gerado por modelos de linguagem traz falha de segurança em quase metade dos casos, com destaque para controle de acesso.
- Quem assina o laudo é humano. Regulador, auditor e diretoria exigem um responsável técnico, independência e evidência reproduzível.
O caso XBOW: o que o primeiro lugar na HackerOne prova (e o que não prova)
Em 2025, o XBOW, sistema de pentest autônomo, se tornou o primeiro não humano a liderar o ranking de pesquisadores dos Estados Unidos na HackerOne, segundo reportagem da CSO Online. Em poucos meses, a ferramenta enviou cerca de 1.060 relatórios de vulnerabilidades a programas de bug bounty reais.
Os números que a própria empresa publicou ajudam a calibrar a expectativa. Dos cerca de 1.060 envios, 130 vulnerabilidades já tinham sido resolvidas pelos donos dos programas e 303 estavam triadas (reconhecidas, mas ainda não corrigidas). Por outro lado, 208 foram marcadas como duplicadas, 209 como informativas e 36 como não aplicáveis. A empresa também informou que os achados eram totalmente automatizados, mas que sua equipe de segurança os revisou antes do envio, para cumprir a política da HackerOne sobre ferramentas automatizadas.
Três conclusões saem daí:
- A capacidade é real. Encontrar e comprovar centenas de falhas em ambientes de produção que outros pesquisadores já tinham testado não é trabalho de scanner.
- A taxa de ruído não é zero. Mais de 40% dos envios foram duplicados, informativos ou não aplicáveis. Em um pentest corporativo, alguém precisa fazer essa triagem antes que o achado chegue ao time de desenvolvimento.
- Houve revisão humana. Mesmo o caso mais citado de IA ofensiva autônoma teve especialistas no circuito.
Também vale lembrar que bug bounty não é pentest. No bug bounty, o pesquisador escolhe onde procurar e é pago por achado válido. No pentest, o escopo é definido por contrato, a cobertura precisa ser demonstrada e a ausência de achado também é informação que vai para o relatório.
Scanner, pentest automatizado e pentest com IA: diferenças
Os três termos aparecem misturados em propostas comerciais. A tabela separa o que cada um entrega.
| Critério | Scanner de vulnerabilidades | Pentest automatizado tradicional | Pentest com IA (agentes) |
|---|---|---|---|
| Como decide o que testar | Lista fixa de checagens | Roteiro predefinido de ataques | Raciocina sobre a aplicação e escolhe o próximo passo |
| Exploração | Não explora, infere pela versão | Explora casos conhecidos | Tenta explorar e confirma a falha com evidência |
| Aplicação autenticada | Limitada | Depende de configuração manual | Navega como usuário, inclusive com sessão autenticada |
| Encadeamento de falhas | Não | Raro | Parcial, em cadeias curtas |
| Lógica de negócio | Não | Não | Limitada; depende de contexto que a IA não tem |
| Falso positivo | Alto | Médio | Menor quando há validação da exploração, mas não zero |
| Frequência viável | Diária | Semanal | A cada release |
| Atende teste anual independente | Não | Não | Só como apoio ao especialista que assina |
O ponto central é a coluna da exploração. Pentest com IA vale pelo que confirma, não pelo que suspeita. Se a ferramenta não mostra requisição, resposta e prova de impacto, ela está mais perto de um scanner do que de um pentest. A diferença entre automação por regra e agentes que decidem está explicada em Automação vs IA agêntica.
O que a IA já faz bem no pentest
Os agentes de IA ganharam espaço justamente nas tarefas que consomem a maior parte do tempo de um pentester e que menos exigem julgamento de negócio:
- Reconhecimento e mapeamento. Enumerar rotas, parâmetros, endpoints de API não documentados e tecnologias em uso, inclusive em aplicações de página única que scanners clássicos não navegam bem.
- Teste autenticado em escala. Manter sessão, trocar de perfil e repetir o mesmo teste em centenas de rotas sem cansar.
- Classes de falha bem conhecidas. Injeção, cross-site scripting, falhas de configuração, exposição de dados e boa parte das categorias do OWASP Top 10:2025.
- Validação da exploração. Confirmar que a falha é explorável antes de reportar, o que reduz o falso positivo típico de scanner.
- Documentação da evidência. Registrar payload, requisição e resposta de forma reproduzível, o que acelera a correção e o reteste.
- Repetição a cada mudança. Rodar de novo a cada release, coisa que um pentest manual não faz por custo e por agenda.
O que ainda exige um especialista humano
Há quatro territórios em que a IA, hoje, apoia o especialista, mas não o substitui.
Lógica de negócio. Um desconto que pode ser aplicado duas vezes, um fluxo de aprovação que pode ser pulado, um saldo que fica negativo quando duas transações chegam juntas. Nada disso é uma vulnerabilidade de catálogo. Para enxergar o abuso, é preciso saber como o negócio deveria funcionar.
Encadeamento de impacto. O pentester experiente combina três achados de baixa severidade (um vazamento de identificador, uma rota sem limite de requisições e uma permissão excessiva) em um ataque de alto impacto. Agentes já fazem cadeias curtas; cadeias longas e criativas ainda dependem de gente.
Autorização e regras de engajamento. Decidir até onde ir em produção, quando parar, o que não tocar (como pagamentos reais, dados de cliente, sistemas de terceiros) e quando escalar para o cliente é decisão humana, combinada em contrato. Um agente que encontra credenciais de um sistema fora do escopo não deveria decidir sozinho se as usa.
Responsabilidade pelo laudo. Para instituições reguladas pelo Banco Central, a Resolução CMN 5.274/2025 e a Resolução BCB 538/2025 exigem teste de intrusão anual conduzido por terceiro independente, segundo análise do escritório Baker McKenzie. Auditor e regulador querem saber quem executou, com qual metodologia e quem responde tecnicamente pelo resultado. Uma ferramenta não ocupa esse lugar. Os critérios para contratar esse teste estão em Teste de invasão para empresas: como contratar e o que exigir.
Leia também: Agentes de IA no pentest dentro do CTEM
Vibe coding: por que aplicação feita com IA pede teste com IA
O argumento mais forte para o pentest com IA não vem do lado do atacante. Vem do lado de quem escreve o código.
O 2025 GenAI Code Security Report da Veracode avaliou código produzido por mais de 100 modelos de linguagem em 80 tarefas reais e encontrou falhas de segurança em 45% dos casos. Em Java, a taxa passou de 70%. O relatório também observa que os modelos melhoraram em escrever código que funciona, mas não em escrever código seguro, e que modelos maiores não se saíram significativamente melhor.
A NetSPI, que faz pentest em aplicações construídas com vibe coding, descreve o padrão que mais aparece: a aplicação acerta a autenticação (quem é o usuário) e erra a autorização (o que ele pode acessar). O resultado são falhas de referência direta a objeto (IDOR) e de autorização em nível de objeto em APIs (BOLA), em que basta trocar o número de um pedido na URL para ver o pedido de outro cliente.
Essa classe de falha é exatamente o topo do OWASP Top 10:2025, que mantém o controle de acesso quebrado (A01) como a categoria mais crítica. E ela tem uma característica incômoda: o código passa nos testes de produto, porque funciona para o usuário legítimo. Só aparece quando alguém testa como outro usuário.
Quando funcionalidade nova sai de um prompt e chega à produção no mesmo dia, um pentest manual por ano não acompanha. Testar com agentes a cada release, autenticado e com mais de um perfil, é a forma de manter a cobertura no ritmo do código. O tema de testes frequentes está detalhado em Pentest contínuo e PTaaS.
Há ainda um efeito na correção. O State of Pentesting Report 2025 da Cobalt mostra que só 21% dos achados sérios encontrados em pentests de aplicações com modelos de linguagem são resolvidos, a menor taxa entre todos os tipos de teste. Testar mais não adianta se a evidência não for clara o bastante para o desenvolvedor corrigir.
Riscos de usar IA no pentest
Usar IA no teste também traz riscos que precisam constar na proposta e nas regras de engajamento:
- Dados sensíveis enviados a modelos de terceiros. Requisições e respostas da aplicação podem conter dado pessoal. Pergunte onde o modelo roda e o que fica retido.
- Ação destrutiva em produção. Um agente que tenta explorar uma falha pode apagar registros ou disparar transações. Limites precisam ser técnicos, não só contratuais.
- Saída de escopo. Agentes seguem links e descobrem ativos. Sem lista de exclusão, podem testar sistemas de terceiros.
- Falso negativo silencioso. Ausência de achado da IA não prova ausência de falha. O relatório precisa dizer o que foi coberto.
Checklist para avaliar uma oferta de pentest com IA
- A ferramenta explora e comprova, ou só aponta? Peça um achado de exemplo com requisição, resposta e prova de impacto.
- Testa autenticado e com mais de um perfil? Sem isso, IDOR e BOLA ficam de fora.
- Quem revisa os achados antes de chegarem ao seu time? Exija nome da função responsável pela triagem.
- Quem assina o relatório? Para conformidade, precisa ser um especialista de terceiro independente.
- Onde roda o modelo e que dados ele retém? Peça isso por escrito.
- Quais ações são proibidas para o agente? Liste exclusões de escopo e operações destrutivas.
- Há reteste? A correção precisa ser validada, de preferência pela mesma metodologia.
- O relatório mostra cobertura? Rotas testadas, perfis usados e categorias OWASP cobertas.
Como a EcoTrust usa IA no pentest
O serviço de Pentest da EcoTrust é pentest por especialistas com IA agêntica: a execução e a responsabilidade técnica são de especialistas, que seguem metodologia OWASP e PTES em rede interna, rede externa, aplicações web e APIs, e a plataforma de IA agêntica potencializa o trabalho. A entrega inclui relatório executivo, relatório técnico com evidências, passos de reprodução e classificação CVSS, reunião de debriefing e reteste em D+30 ou D+60 sem custo adicional.
Para o teste frequente entre um pentest e outro, o AppSec usa um agente autônomo que navega, mapeia e testa a aplicação de ponta a ponta sem definição manual de escopo, virtualiza um usuário autenticado, explora toda a superfície acessível e executa 27 categorias de vulnerabilidades, com cobertura integral do OWASP Top 10:2025. Cada achado traz payload, requisição, resposta do servidor e código de correção recomendado, e segue para o Flow, que conduz o ciclo até o fechamento. A diferença entre esse tipo de teste dinâmico e um pentest está em DAST: o que é e como funciona.
Perguntas Frequentes
A IA vai substituir o pentester?
Não no horizonte de quem precisa contratar um teste hoje. A IA já assume reconhecimento, testes repetitivos, validação de falhas conhecidas e documentação, o que libera o especialista para lógica de negócio, encadeamento de falhas e decisões de escopo. Mesmo o caso XBOW teve revisão humana antes do envio dos achados.
Pentest automatizado com IA serve para atender o Banco Central?
Sozinho, não. A regulação do Banco Central exige teste de intrusão anual por terceiro independente, com responsável técnico e evidências. A IA pode e deve ser usada como ferramenta dentro desse teste e para testes frequentes entre um ciclo e outro, mas não substitui o teste independente.
Qual a diferença entre pentest com IA e scanner de vulnerabilidades?
O scanner compara versões e assinaturas com bases de falhas conhecidas e aponta suspeitas. O pentest com IA usa agentes que decidem o próximo passo, tentam explorar a falha e só reportam o que conseguem comprovar, com requisição e resposta. Na prática, a diferença aparece no falso positivo e na capacidade de testar a aplicação autenticada.
Pentest com IA encontra falhas de lógica de negócio?
Parcialmente. Agentes já identificam alguns padrões, como acesso a objeto de outro usuário. Falhas que dependem de saber como o negócio deveria funcionar, como aplicar um desconto duas vezes ou pular uma aprovação, ainda dependem de um especialista que conheça o contexto.
É seguro rodar pentest com IA em produção?
É seguro quando há regras de engajamento técnicas: lista de exclusão de escopo, bloqueio de ações destrutivas, limite de carga, janela de teste e contato de emergência. Também é preciso saber onde o modelo roda e que dados da aplicação ele retém.
Pentest com IA é mais barato?
Reduz o custo por teste, porque o trabalho repetitivo deixa de consumir horas de especialista, e por isso viabiliza testar com mais frequência. O custo do pentest manual independente continua existindo. Os fatores que formam o preço estão em Quanto custa um pentest.
Conclusão: a IA muda o ritmo do pentest, não a responsabilidade por ele
O pentest com IA deixou de ser promessa. Agentes já encontram e comprovam falhas reais em escala, testam aplicações autenticadas e repetem o trabalho a cada release, algo que nenhum time humano faz por custo e por agenda. Ao mesmo tempo, os próprios números do caso mais famoso mostram ruído relevante e revisão humana no circuito.
O modelo que faz sentido para empresas é o que divide o trabalho pelo que cada lado faz melhor: agentes de IA testando com frequência a aplicação que muda todo dia, sobretudo quando ela foi escrita com IA, e especialistas cuidando da lógica de negócio, do encadeamento, das regras de engajamento e do laudo que o regulador e a diretoria vão ler. Na hora de comparar fornecedores, use o checklist acima e os critérios de Empresas de pentest no Brasil: como escolher.
Referências
- CSO Online, "The top red teamer in the US is an AI bot", 2025. csoonline.com
- XBOW, "The road to Top 1: How XBOW did it", 2025. xbow.com
- TechRepublic, "AI Bug Hunter Sets Milestone By Claiming Top Spot on HackerOne's Leaderboard", 2025. techrepublic.com
- Veracode, "2025 GenAI Code Security Report", 2025. veracode.com
- NetSPI, "Vibe Coding: A Pentester's Dream", 2025. netspi.com
- Cobalt e Cyentia Institute, "State of Pentesting Report 2025", 2025. cobalt.io
- Baker McKenzie, "Brazil: BCB and CMN establish additional cyber security requirements", dezembro de 2025. bakermckenzie.com
- OWASP Foundation, "OWASP Top 10:2025", 2025. owasp.org/Top10/2025
Conheça nosso serviço de Pentest
Fale com especialistas da EcoTrust e veja como podemos ajudar sua empresa na prática.
Conhecer o serviçoArtigos Relacionados
Pentest contínuo e PTaaS: o que é, como funciona e quando usar
Pentest contínuo testa a aplicação a cada mudança, não uma vez por ano. Veja como funciona o PTaaS, o que ele não substitui e como montar o programa.
Pentest: o que é, como funciona e tipos de teste (guia 2026)
Pentest é a simulação controlada de um ataque real para provar até onde um invasor chegaria. Veja tipos (black, gray, white box), fases e pentest web.
Security by Design: princípios, abordagens e como aplicar no desenvolvimento seguro
Guia completo sobre Security by Design: entenda os princípios (menor privilegio, defesa em profundidade, zero trust), como implementar em cada fase do SDLC, requisitos regulatórios (LGPD, GDPR) e como a EcoTrust válida a postura de segurança com testes contínuos DAST e gestão de vulnerabilidades.