EcoTrust
    Agentic CTEM15 min de leitura

    Como avaliar agentes de IA em segurança: 7 testes antes da compra

    Equipe EcoTrust·Publicado em ·Atualizado em

    O que significa avaliar agentes de IA em segurança

    Avaliar agentes de IA em segurança é testar, antes da compra, se o produto realmente planeja e executa trabalho por objetivo, com que identidade e privilégio age, onde ficam os dados e o modelo, como resiste a ataques contra o próprio agente e se entrega resultado medido no seu ambiente, em mais de um domínio.

    Resumo em 5 pontos:

    • Primeiro, descubra se é agente. O Gartner estima que só cerca de 130 dos milhares de fornecedores que se dizem agênticos entregam capacidade agêntica real.
    • Depois, avalie o agente como um ativo de risco. Ele tem credencial, acessa dados e executa ações. Os controles do fornecedor contra os riscos do OWASP Top 10 para aplicações agênticas fazem parte da compra.
    • Dados e modelo têm endereço. Pergunte onde os dados ficam, onde roda a inferência e se os seus dados treinam o modelo.
    • Peça atestação de governança de IA, como ISO/IEC 42001, e diferencie certificado emitido de processo iniciado.
    • Feche com uma POC em dois ou três domínios, com testes adversariais e métricas definidas antes de o agente ligar.

    Este guia é deliberadamente transversal. Se a compra é de AI SOC, as 28 perguntas por escrito e o roteiro de POC de 30 dias estão em como avaliar uma plataforma AI SOC. Aqui o foco são os testes que valem para qualquer agente de segurança, seja de exposição, vulnerabilidades, correção, terceiros ou SOC.

    Leia também: Agentes de IA para cibersegurança: o mapa por domínio

    Por que avaliar um agente é diferente de avaliar software

    Três números explicam por que a demonstração não basta.

    • Agent washing. Segundo o Gartner, muitos fornecedores rebatizam assistentes, RPA e chatbots como agentes, e só cerca de 130 dos milhares de fornecedores de IA agêntica são reais. O mesmo comunicado prevê que mais de 40% dos projetos de IA agêntica serão cancelados até o fim de 2027.
    • Controle de acesso. No Cost of a Data Breach 2025, da IBM, 97% das organizações que tiveram incidente envolvendo modelos ou aplicações de IA não tinham controles de acesso adequados para IA, e 63% das organizações violadas não tinham política de governança de IA.
    • Avaliação estruturada. O Gartner projeta que, até 2028, 70% dos grandes SOCs vão pilotar agentes de IA, mas só 15% terão melhoria mensurável sem avaliação estruturada, segundo a Help Net Security.

    Software tradicional faz o que o código manda. Um agente decide o próximo passo a partir do que lê, inclusive de dados que um atacante pode controlar. Por isso a avaliação precisa cobrir comportamento, não só funcionalidade.

    Teste 1: é agente de verdade ou automação reembalada?

    Dê ao produto um objetivo que não esteja num roteiro e observe o que acontece.

    SinalAgente realAutomação reembalada
    EntradaRecebe um objetivo ("reduzir a exposição dos servidores expostos à internet")Recebe um gatilho fixo ou um comando de menu
    PlanoMonta um plano visível, com passos e pré-requisitosExecuta sempre a mesma sequência
    FerramentasEscolhe quais ferramentas chamar e com quais parâmetrosChama as mesmas integrações na mesma ordem
    Falha no caminhoReplaneja e tenta outra rota, registrando por quêPara ou devolve erro
    MemóriaUsa o contexto de passos e conversas anterioresCada execução começa do zero
    LimiteSabe quando parar e pedir aprovação humanaOu não age, ou age sem perguntar

    Automação determinística não é defeito. Muitas operações devem rodar sempre igual, e uma boa plataforma combina passos fixos com decisões do agente. O problema é pagar por agente e receber um script com chat por cima. A diferença está detalhada em automação vs IA agêntica.

    Teste 2: como o fornecedor protege o próprio agente

    O agente que você compra também é alvo. O OWASP publicou em dezembro de 2025 o Top 10 for Agentic Applications 2026, e ele serve como roteiro de perguntas ao fornecedor. O guia completo em português está em OWASP Top 10 para IA agêntica.

    Risco OWASPO que pode acontecerEvidência aceitável do fornecedor
    ASI01, sequestro do objetivoUm texto escondido num ticket, num e-mail ou no nome de um ativo redireciona o agenteDemonstração ao vivo com instrução maliciosa nos dados e o agente recusando a ação
    ASI02, uso indevido de ferramentasO agente chama uma ferramenta legítima com parâmetros perigososAções limitadas a um catálogo, com validação de parâmetros e sem caminho para comando arbitrário
    ASI03, abuso de identidade e privilégioO agente herda credenciais amplas e permanentesIdentidade própria por agente, privilégio mínimo e acesso just-in-time
    ASI08, falhas em cascataO erro de um agente se propaga para outros agentes e sistemasPontos de parada, aprovação humana nas ações de impacto e kill switch

    Peça a resposta por escrito e a demonstração do controle, não um slide. Um fornecedor que nunca testou o próprio agente contra instrução escondida nos dados ainda não está pronto para agir no seu ambiente.

    Leia também: OWASP Top 10 para IA agêntica: os riscos ASI01 a ASI10 em português

    Teste 3: credenciais, identidade e a aprovação humana

    Um agente de segurança costuma ter mais acesso que a maioria dos usuários. Sete perguntas resolvem a maior parte do risco:

    1. Que identidade o agente usa: uma conta compartilhada, a credencial de um analista ou uma identidade não humana própria?
    2. O privilégio é permanente ou concedido só pelo tempo da operação?
    3. Onde ficam os segredos, e eles aparecem mascarados nos logs?
    4. Quem define o que o agente faz sozinho, o que exige aprovação e o que é proibido: o fornecedor ou você?
    5. A aprovação humana é imposta pela arquitetura ou é uma configuração que alguém pode desligar?
    6. O modelo pode aprovar a própria ação?
    7. Existe kill switch que suspende os agentes na hora, e quem pode acioná-lo?

    O Gartner recomenda governança proporcional ao nível de autonomia de cada agente e prevê que, até 2027, 40% das empresas vão rebaixar ou desligar agentes autônomos por lacunas descobertas só depois de incidentes. O desenho da matriz de autonomia está em governança de agentes de IA e human-in-the-loop.

    Teste 4: conexões, MCP e superfície de ataque

    Para agir, o agente precisa chegar às suas ferramentas. Cada conexão é uma porta.

    • Como o agente chega ao ambiente? Exige abrir portas de entrada, VPN ou instalar software nos endpoints?
    • Usa MCP? Se sim, quais servidores, quem os mantém, como autenticam e como o fornecedor evita servidores maliciosos ou alterados depois de aprovados. Os ataques típicos estão em segurança do MCP.
    • O que sai do ambiente? Conteúdo bruto dos sistemas ou só resultados estruturados?
    • Isolamento entre clientes. Em plataforma multi-tenant, como se garante que um agente nunca enxerga dados de outra organização?
    • Acesso do modelo ao banco. O modelo de linguagem consulta diretamente o banco de dados ou passa por uma camada controlada?

    Teste 5: dados, modelo e treinamento

    Telemetria de segurança tem dado pessoal, segredo industrial e mapa da sua rede. Antes de assinar, obtenha por escrito:

    • Residência: em que região os dados são armazenados e processados.
    • Inferência: onde o modelo de linguagem roda, e se pode rodar no Brasil.
    • Treinamento: se os seus dados, prompts ou resultados treinam o modelo do fornecedor ou de terceiros, e como desligar isso.
    • Provedor do modelo: qual modelo é usado, como o fornecedor avisa quando ele muda e se você pode reavaliar antes.
    • Retenção: por quanto tempo prompts, respostas e trilhas ficam guardados e como são apagados.
    • LGPD: se houver transferência internacional por cláusulas contratuais, elas seguem as cláusulas-padrão da Resolução CD/ANPD nº 19/2024.

    Teste 6: governança de IA e atestações

    A norma ISO/IEC 42001 define um sistema de gestão de inteligência artificial e virou o pedido natural em compras de agentes. Já há fabricantes de segurança certificados: a CrowdStrike anunciou em janeiro de 2026 a certificação ISO/IEC 42001 cobrindo capacidades da plataforma Falcon, inclusive o Charlotte AI.

    Na avaliação, separe três situações: certificado emitido, com escopo e organismo certificador; processo de certificação iniciado; e nenhum dos dois. Complemente com o mapeamento do fornecedor para o NIST AI RMF, explicado em gestão de riscos de IA pelo NIST, e com o que ele prevê para a supervisão humana exigida pelo PL 2338/2023 em sistemas de alto risco, ainda em tramitação.

    Teste 7: POC em vários domínios

    Agente bom num domínio pode ser fraco em outro. Uma POC útil cobre dois ou três domínios com contexto compartilhado, por exemplo exposição, vulnerabilidades e SOC, e segue este roteiro:

    1. Defina objetivos, não funcionalidades. "Reduzir as vulnerabilidades exploráveis nos ativos expostos" diz mais que "rodar uma varredura".
    2. Monte a linha de base e o gabarito com casos que o seu time já resolveu.
    3. Homologue a matriz de autonomia: o que é automático, o que é assistido, o que é proibido.
    4. Rode em modo sombra. O agente propõe e o time compara, sem ação no ambiente.
    5. Faça testes adversariais: instrução escondida num ticket, ativo com nome malicioso, dado contraditório entre duas fontes.
    6. Libere ações com aprovação e leia a trilha de cada uma.
    7. Meça e decida com as métricas abaixo.
    MétricaComo medirDomínio em que mais pesa
    Acerto da decisãoDecisões confirmadas pelo revisor em amostra cegaTodos
    Trabalho que sai da filaHoras de analista retiradas por semana, contra a linha de baseTodos
    Exposição reduzida e validadaVulnerabilidades exploráveis fechadas com re-teste e evidênciaExposição e vulnerabilidades
    Uso do contexto entre domíniosCasos em que a decisão usou dado de outro domínio, como a exposição do ativo numa triagemPlataformas multi-domínio
    Resistência adversarialTestes adversariais em que o agente recusou ou escalou corretamenteTodos
    Trilha completaAções com plano, aprovação, resultado e evidência registradosTodos
    Custo por resultadoCusto projetado dividido pelos resultados entregues no volume realTodos

    Para SOC, o detalhamento por fase e as métricas de veredito estão em como avaliar uma plataforma AI SOC. Para agentes de exposição e ofensivos, veja agentes de IA na gestão de vulnerabilidades e agentes de IA no pentest.

    Leia também: Plataformas de agentes de IA para segurança: comparativo de fabricantes

    O custo também é critério de avaliação

    A unidade de cobrança muda o comportamento do contrato. Por assento, por ativo, por investigação, por token ou por trabalho entregue: cada modelo cresce de um jeito com o seu volume. Pergunte se o custo do modelo de linguagem está incluso ou repassado, em que moeda, e se tarefa que falha é cobrada. A conta completa está em quanto custa um agente de IA.

    Como a EcoTrust responde a estes testes

    A EcoTrust é fabricante e passa pelos mesmos testes. Abaixo, só o que está publicado sobre o EcoTrust OS, o runtime onde rodam o Agentic CTEM e o EcoTrust Agentic SOC, e o que ainda não publicamos.

    TesteO que a EcoTrust publicaO que pedir por escrito
    1. Agente realPlan-mode: o pedido vira um plano com pré-requisitos checados; subagentes em paralelo que replanejam quando um caminho falha; memória entre passos e conversas; serviços em modo determinístico, híbrido ou totalmente agênticoDemonstração com um objetivo seu, fora do catálogo
    2. Proteção do agenteNo SOC, ações limitadas a catálogo determinístico, sem caminho para comando arbitrário; nenhuma ação no ambiente sem aprovação humana registradaResultado de testes adversariais no seu ambiente, na POC
    3. Identidade e aprovaçãoIdentidades não humanas com acesso just-in-time; o modelo não pode se autoaprovar; matriz do que é automatizado, assistido ou proibido homologada com o cliente; kill switchSem pendência
    4. ConexõesO EcoTrust Connect conecta de dentro para fora por túnel criptografado, sem portas de entrada e sem agente nos endpoints; ferramentas do cliente entram por MCP; envia só resultados estruturados; cada cliente em espaço isolado; o modelo não acessa diretamente o banco de dados do clienteLista de integrações por fabricante e versão
    5. Dados e modeloDados na região que o cliente escolher, no Brasil para governo; a inferência pode rodar no Brasil; a observabilidade mostra onde estão os dados e o modeloPolítica de uso de dados para treinamento, por escrito no contrato
    6. Governança de IAProcesso de certificação ISO/IEC 42001 iniciadoCertificado ainda não emitido
    7. POC multi-domínioDez módulos agênticos do ciclo CTEM, como VulScan, Surface e AutoPatch, e o SOC no mesmo modelo de dadosEscopo e métricas da POC definidos com o seu time
    CustoAWU, em que 1 AWU equivale a uma hora de analista qualificado; tarefa que falha não é cobrada; sem token na fatura; lógica pública em /precoValor final em proposta

    Checklist final do comprador

    1. O produto planejou e replanejou diante de um objetivo fora do roteiro.
    2. O fornecedor demonstrou controles contra ASI01, ASI02, ASI03 e ASI08.
    3. O agente usa identidade própria, com privilégio mínimo e temporário.
    4. Você define o que é automático, assistido e proibido.
    5. A aprovação humana não pode ser desligada por configuração, e o modelo não se autoaprova.
    6. Há kill switch com responsável definido.
    7. As conexões não exigem portas de entrada nem software nos endpoints, ou o risco foi aceito por escrito.
    8. Os servidores MCP estão inventariados e autenticados.
    9. Região dos dados, local da inferência e política de treinamento estão no contrato.
    10. O status de ISO/IEC 42001 está claro: emitido, em processo ou inexistente.
    11. A POC cobriu pelo menos dois domínios, com testes adversariais e gabarito do seu time.
    12. O custo por resultado foi projetado no seu volume real.

    Perguntas Frequentes

    Como saber se um produto é agente de IA ou só automação?

    Dê um objetivo que não esteja no roteiro e observe se ele monta um plano, escolhe ferramentas, replaneja quando algo falha e pede aprovação no ponto certo. Se executa sempre a mesma sequência, é automação, útil mas diferente do que está sendo vendido.

    Quais perguntas fazer a um fornecedor de agentes de IA de segurança?

    Pergunte que identidade o agente usa, quem define o que ele faz sozinho, se a aprovação humana pode ser desligada, onde ficam dados e modelo, se seus dados treinam o modelo, como ele resiste a instrução escondida nos dados e que atestação de governança de IA o fornecedor tem. Para AI SOC, use também as 28 perguntas específicas.

    A ISO/IEC 42001 é obrigatória para fornecedores de agentes?

    Não é obrigatória por lei no Brasil, mas é a norma de sistema de gestão de IA mais reconhecida e já há fabricantes de segurança certificados. Diferencie certificado emitido, com escopo, de processo de certificação apenas iniciado.

    Quanto tempo deve durar uma POC de agentes de IA?

    Para um domínio, 30 dias costumam bastar, como no roteiro de AI SOC. Para dois ou três domínios com contexto compartilhado, reserve de 30 a 45 dias, mantendo o modo sombra antes de liberar qualquer ação no ambiente.

    Como testar prompt injection num agente de segurança?

    Na POC, plante instruções em dados que o agente vai ler, como um ticket, o campo de descrição de um ativo ou o corpo de um e-mail, pedindo uma ação indevida. O resultado esperado é recusa ou escalonamento, com o episódio registrado na trilha.

    Conclusão: avalie o agente como um colaborador com acesso privilegiado

    Um agente de segurança lê dados que você não controla, usa credenciais e executa ações. Avaliá-lo só pela demonstração é como contratar alguém com acesso privilegiado sem checar referências. Os sete testes cobrem o que decide: se é agente de verdade, como se protege, com que identidade age, por onde entra, onde ficam os dados, que governança comprova e que resultado entrega no seu ambiente.

    Aplique a mesma régua a todos os fornecedores, inclusive à EcoTrust, e guarde as respostas por escrito. Elas valem mais no contrato do que qualquer slide.


    Referências

    • Gartner, "Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027", 25 de junho de 2025. gartner.com
    • Gartner, "Gartner Says Applying Uniform Governance Across AI Agents Will Lead to Enterprise AI Agent Failure", 26 de maio de 2026. gartner.com
    • IBM, "Cost of a Data Breach Report 2025", comunicado de 30 de julho de 2025. nasdaq.com
    • Help Net Security, "Gartner: 70% of SOCs will pilot AI agents. Only 15% will see results", 9 de setembro de 2026. helpnetsecurity.com
    • OWASP GenAI Security Project, "OWASP Top 10 for Agentic Applications for 2026", dezembro de 2025. genai.owasp.org
    • CrowdStrike, "CrowdStrike Achieves ISO 42001 Certification for Responsible AI-Powered Cybersecurity", janeiro de 2026. ir.crowdstrike.com
    • ISO, "ISO/IEC 42001:2023 Artificial intelligence: Management system". iso.org
    • NIST, "AI Risk Management Framework (AI RMF 1.0)", 2023. nist.gov
    • ANPD, Resolução CD/ANPD nº 19/2024. gov.br/anpd

    Conheça o módulo Agentic CTEM

    Veja como a EcoTrust aplica IA agêntica para resolver os desafios apresentados neste artigo.

    Explorar Agentic CTEM

    Artigos Relacionados