Como avaliar AI SOC: guia de compra com 28 perguntas ao fornecedor e roteiro de POC de 30 dias
O que significa avaliar uma plataforma AI SOC
Avaliar uma plataforma AI SOC é medir, com dados do seu próprio ambiente, se os agentes de IA reduzem o trabalho real do time sem perder qualidade de decisão, dentro de limites de autonomia, integração e governança que a sua organização consegue auditar, antes de assinar um contrato de longo prazo.
Resumo em 5 pontos:
- O método decide mais que o fornecedor. O Gartner projeta que 70% dos grandes SOCs vão pilotar agentes de IA até 2028, mas só 15% terão ganho mensurável sem avaliação estruturada.
- Avalie em sete áreas: redução real de trabalho, medição de resultado, viabilidade e preço, ampliação do analista, limites de autonomia, integração e transparência.
- Faça as 28 perguntas por escrito. Resposta escrita pode virar anexo de contrato. Demonstração, não.
- Rode uma POC de 30 dias em quatro fases: linha de base, modo sombra, operação assistida e decisão.
- Quatro métricas sustentam a decisão: taxa de acerto do veredito, proporção de casos que exigem humano, tempo por investigação e cobertura.
Todo fornecedor de AI SOC vai demonstrar um agente triando um alerta. Essa parte deixou de diferenciar. O que separa uma compra boa de uma cara é a pergunta seguinte: com os meus alertas, as minhas ferramentas e as minhas regras de aprovação, o ganho se sustenta? A Omdia mostra a lacuna: 52% das organizações com SOC já usam IA agêntica, mas só 25% avaliam formalmente cada investimento.
Usamos como espinha dorsal as sete áreas do relatório "Validate the Promises of AI SOC Agents With These Key Questions", publicado pelo Gartner em outubro de 2025, desdobramos cada uma em perguntas ao fornecedor e fechamos com o roteiro de POC e as métricas que recomendamos exigir antes de assinar.
Leia também: Plataforma AI SOC: o que é, como funciona e quando faz sentido adotar
Por que a demonstração não basta para avaliar um AI SOC
A demonstração mostra o caso escolhido pelo fornecedor. A operação vive dos casos que ninguém escolheu. Quatro sinais públicos:
- A categoria está no pico da expectativa. No Hype Cycle for Security Operations 2026, o Gartner colocou os AI SOC agents no Peak of Inflated Expectations, com penetração de 1% a 5% e alerta explícito contra "agent washing", produtos que chamam automação comum de agente.
- Os benchmarks públicos mostram que a tarefa é difícil. No CyberSOCEval, da Meta e da CrowdStrike, os modelos testados acertaram cerca de 15% a 28% das questões de análise de malware e 43% a 53% das de raciocínio sobre inteligência de ameaças. No ExCyTIn-Bench, da Microsoft, o melhor modelo chegou a uma recompensa de 0,606 em investigações sobre 57 tabelas de log. Os dois avaliam modelos, não produtos, e lembram que o resultado depende do harness em volta do modelo e precisa ser medido no seu ambiente.
- As implantações ainda são rasas. Anton Chuvakin e Oliver Rochford observam que o uso real se concentra em enriquecimento e resumo, longe do que as promessas sugerem.
- Repetibilidade importa. Allie Mellen, da Forrester, defende avaliar agentes por acurácia, repetibilidade e explicabilidade, e observa que implementações com um agente por tarefa têm melhorado a acurácia.
Antes de olhar alternativas, o Gartner recomenda três passos: medir a linha de base da operação atual, rodar pilotos neutros em relação a fornecedor e avaliar a IA já embutida no SIEM ou XDR que a empresa tem.
As 7 áreas de avaliação do Gartner para AI SOC
No relatório, de Craig Lawson e Andrew Davies, resumido pelo BleepingComputer em março de 2026, o Gartner organiza a avaliação de AI SOC agents em sete perguntas. Acrescentamos a cada uma o sinal de alerta que vale procurar na resposta.
| # | Área | Pergunta do Gartner | Sinal de alerta na resposta |
|---|---|---|---|
| 1 | Redução real de trabalho | Reduz o trabalho que o time faz hoje? | Ganho descrito em alertas processados, não em horas de analista |
| 2 | Medição de resultado | Como medir além de "alertas processados"? | Sem linha de base, sem tempo de contenção, sem taxa de falso positivo |
| 3 | Viabilidade e preço | O fornecedor vai existir daqui a dois anos? | Preço que cresce com volume de dado, sem teto, ou dependente de rodada futura |
| 4 | Ampliação do analista | Deixa o analista melhor ou só ocupado de outro jeito? | Veredito sem raciocínio visível, que o analista só aceita ou rejeita |
| 5 | Limites de autonomia | Quais são as fronteiras da autonomia e os mecanismos de proteção? | Limites definidos pelo fornecedor, não pelo cliente |
| 6 | Integração | Funciona com o stack que já existe? | Integração crítica "no roadmap" |
| 7 | Transparência | Dá para ver o que o agente está fazendo? | Trilha que não pode ser exportada |
28 perguntas para fazer ao fornecedor de AI SOC
Peça as respostas por escrito. Na nossa leitura, uma resposta escrita vale mais que uma demonstração, porque pode ser cobrada depois.
Área 1: adequação ao caso de uso e redução de trabalho
- Quais tipos de alerta o agente trata de ponta a ponta hoje, e quais apenas enriquece?
- Quanto trabalho, em horas de analista por semana, o agente retira no meu volume, e como isso é medido?
- Para onde vai o alerta que o agente não resolve, e com que contexto chega ao analista?
- Quanto precisa ser configurado ou escrito por nós antes de o agente funcionar?
Área 2: medição de resultado
- Quais métricas o produto reporta além de "alertas processados": MTTD, tempo até a contenção, falso positivo por regra, concordância com o analista?
- Como é medida a taxa de acerto do veredito, e quem define o gabarito?
- O produto permite sortear casos encerrados pelo agente para revisão humana?
- De que ambiente vêm os números da demonstração, e posso reproduzi-los no meu?
Área 3: viabilidade do fornecedor e preço
- Qual é a unidade de cobrança (investigação, endpoint, volume de dados ou taxa fixa) e o que acontece quando o volume cresce?
- O custo do modelo de linguagem está incluso ou é repassado? Em que moeda e com que reajuste?
- Se a empresa for adquirida ou descontinuar o produto, como recupero dados, configurações e trilhas?
- Que custos ficam fora da proposta: integração, serviços profissionais, retenção de dados?
Área 4: ampliação do analista
- O analista vê o raciocínio e a evidência de cada veredito, ou só o resultado?
- O analista consegue corrigir o agente? A correção muda o comportamento futuro e fica registrada?
- Que trabalho o produto devolve ao time, como hunting e engenharia de detecção, e como isso aparece em relatório?
- Como o produto evita que o time perca a habilidade de investigar?
Área 5: limites de autonomia
- Quais ações o agente executa sem aprovação, e quem define essa lista: o fornecedor ou o cliente?
- A aprovação humana é obrigatória por arquitetura ou é uma configuração que alguém pode desligar?
- Existe kill switch para suspender o agente na hora? Quem pode acioná-lo?
- Como o agente resiste a instruções escondidas nos dados, como um e-mail escrito para induzir uma contenção automática?
Área 6: integração com o que já existe
- Quais integrações com o meu SIEM, EDR, XDR, ITSM e identidade estão em produção hoje, e quais estão no roadmap?
- A integração exige abrir portas de entrada, instalar agente nos endpoints ou copiar logs para outro repositório?
- Que credenciais o agente usa, com que privilégio e por quanto tempo?
- Quanto tempo leva da assinatura ao primeiro alerta tratado no meu ambiente?
Área 7: governança e transparência
- A trilha registra contexto consultado, plano, passos, erros e quem aprovou o quê? É exportável e imutável?
- Onde os dados são processados e armazenados, onde roda o modelo e se os meus dados treinam o modelo?
- Como funciona o controle de mudança de modelo: sou avisado quando ele muda e posso reavaliar antes?
- Que atestações o fornecedor tem (SOC 2, ISO 27001, ISO/IEC 42001) e como o produto apoia LGPD, Resolução CD/ANPD nº 15/2024 e Resolução CMN nº 4.893/2021?
As perguntas 19, 25 e 27 não são excentricidade. Pesquisa da Zylos sobre compras corporativas de agentes em 2026 registra que kill switch, trilha com valor de evidência, limites de human-in-the-loop, controle de mudança de modelo e atestações como ISO/IEC 42001 ou SOC 2 viraram condição de compra. Os níveis de autonomia por ação estão em SOC autônomo e níveis de autonomia.
Leia também: Melhores plataformas AI SOC em 2026: comparativo por tipo de fornecedor
Roteiro de POC de AI SOC em 30 dias
Trinta dias bastam se o escopo for curto: dois ou três casos de uso com volume e gabarito, como phishing reportado, identidade ou EDR. O guia de casos de uso de agentes de IA no SOC ajuda a escolher.
| Fase | Dias | O que fazer | Entregável |
|---|---|---|---|
| 1. Linha de base e escopo | 1 a 5 | Medir volume, tempo atual por investigação e falso positivo; montar o gabarito com casos já resolvidos; homologar o que será automatizado, assistido ou proibido | Critérios de aceite assinados antes de o agente ligar |
| 2. Integração e modo sombra | 6 a 12 | Conectar SIEM, EDR e XDR em leitura; o agente tria em paralelo, sem agir, e os vereditos são comparados aos do time | Primeira medição de acerto e de cobertura |
| 3. Operação assistida | 13 a 24 | O agente propõe contenções e o humano aprova ou rejeita; rodar testes adversariais, como e-mail com instrução escondida, alerta duplicado e caso fora do escopo | Métricas semanais e trilhas completas de casos reais |
| 4. Análise e decisão | 25 a 30 | Comparar com a linha de base; revisão cega de amostra; leitura da trilha por auditoria e encarregado de dados; projeção de custo no volume real | Relatório de decisão com as métricas e as respostas às 28 perguntas |
As métricas da POC
| Métrica | Como calcular | O que revela |
|---|---|---|
| Taxa de acerto do veredito | Vereditos confirmados pelo revisor ÷ vereditos revisados, em amostra cega | Qualidade da decisão |
| Falso negativo na amostra | Casos encerrados como benignos que o revisor reclassificou como maliciosos | O erro mais caro, que a demonstração nunca mostra |
| % que exige humano | Alertas escalados ou com intervenção ÷ total tratado | Quanto trabalho saiu da fila de fato |
| Tempo por investigação | Mediana e percentil 90 do alerta ao veredito com evidência, contra a linha de base | Ganho real de velocidade |
| Cobertura | Tipos de alerta tratados de ponta a ponta ÷ tipos no escopo, e fontes integradas ÷ fontes previstas | Quanto da operação o agente alcança |
| Repetibilidade | Mesmo alerta reprocessado, mesmo veredito? | Consistência, o ponto levantado pela Forrester |
| Custo por investigação | Custo projetado ÷ investigações no volume real | Se o modelo de preço escala com você |
Defina os limiares por escrito antes de começar. O número é seu, mas precisa existir antes do primeiro alerta, senão a POC vira negociação. Para MTTD e tempo de contenção, use as definições de métricas de SOC; para o custo, quanto custa AI SOC.
Três erros comuns que vale evitar:
- Medir só a redução da fila. Fila menor com falso negativo maior é piora.
- Deixar o fornecedor montar o gabarito. O gabarito é do time, com casos que o time já resolveu.
- Liberar ação no ambiente na primeira semana. O modo sombra existe para medir sem risco.
Como o EcoTrust Agentic SOC responde às perguntas de governança
O EcoTrust Agentic SOC é o AI SOC da EcoTrust: roda sobre o EcoTrust OS, opera sobre o SIEM, o EDR e o XDR que a empresa já tem e tria, investiga e contém ataques com aprovação humana para ações de alto risco. Não é SIEM, nem SOAR, nem EDR, nem MDR. Como a EcoTrust é parte interessada, a tabela traz só o que podemos afirmar hoje, com o número da pergunta, e depois o que ainda não está publicado.
| Pergunta | O que o EcoTrust Agentic SOC faz |
|---|---|
| 13. O analista vê o raciocínio? | Os incidentes são agrupados pela regra de detecção que os originou, e cada grupo recebe veredito e evidência: identificadores de evento, horário e técnica MITRE quando existe. O falso positivo é descartado com justificativa registrada |
| 17. Quem define o que é automático? | O cliente. A matriz do que é automatizado, assistido ou proibido é uma taxonomia formal homologada com ele |
| 18. A aprovação pode ser desligada? | Não. A governança é de arquitetura: toda ação que altera o ambiente segue plano, revisão, aprovação humana, execução e evidência, e o modelo não pode se autoaprovar |
| 19. Existe kill switch? | Sim. Um botão de desligamento suspende na hora a atuação dos agentes |
| 20. E a instrução escondida nos dados? | As ações ficam limitadas a um catálogo determinístico, sem caminho para comando arbitrário, e nenhuma ação no ambiente acontece sem aprovação humana registrada |
| 22. Precisa abrir portas ou instalar agente? | Não. As ferramentas entram por MCP, e o EcoTrust Connect conecta de dentro para fora, sem portas de entrada e sem agente nos endpoints. As ferramentas atuais permanecem |
| 23. Que credenciais o agente usa? | Identidades não humanas gerenciadas, com acesso privilegiado just-in-time pelo tempo da operação. Nenhuma credencial permanente |
| 25. O que fica na trilha? | O contexto consultado, o plano, cada passo e resultado, o erro e o que mudou depois dele, quem aprovou o quê e quando, em trilha exportável como evidência |
| 26. Onde ficam os dados? | Na região que o cliente escolher; em clientes de governo, no Brasil. A inferência do modelo de linguagem também pode rodar no Brasil, e a observabilidade da plataforma mostra onde estão os dados e onde roda o modelo. O Connect envia apenas resultados estruturados, por túnel criptografado, cada cliente opera em espaço isolado e o modelo não acessa diretamente o banco de dados do cliente |
| 28. Que atestações? | A EcoTrust está iniciando o processo de certificação ISO/IEC 42001, ainda sem certificado emitido. Saber onde estão os dados e o modelo ajuda o comprador a documentar LGPD e CMN 4.893/5.274, mas não substitui a avaliação de conformidade dele |
| 9 e 10. Como é cobrado? | Por alertas por mês, não por assento. O trabalho dos agentes é medido em AWU (Agent Work Unit), em que 1 AWU equivale a uma hora de trabalho de um analista qualificado, e tarefa que falha não é cobrada. A lógica de preço é pública e em reais em /preco, sem token na fatura, e a unidade está explicada em AWU: fundamentos |
O que não está publicado e você deve pedir por escrito, a nós e a qualquer fornecedor: a política de uso de dados para treinamento de modelo, o controle de mudança de modelo, o mapeamento específico para a CMN 4.893 e as demais atestações formais, como SOC 2.
Duas escolhas de produto ajudam a POC. O módulo é um catálogo de sete serviços, da triagem ao relatório de conformidade, e o cliente ativa o que precisa e mede o resultado serviço por serviço, o que encaixa no escopo de 30 dias. E a triagem usa a exposição vinda do Agentic CTEM, no mesmo EcoTrust OS, a partir do que VulScan, Surface e Baseline sabem do ativo. Um teste útil, em cenário ilustrativo: o mesmo alerta em um host exposto e em um host corrigido deve receber prioridades diferentes, e a exposição de origem do incidente deve seguir para o Flow. A tese completa está em triagem de alertas com contexto de exposição, e a documentação do produto em EcoTrust Agentic SOC: como funciona.
Leia também: SOC autônomo existe? Os níveis de autonomia L0 a L4
Perguntas Frequentes
Quanto tempo deve durar uma POC de AI SOC?
Trinta dias bastam para dois ou três casos de uso, se a linha de base for medida na primeira semana e os critérios de aceite estiverem escritos antes. POC longa sem critério tende a virar implantação informal, decidida pelo cansaço, não pelos números.
Quais métricas usar para avaliar um AI SOC?
Quatro decidem: taxa de acerto do veredito em amostra cega, proporção de casos que exigem humano, tempo por investigação contra a linha de base e cobertura. Some falso negativo, repetibilidade e custo por investigação. Alertas processados, sozinhos, não dizem nada.
Como testar se o agente erra ou alucina?
Com gabarito do próprio time e revisão cega. Misture no lote casos já resolvidos, incluindo os difíceis, e compare. Reprocesse alertas para medir repetibilidade. E rode testes adversariais, como um e-mail com instrução escondida, para ver se o agente propõe uma ação fora do escopo.
Dá para fazer a POC sem deixar o agente agir no ambiente?
Sim, e é o recomendado no começo. No modo sombra, o agente lê os alertas, investiga e emite veredito em paralelo ao time, sem executar nada. As ações só entram na fase assistida, com aprovação humana em cada uma e a trilha registrada.
Devo avaliar primeiro a IA do meu SIEM ou XDR?
O Gartner recomenda. Se a telemetria está concentrada em um fornecedor, os agentes dele podem resolver parte do problema sem novo contrato. Aplique a eles as mesmas 28 perguntas e métricas e compare com uma alternativa independente. A comparação por tipo está em melhores plataformas AI SOC.
Quem deve participar da avaliação?
O responsável pelo SOC, analistas que conhecem a fila, quem mantém as detecções, o encarregado de dados para a LGPD, auditoria ou risco para ler a trilha e compras para o contrato. Se só o time técnico avalia, trilha e contrato chegam tarde.
Conclusão: avalie o agente como avaliaria um analista
Ninguém contrata um analista de SOC só pela entrevista. Pede referências, define período de experiência, mede o trabalho e limita o acesso até a confiança existir. Na nossa visão, um agente de IA merece o mesmo rigor: perguntas por escrito, POC com gabarito do time, métricas definidas antes e limites de autonomia homologados pelo cliente.
Os números do Gartner e da Omdia dizem que a maioria ainda compra sem medir. Quem medir vai saber, em 30 dias, se o agente reduz trabalho, se acerta e se deixa uma trilha que o auditor aceita.
Referências
- Gartner, Craig Lawson e Andrew Davies, "Validate the Promises of AI SOC Agents With These Key Questions", 28 de outubro de 2025. gartner.com
- BleepingComputer, resumo das sete perguntas do Gartner para avaliar AI SOC agents, março de 2026. bleepingcomputer.com
- Gartner, "Hype Cycle for Security Operations, 2026", via Simbian, 2026. simbian.ai
- Omdia, atualização de mercado sobre agentic SOC e governança, 2026. prnewswire.com
- Meta e CrowdStrike, "CyberSOCEval", 2025; Microsoft Research, "ExCyTIn-Bench", 2025. arxiv.org
- Help Net Security, "AI SOC vendors are selling a future that production deployments haven't reached yet", 2026. helpnetsecurity.com
- Tines, entrevista com Allie Mellen, da Forrester, sobre SOC autônomo. tines.com
- Zylos Research, "Buyer-Side Governance: What Enterprise Customers Now Demand From AI Agent Vendors", 2026. zylos.ai
- ANPD, Resolução CD/ANPD nº 15/2024; Banco Central do Brasil, Resolução CMN nº 4.893/2021. gov.br/anpd, bcb.gov.br
Conheça o módulo Agentic SOC
Veja como a EcoTrust aplica IA agêntica para resolver os desafios apresentados neste artigo.
Explorar Agentic SOCArtigos Relacionados
Melhores plataformas AI SOC em 2026: comparativo de fabricantes e critérios Brasil
Melhores plataformas AI SOC em 2026: comparativo em português entre fabricantes de plataforma, com fontes, critérios Brasil e sem ranking.
Quanto custa AI SOC? Modelos de preço, TCO em reais e os custos ocultos de uma plataforma
Quanto custa AI SOC: preço por investigação, endpoint, GB ou taxa fixa, TCO em reais contra um turno 24x7 interno e os custos ocultos de tokens e câmbio.
Plataforma AI SOC: o que é, como funciona, tipos e quando faz sentido adotar em 2026
Plataforma AI SOC: o que é, os tipos (copiloto, agente, plataforma, SOAR), como funciona em camadas, o que dizem Gartner e IDC e quando faz sentido.