Agente de pentest yaga alcança 98,8% de efetividade em testes de segurança

5 минут чтения

Agente de Pentest alcança 98,8% de efetividade em testes de segurança

O agente autônomo de pentest Yaga, desenvolvido pela empresa de cibersegurança ofensiva HackerSec, atingiu 98,8% de efetividade em avaliações no formato white box. O resultado foi apresentado na versão mais recente do benchmark YagaBench e representa o melhor desempenho da tecnologia desde o início das medições.

Além do índice obtido no cenário white box, no qual o sistema recebe amplo acesso a informações sobre o ambiente analisado, o Yaga alcançou 97% de efetividade em testes gray box e 96,2% em avaliações black box. Na prática, isso significa que o agente identificou mais de 98% das vulnerabilidades existentes nos ambientes utilizados para os testes white box.

A proposta do benchmark é medir não apenas a capacidade isolada de grandes modelos de inteligência artificial, mas também o impacto de uma estrutura especializada para testes de intrusão. A HackerSec afirma que o principal diferencial está no harness desenvolvido para coordenar os modelos ao longo de todas as fases de um pentest.

Orquestração aumenta o desempenho da IA

Quando utilizados sem a camada de orquestração da Yaga, modelos de IA apresentaram resultados consideravelmente inferiores. Em um dos cenários white box, o Opus 5 registrou 61% de efetividade. Nos testes gray box, o índice foi de 48,9%, enquanto no black box chegou a 40%.

O GPT 5.6 SOL apresentou desempenho semelhante: alcançou 60,9% no formato white box e 39,5% no black box. A diferença demonstra que a qualidade do modelo, embora importante, não é suficiente para garantir bons resultados em uma operação de segurança ofensiva.

Na arquitetura da Yaga, quatro modelos atuam de maneira coordenada durante uma única execução. Cada um é direcionado para a etapa em que apresenta maior capacidade, como reconhecimento, análise de código, exploração, validação ou interpretação dos resultados.

Esse processo permite preservar o contexto entre as fases do teste. Uma descoberta feita durante o reconhecimento pode ser relacionada a uma configuração identificada posteriormente, formando uma cadeia de evidências que talvez não fosse percebida por modelos trabalhando de forma independente.

A plataforma também mantém a exploração ativa até verificar se a vulnerabilidade pode ser realmente aproveitada. Essa etapa é importante para diferenciar uma simples anomalia técnica de uma falha com impacto concreto no sistema avaliado.

Menos falsos positivos nos relatórios

Outro destaque informado pela HackerSec é a redução da taxa de falsos positivos para menos de 1%. Os poucos casos restantes passam por uma revisão feita por pentesters antes de qualquer resultado ser apresentado no painel do cliente.

A validação humana continua relevante mesmo em processos altamente automatizados. A inteligência artificial pode acelerar a descoberta de falhas, mas a confirmação do impacto, da gravidade e das condições necessárias para exploração exige análise contextual.

Relatórios com grande quantidade de falsos positivos podem dificultar a priorização das correções. Ao reduzir esse ruído, a equipe de segurança consegue concentrar esforços nas vulnerabilidades que oferecem maior risco para dados, operações e continuidade dos negócios.

White box, gray box e black box

Os três formatos avaliados representam diferentes níveis de conhecimento sobre o alvo. No white box, o agente pode receber informações detalhadas, como código-fonte, documentação, credenciais de teste e arquitetura da aplicação. Esse modelo favorece uma investigação profunda e abrangente.

No gray box, o acesso é parcial. O avaliador trabalha com algumas informações internas, mas não conhece completamente a estrutura do ambiente. Esse formato costuma reproduzir situações em que um invasor possui credenciais limitadas ou informações obtidas previamente.

Já o black box simula um ataque externo, com pouco ou nenhum conhecimento inicial sobre o sistema. Por isso, esse cenário exige maior capacidade de descoberta, enumeração e adaptação, além de representar uma das condições mais difíceis para agentes automatizados.

Automação não elimina a responsabilidade técnica

O avanço de agentes de pentest pode reduzir o tempo necessário para avaliar aplicações, redes e serviços expostos. Também permite repetir testes com mais frequência, acompanhar mudanças no ambiente e identificar regressões de segurança logo após novas implementações.

Ainda assim, a automação deve ser utilizada dentro de regras bem definidas. Testes de intrusão precisam contar com autorização formal, limites de escopo e mecanismos para evitar impactos em sistemas de produção.

A combinação entre agentes de IA e especialistas humanos tende a ser mais eficiente do que a substituição completa de profissionais. Enquanto a máquina executa tarefas repetitivas em larga escala, os analistas podem se dedicar à interpretação dos riscos, à validação de cenários complexos e à recomendação de correções.

Segundo Andrew Martinez, CEO da HackerSec, o resultado alcançado representa apenas uma etapa do desenvolvimento. A meta declarada pela empresa é chegar a 99% de efetividade em todas as modalidades de pentest até o final do ano.

Caso esse nível seja confirmado em avaliações independentes e em ambientes diversificados, agentes desse tipo poderão se tornar ferramentas relevantes para programas contínuos de gerenciamento de vulnerabilidades. O principal desafio será manter a precisão diante de aplicações personalizadas, infraestruturas híbridas e técnicas de ataque que mudam constantemente.

Outro ponto essencial será a transparência dos critérios de avaliação. Para que os números sejam comparáveis, é necessário conhecer os tipos de vulnerabilidade testados, o tamanho dos ambientes, as regras de execução e a forma como os resultados foram validados.

Mesmo com essas ressalvas, os dados indicam uma evolução significativa na aplicação prática da inteligência artificial à segurança ofensiva. A capacidade de combinar múltiplos modelos, manter contexto e confirmar a exploração pode tornar os testes mais rápidos, consistentes e úteis para a tomada de decisões.