A Microsoft lançou o seu primeiro modelo dedicado de cibersegurança, MAI-Cyber-1-Flash, a 27 de Julho e o modelo foi integrado no MDASH, um sistema de caça a vulnerabilidades que obteve 95,95% no benchmark CyberGym. A empresa afirma que esta configuração supera o Mythos 5 da Anthropic e o GPT-5.6 Sol da OpenAI, custando 50% menos do que a melhor configuração atual do MDASH da Microsoft. O CyberGym é um benchmark que pede a agentes de IA que reproduzam 1.507 vulnerabilidades conhecidas em 188 projectos open-source, classificando-as pela percentagem de reproduções bem-sucedidas num ambiente controlado. O CEO da Microsoft, Satya Nadella, afirmou que o sistema combinado entrega desempenho de nível mundial a metade do custo dos modelos líderes, assinalando a primeira vez que um modelo da Microsoft focado em eficiência superou modelos state-of-the-art densos construídos para capacidades gerais.
MDASH supera modelos concorrentes no benchmark CyberGym
O sistema MDASH da Microsoft obteve 95,95% no CyberGym, de acordo com a empresa. Este resultado colocou-o à frente do GPT-5.5 Cyber, com 85,6%, do Mythos 5, com 83,8%, do GPT-5.6 Sol, com 83,6%, e do Gemini 3.5 Flash Cyber, com 83,2%. O resultado foi autodeclarado pela Microsoft e, na data de publicação, não tinha aparecido no leaderboard público do CyberGym, embora o benchmark utilize um conjunto de testes público e uma métrica de sucesso definida. A pontuação representa cerca de 10 pontos acima do GPT-5.5 Cyber e 7,5 pontos acima do resultado anterior do MDASH.
MAI-Cyber-1-Flash assume 90% da carga de trabalho com apoio do GPT-5.4
O MAI-Cyber-1-Flash não funciona sozinho. A Microsoft diz que trata até 90% das tarefas, enquanto o MDASH encaminha os 10% mais difíceis para o GPT-5.4. O modelo é uma IA que raciocina sobre código, enquanto o MDASH é o banco de ensaio — a maquinaria que inclui agentes, ferramentas, verificações e um fluxo de trabalho que decide onde procurar, desafia conclusões suspeitas, remove duplicados e comprova que os bugs podem ser acionados. O MDASH utiliza mais de 100 agentes especializados atribuídos para auditar código, debater se uma descoberta é genuína e construir uma prova de conceito que demonstra que a falha existe.

A Microsoft abre uma pré-visualização privada através do portal Defender
A Microsoft está a colocar o MDASH em pré-visualização privada através do Microsoft Security Exposure Management no portal Defender. Os clientes podem analisar repositórios Git, ver descobertas classificadas de improváveis a comprovadas, e utilizar a Defender CLI para gerar potenciais correcções de código para revisão por parte dos programadores. A pré-visualização, neste momento, limita os repositórios a cerca de 256MB e permite uma única análise concorrente por tenant. Espera-se que o Project Perception estenda a mesma abordagem multi-agente para além da análise de código, passando para fluxos de monitorização e remediação mais abrangentes de ameaças.
FAQ
Que pontuação conseguiu o MDASH da Microsoft no CyberGym?
A Microsoft afirma que o MDASH obteve 95,95% no CyberGym, um benchmark que pede a agentes de IA que reproduzam 1.507 vulnerabilidades conhecidas em 188 projectos open-source.
Como é que o MAI-Cyber-1-Flash distribui a sua carga de trabalho?
A Microsoft diz que o MAI-Cyber-1-Flash trata até 90% das tarefas, enquanto o MDASH encaminha os 10% mais difíceis para o GPT-5.4. O sistema utiliza mais de 100 agentes especializados para auditar código e validar descobertas.
Quais são os limites da pré-visualização privada do MDASH?
A pré-visualização, neste momento, limita os repositórios a cerca de 256MB e permite uma única análise concorrente por tenant através do Microsoft Security Exposure Management no portal Defender.