微软于 7 月 27 日发布其首个专注于网络安全的模型 MAI-Cyber-1-Flash,并将其集成到 MDASH 中;该系统在 CyberGym 基准测试中获得了 95.95% 的评分。该公司表示,这一配置在成本上比微软当前最优的 MDASH 设置低 50%,同时击败了 Anthropic 的 Mythos 5 以及 OpenAI 的 GPT-5.6 Sol。CyberGym 是一种基准测试,要求 AI 代理在受控环境中复现 188 个开源项目中的 1,507 个已知漏洞,并根据成功复现的百分比对其进行评分。微软首席执行官 Satya Nadella 表示,合并后的系统以一半成本交付世界级性能,这也是首次让微软专注效率的模型击败为通用能力构建的稠密最先进模型。
MDASH 在 CyberGym 基准测试中胜过竞争模型
根据微软说法,MDASH 系统在 CyberGym 上的得分为 95.95%。这一结果使其领先于 GPT-5.5 Cyber(85.6%)、Mythos 5(83.8%)、GPT-5.6 Sol(83.6%)以及 Gemini 3.5 Flash Cyber(83.2%)。该结果由微软自述,并且在发布时尚未出现在 CyberGym 的公开排行榜上;不过该基准使用公开测试集,并且采用了定义明确的成功衡量标准。该分数大约比 GPT-5.5 Cyber 高 10 分,比 MDASH 先前的结果高 7.5 分。
MAI-Cyber-1-Flash 以 GPT-5.4 备份承担 90% 工作负载
MAI-Cyber-1-Flash 并不是独自工作。微软表示它最多处理 90% 的任务,而 MDASH 会将最困难的 10% 转交给 GPT-5.4。该模型负责对代码进行推理;而 MDASH 则是“支架”——包含代理、工具、检查,以及决定去哪里寻找的工作流程:对疑似发现进行挑战、移除重复,并证明漏洞能够被触发。MDASH 使用 100 多个专门代理来审计代码、辩论某项发现是否属实,并构建概念验证,以证明该缺陷确实存在。

微软通过 Defender 门户开启私有预览
微软正在通过 Defender 门户中的 Microsoft Security Exposure Management 将 MDASH 推入私有预览。客户可以扫描 Git 代码库,查看从“不太可能”到“已证实”的排序发现,并使用 Defender CLI 为开发者审查生成建议的代码修复。当前预览将代码库限制在大约 256MB,并允许每个租户同时进行一次扫描。Project Perception 预计会将相同的多代理方法扩展到代码扫描之外的更广泛威胁监测与补救工作流中。
FAQ
微软的 MDASH 在 CyberGym 上取得了多少分?
微软表示,MDASH 在 CyberGym 上获得了 95.95% 的评分;该基准测试要求 AI 代理在 188 个开源项目中复现 1,507 个已知漏洞。
MAI-Cyber-1-Flash 如何分配工作负载?
微软表示,MAI-Cyber-1-Flash 负责处理最多 90% 的任务,而 MDASH 将最困难的 10% 转交给 GPT-5.4。该系统使用 100 多个专门代理来审计代码并验证发现。
MDASH 私有预览的限制是什么?
该预览当前将代码库限制在大约 256MB,并通过 Defender 门户中的 Microsoft Security Exposure Management 允许每个租户同时进行一次扫描。