微软称MDASH在网络安全测试中超越Claude Mythos和GPT-5.6 Sol

By: rootdata|2026/07/27 19:01:04

微软发布了其首个专门的网络安全模型MAI-Cyber-1-Flash,并将其集成到MDASH中。根据公司说法,这一漏洞猎捕系统的性能超过了Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol,且成本比微软当前最佳的MDASH配置低50%。

根据微软的说法,组合设置在CyberGym上的得分为95.95%。CyberGym是一个基准测试,要求AI代理重现1,507个已知漏洞,涵盖188个开源项目,然后根据在受控环境中成功重现的百分比进行评分。

这使得MDASH在得分上领先于GPT-5.5 Cyber(85.6%)、Mythos 5(83.8%)、GPT-5.6 Sol(83.6%)和Gemini 3.5 Flash Cyber(83.2%)。这一结果由微软自报,在发布时尚未出现在CyberGym的公共排行榜上,尽管该基准使用的是公共测试集和定义的成功指标。

MAI-Cyber-1-Flash并不是单独工作的。微软表示,它处理高达90%的任务,而MDASH将最困难的10%任务交给GPT-5.4。这一点很重要,因为每次模型读取代码或生成答案时,处理文本的代币——AI处理的文本块——都会产生费用。

这是微软首次推出一个旨在提高效率的模型,能够超越以通用能力为目标构建的密集型最先进模型。微软首席执行官萨提亚·纳德拉(Satya Nadella)表示:“与MDASH结合时,(MAI-Cyber-1-Flash)以领先模型50%的成本提供世界级的性能。”

一个模型(在此情况下是MAI-Cyber-1-Flash)是对代码进行推理的AI。一个支架(在此情况下是MDASH)是围绕它的机械装置:决定在哪里查找、挑战可疑发现、去除重复项并证明一个漏洞可以被触发的代理、工具、检查和工作流程。

MDASH使用了100多个专门的代理,负责审核代码、辩论发现是否真实,并构建概念证明——一个证明缺陷存在的有效演示。

微软表示,随着AI使漏洞发现变得更便宜,偶尔的扫描和延迟的补丁变得过时。该公司认为,数十年的安全数据使其具有优势,并补充道:“没有人能制造这种历史。”

自从Claude Mythos发布以来,网络安全专家一直在努力超越或匹配其能力。研究人员以每次扫描不到30美元的成本,使用公共模型重现了Mythos风格的漏洞猎捕。参与研究的达维德·莫查兹洛(Dawid Moczadło)表示:“护城河正在从模型访问转向验证。”

稀缺的部分正在成为能够证明发现而不让开发人员陷入虚假警报的系统。

Decrypt还报道,GPT-5.5 Cyber最近以85.6%的得分在公共CyberGym中领先,略微超过了Mythos。微软的得分比GPT-5.5 Cyber高出约10分,比MDASH之前的结果高出7.5分,但它评估的是整个系统,而不是单独的MAI-Cyber-1-Flash。

微软正在通过Defender门户的Microsoft Security Exposure Management将MDASH投入私人预览。客户可以扫描Git存储库,查看从不太可能到已证明的发现排名,并使用Defender CLI生成供开发人员审查的建议代码修复。

当前预览限制存储库约为256MB,并允许每个租户进行一次并发扫描。项目Perception预计将把相同的多代理方法扩展到更广泛的威胁监控和修复工作流程中。

-- 价格

--

免责声明:本内容仅用于一般品牌传播与信息说明之目的,不构成任何金融、投资、法律或税务建议。文中提及的活动、奖励、线上活动或相关信息,不应被视为对购买、出售、交易任何加密资产,或使用任何服务的推荐、招揽或邀请。加密资产具有高波动性,并存在价值损失风险。WEEX 服务及线上活动的可用性可能因地区而异,并受当地适用法律法规及用户资格要求限制。部分活动可能不适用于某些司法辖区。您有责任确保访问及使用 WEEX 服务符合当地适用法律法规。在参与任何涉及加密资产的活动前,请充分评估相关风险。

猜你喜欢

iconiconiconiconiconicon
客户服务:@weikecs
商务合作:@weikecs
量化做市商合作:[email protected]