新智元报道
在业内公认的CyberGym网安基准上,,这个分数刚刚把一众最顶尖的模子甩到了死后。。
而拿下它的,,不是一个前沿模子,,而是微软的MDASH系统。。
微软宣布的CyberGym测试效果。。MDASH组合以95.95%的效果,,压过GPT-5.5 Cyber、Mythos 5等四个前沿模子。。(图源:Microsoft AI)
跟在MDASH死后的,,是GPT-5.5 Cyber 85.6%、Mythos 5 83.8%、GPT-5.6 Sol 83.6%、Gemini 3.5 Flash Cyber 83.2%。。
MDASH领先第二名凌驾10个百分点,,断层第一。。
更狠的是价钱:MDASH的本钱,,只有微软此前最强设置的一半。。
微软CEO纳德拉亲自在X上发帖站台:
天下级的清静能力,,一半的价钱。。
最猛的数字不是95.95%
95.95%虽然亮眼,,但真正要注重的,,是另一个数字:90%。。
九成的活,,是一个激活参数只有5B的小模子扛下来的。。
它叫MAI-Cyber-1-Flash,,微软第一个自己造的网络清静模子,,总参数137B,,激活只有5B,,是微软代码模子MAI-Code-1-Flash的网安专用微调版。。
微软AI的掌门人苏莱曼在先容MDASH时说,,MAI-Cyber-1-Flash最多处理九成盘问,,剩下最难的10%,,交给约莫比它大10倍的GPT-5.4收尾。。
MAI-Cyber-1-Flash被设计为高效处理最多90%的使命,,最难的10%才交给GPT-5.4。。(图源:Microsoft AI)
为什么要这么分????
由于网络清静,,是一场7×24小时一直的长期战。。攻击天天像潮流一样涌进来,,要扫的代码就像是一座一直堆高的山。。
在这种情形下,,真正卡脖子的不是模子够不敷智慧,,而是token够不敷自制。。
以前的打法,,是简朴粗暴地堆最贵的模子,,一遍各处扫。。
以是微软的算盘是:让自制好用的小模子顶在前面吃掉九成使命,,好把最贵的旗舰模子省下来,,只碰那一成的疑难杂症。。
这就是一套全新的AI网络清静经济学。。
MAI-Cyber-1-Flash的官方模子卡里,,藏着一个更直观的例子:
原本的MDASH跑CyberGym是88.4%。。把其中80%的模子挪用换成自制的MAI-Cyber-1-Flash,,效果非但没掉,,反而抬到95.95%。。
相比此前最好的GPT-5.4、5.4 mini和5.3 codex那套设置,,自制了整整一半。。
不过话说回来,,「最多处理九成使命」讲的是MDASH内部的模子路由比例,,不是「自动修睦了90%的误差」。。
旗舰虽然坐了冷板凳,,可活儿,,仍是一整条流水线一起干出来的。。
不是模子封神
而是系统跑出来的
95.95%,,不是MAI-Cyber-1-Flash一个模子的效果,,而是一套叫MDASH的系统跑出来的。。
它是微软的多模子误差识别与修复系统。。
内里有100多个专用智能体,,各干各的:有的审代码,,有的验误差,,有的为「这个发明是真是假」相互辩说,,有的去重,,尚有的写误差证实。。
而模子,,只是其中一个零件。。
微软把自己的打法拆成三个词:Model、Data、Harness。。模子、数据、编排。。这三样一起调优,,才有了谁人跑分。。
其中,,竞争敌手最难抄的是数据。。
微软天天能看到凌驾100万亿个清静信号,,横跨身份、终端、云和网络;;;;服务着160万家客户;;;;从微软清静响应中心一起到实战里,,什么误差被使用了、什么被盖住了、什么补丁真的管用,,全掌握在它手中。。
因此,,微软放了句很硬气的话:这段历史,,没人能凭空造出来。。
意思是,,模子你可以追,,数据你追不了。。
它想强调的是:模子只是输入,,系统才是产品。。
当各家模子的能力都被拉平,,真正拉开差别的,,是谁的系统调理得更省,,谁的清静数据攒得更久、更全。。
测的是误差复现乐成率
先搞清晰CyberGym测的究竟是什么。。
它给智能体一段补丁前的代码,,外加一份误差形貌,,让智能体写出能复现这个误差的PoC,,再拿补丁前后的版本去验证。。
CyberGym基准组成:来自188个开源项目的1507个真实误差,,智能体凭证误差形貌和补丁前代码天生PoC,,在补丁前后版本中验证复现。。(图源:CyberGym论文,,UC Berkeley)
说白了,,是「照着线索复现已知误差」,,不是「面临生疏代码盲找新洞」。。
准确地说,,是误差复现乐成率,,不是误差发明准确率。。
是不是说,,这个95.95%的数字就没那么厉害了????
CyberGym原始论文里,,其时最强的组合OpenHands加Claude-3.7-Sonnet,,复现率只有11.9%。。
一年多,,从11.9%到95.95%,,这数字爬升自己就够惊人了。。
不过,,得给这个效果打个补。。鹤柚狗⒏,,95.95%还没进CyberGym果真榜单,,榜上挂的仍是微软5月那次88.4%的旧分。。
以是严酷说,,它现在只能算「微软自己宣称」。。
但MDASH在5月12日首发时的88.45%,,就是其时CyberGym果真榜单上的最高分,,领先第二名约5个百分点。。
尚有一点,,MAI-Cyber-1-Flash现在并不是公共模子,,它只在MDASH内部,,通过Azure AI Foundry的私人预览,,向审核通过的客户开放。。
造了自己的模子
最难的活还得交给OpenAI
微软造出了自己的清静模子,,本想少依赖点OpenAI。。
可最难的那10%,,最后照旧得交给GPT-5.4收尾。。
The Decoder的点评一针见血:微软有了自己的网络清静模子,,最硬的骨头照旧得OpenAI来啃。。
微软的角色,,从「OpenAI模子的分销商」,,升级成了「编排者+自家专才」。。
但在模子这一层,,还没对OpenAI彻底「断奶」。。
从清静Copilot
到清静行动系统
统一天,,微软还甩出了一个更大的工具:Project Perception。。
这是比MDASH更大的智能体清静系统。。
红队智能体认真找出可能的攻击路径,,蓝队智能体视察、判断哪些才是真风险,,绿队智能体下手修复和加固。。
三支步队围成一个闭环,,自己找、自己判、自己修。。
Project Perception的三队智能体:红队模拟攻击,,蓝队检测分诊,,绿队修复加固,,8月3日进入果真预览。。(图源:Microsoft)
8月3日进入果真预览。。
但要害行动,,微软仍然坚持要留在人手里。。
其中能看出一条正在转变的行业主线:网络清静,,正在从「清静Copilot」转向「清静行动系统」。。
以前的系统忙着爆发更多告警,,新一代系统比的是,,能不可一连地感知、推理,,然后直接下手。。
有位清静研究者Moczad?o讲得很透:护城河正在从「模子会见」转向「验证」。。
现在花30美元跑一次果真模子,,也能复现出Mythos级别的误差狩猎。。
真正稀缺的,,是那套既能证实误差为真、又不把开发者埋进误报堆里的系统。。
以是,,以后拼的不再是谁能挪用最强的模子,,而是谁能把模子、数据、智能体、验证,,打造成一套一连运转、还信得过的清静行动系统。。
系统的牌桌,,才刚刚开局。。
参考资料:
https://x.com/satyanadella/status/2081779755146482153?s=20
https://microsoft.ai/news/introducing-mai-cyber-1-flash-inside-mdash/
https://arxiv.org/pdf/2506.02548
https://blogs.microsoft.com/blog/2026/07/27/rethinking-security-for-the-age-of-ai/
编辑:元宇