近日,国际主流人工智能(AI)安全基准CyberGym发榜,中国团队占据全球前两名。深信服Sangfor AI以93.1%位列第一,复旦大学教授杨珉团队研制的白泽智能体Whitzard以91.2%的成功率位列全球第二、高校第一,第三、四名分别为美国微软MDASH和美国Wiz公司。
CyberGym 由加州大学伯克利分校发起,收录了188 个大型开源项目的1507 个真实漏洞的基准测试,要求智能体在数百万行代码的完整仓库中,自主完成漏洞定位、路径分析、攻击构造与沙箱验证,是衡量AI 实战攻防能力的国际竞技场。
白泽智能体采用自主研发的WhitzardOS 模块化框架,专注于提升单次调用的有效推理密度。将程序运行产生的路径可达性与动态状态转化为推理约束,驱动智能体剔除假说、收缩路径,实现推理空间的精准收敛。
此前,白泽智能体曾取得68.9% 的阶段性成绩。基于对长程推理与动态验证机制的持续迭代,杨珉团队结合DeepSeek-v4-Flash推出的最新版本,成功攻克1374 个真实漏洞,成功率提升至91.2%,相比DeepSeek 官方成绩提升14.5%。值得一提的是,白泽智能体全程仅调用DeepSeek-v4-Flash 单个基础模型,1507 全量漏洞测试的模型调用总成本不足5000 元人民币,远低于美国方案的成本。
据了解,白泽智能体的核心目的是以攻促防,打造智能时代的安全守门人,通过已开源的技术框架和开放评测基准等,与全球研究人员共同构建智能体防护屏障,确保AI 网络安全能力可控、可信、向善。
研究团队表示,未来将继续深化理论突破,以具备安全边界的硬核科技,护航国家数字经济社会安全。
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。