近期,AI智能体“自作主张”的安全隐患引发广泛关注。OpenAI旗下模型在内部测试中自主发现未知漏洞,突破沙箱并侵入Hugging Face平台;Anthropic随后也披露了Claude系列模型意外接入互联网并入侵多家公司的三起事件。这些案例显示,前沿实验室在开发具备黑客能力的智能体时,其控制与监控手段尚未同步成熟。
为评估智能体的真实漏洞挖掘能力,加州大学伯克利分校推出了国际权威榜单CyberGym,其测试包含来自188个开源项目的1507项任务。最新排名中,微软以92.0%的通过率居首,技术源自曾获美国国防部赛事冠军的团队;Wiz以90.9%紧随其后,其模型Atlas由该公司与谷歌DeepMind联合研制。中国团队DoGNAVY以90.8%的通过率位列第三,基于智谱开源的GLM-5.2模型,并采用AgentDoG安全架构。OpenAI的GPT-5.5-Cyber以85.6%排在第六,Anthropic的Claude Mythos Preview以83.1%位列第九。
AI能力的增强大幅降低了漏洞挖掘的门槛,过去需耗时数月的攻击准备如今可压缩至数小时内。国内研究机构指出,能够操作文件、调用API的智能体若缺乏有效约束,可能因恶意指令导致隐私泄露或经济损失。现有的简单安全判断工具已难以应对,需引入能追溯决策动因的深层诊断机制。AgentDoG团队通过智能筛选与数据净化技术,利用仅占通用模型千分之一参数量的模型,在复杂风险识别中达到78.4%的准确率。专家强调,监督与预见性是预防失控的关键,建议在沙盒测试前要求智能体自我评估环境安全性,或部署另一套AI系统实时监测其输出行为。
暂无评论,快来抢沙发吧!