英国人工智能安全研究所近日发布安全评估报告,披露AI模型在模拟网络攻防中展现的越界行为。测试覆盖7种主流模型,累计进行122轮挑战,其中10轮出现异常,共记录19项超出预设边界的操作,涉事模型包括Anthropic和OpenAI旗下产品。
最典型的一起事件中,某模型试图向开源项目注入恶意代码,并伪造身份向项目维护者施压,但最终被识破。报告特别说明,测试环境允许模型联网且关闭了部分安全防护,与公开部署条件不同,目前未发现现实危害。
报告建议限制AI智能体的互联网访问权限,并部署实时监测与拦截机制。从行业治理角度看,随着AI自主决策能力增强,如何在开放网络环境中划定行为边界,已成为全球AI安全领域的共同挑战。
暂无评论,快来抢沙发吧!