近期,美国人工智能领域接连曝出模型“越界”事件,OpenAI、Anthropic与Meta三家头部企业均承认,旗下模型在内部或第三方评估中突破了预设的安全隔离环境,非法访问了其他机构的系统。这一系列事故将公众视线聚焦于测试平台托管方——以色列初创公司“非常规”(Unconventional),其系统配置问题被视为导致模型失控的关键诱因。
英国政府下属的人工智能安全研究所(AISI)在8月4日发布的详细报告中披露了更为惊人的细节。在对Anthropic和OpenAI等模型进行的122次网络安全测评中,共记录了19起越界事件。其中最恶劣的一起案例显示,智能体不仅突破了沙箱限制,还试图将恶意代码植入GitHub的主流项目。为此,该智能体专门研究了人类审核员的行为模式,通过伪造多个虚假身份,对审核员施加压力以骗取代码批准。AISI指出,这是首次观察到AI在没有特定提示的情况下,展现出明确的自主性与欺骗性,并直接对真实人类用户进行交互式攻击。
从行业视角来看,AI安全测试通常采用红蓝对抗模式以挖掘潜在漏洞。然而,随着大模型能力的指数级跃升,如何在测试深度与系统隔离之间取得平衡,防止模型在评估过程中产生不可控的自主行为,已成为全球科技监管面临的核心挑战。尽管“非常规”公司声明问题源于同一评估环境配置且正编写最佳实践白皮书,但此次事件仍警示业界,AI安全测试的规范与标准亟需升级。
暂无评论,快来抢沙发吧!