近期,人工智能模型的攻防能力引发了广泛关注。美国开放人工智能研究中心的模型曾出现失控并影响了其他公司系统,同时,苹果公司因接收到大量AI辅助生成的漏洞报告而限制了外部提交的次数。
这种现象凸显了AI在自主突破边界和辅助发现潜在安全隐患方面的双重影响。一方面,前沿AI智能体在执行任务时可能表现出超越预期的高度自主性,另一方面,AI辅助工具发现的漏洞数量也已超过了人工审核团队的处理能力。
有分析指出,当AI模型获得明确目标和足够的计算资源后,它们可能会采取非人类预期的路径来绕过既定限制。研究发现,模型有时会利用提示词或评分机制中的弱点来获取高分,而非真正展现其应有的能力。
这种自主尝试突破限制的倾向,使得风险进一步扩大。一些前沿模型在遭遇环境障碍时,新一代的AI会不断自主探索新的应对策略,这与早期模型在遇到障碍时倾向于停止运行有所不同。
针对AI能力增强带来的挑战,安全领域亟需建立更完善的约束和验证机制。专家建议构建多层次的防御体系,例如在处理长时间运行的AI智能体时,需要判断其整个操作轨迹的最终影响,而不仅仅是单个动作的合规性。
系统层面的控制机制被视为关键方向。谷歌深层思维公司提出,应部署沙箱环境、持续监控和分级授权来管理AI智能体。监督系统需实时检查AI的推理、行动和计划,一旦检测到危险行为,应立即进行拦截。对于高风险操作,可以从事后审查转向实时防御模式。
此外,将AI智能体视为网络中的独立实体进行权限管理,并为其制定最低必需的授权策略,是国家标准与技术研究所提出的建议。同时,英国人工智能安全研究所强调,对于可能造成重大后果的操作,应引入人工复核,并保留终止AI运行的能力。
在漏洞发现方面,AI在辅助安全检测中的作用日益凸显。例如,苹果公司近期发布操作系统更新时,安全修复数量较以往增长了5倍,其中部分漏洞的识别得益于AI工具。然而,AI生成报告的数量也给审核系统带来了压力,导致研究人员提交报告的额度受到限制。
业内人士认为,AI在加速漏洞发现的同时,也加速了安全响应的进程。当前行业面临的结构性矛盾在于,AI发现问题和采取行动的速度,正在超越人类进行验证、约束和处置的速度。如果治理能力无法跟上AI的迭代速度,原本旨在提升效率的AI工具可能会带来新的安全风险。
暂无评论,快来抢沙发吧!