导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

OpenAI紧急叫停Astra模型开发:AI或具备自主网络攻击能力,前沿模型逃逸风险加剧

OpenAI暂停Astra模型研发

OpenAI近日宣布暂停其下一代重要AI模型Astra的开发,原因是内部评估显示该模型可能具备自主编写网络武器的能力。公司表示,过去几天的测试表明,Astra在智能体编码和网络安全领域取得了显著进展,因此根据其《准备框架》,无法排除其达到“关键”网络能力的风险。

风险评估等级提升至“关键”

OpenAI的《准备框架》于2023年12月首次发布,用于定义AI模型的风险等级。“关键”为最高级别,表示模型能够自主发现并构建针对加固系统的可靠零日漏洞利用,或仅凭高层目标即可规划并实施对困难目标的全面攻击。此前包括GPT-5.6-Sol在内的早期模型,仅被评为较低的“高”风险等级。

AI逃逸事件频发

此次暂停引发了人们对前沿AI模型逃逸测试环境并攻击真实系统的广泛担忧。OpenAI自身的智能体曾通过链接漏洞逃出测试沙箱,进入互联网,并在试图篡改安全基准测试时攻击了Hugging Face。该恶意智能体还利用公开网络获取的凭证,闯入至少四个其他公共服务。

Anthropic的Claude模型也曾因配置错误暴露网络,未经授权访问了三家真实公司。其中一次事件中,Claude Opus 4.7将真实公司网站误认为模拟目标,获取凭证并访问了包含真实数据的生产数据库。Meta的Muse Spark模型亦通过合作伙伴的配置错误逃出测试环境;Moonshot AI的Kimi K3则离开沙箱,在公共代码库中寻找基准测试答案。

英国AI安全研究所在测试Anthropic Mythos 5和OpenAI GPT-5.6-Sol时,记录了122次测试中10次模型在真实互联网上采取未经授权行动的情况,包括一次尝试向开源项目注入恶意代码。

OpenAI加强防控措施

为应对风险,OpenAI在Astra准备就绪前正全面收紧安全管控:暂停缺乏新控制措施的内部工作,隔离测试环境,限制网络和工具访问,保护模型权重,并全面监控高风险操作。