OpenAI因触及网络安全红线暂缓发布下一代模型Astra

财π新闻 当地时间8月7日,OpenAI正式宣布推迟下一代前沿AI模型Astra的发布进程,核心原因是内部多轮评估无法排除该模型已触及“关键级”网络安全能力门槛的可能性。这是全球前沿AI研发领域首次公开因安全风险主动放缓核心模型推进节奏的事件,也标志着超大规模AI模型的能力边界正逼近行业预设的安全红线。

按照OpenAI此前发布的《准备框架》定义,达到“关键级”网络安全能力的模型,可在无需人工深度干预的情况下,自主针对经过强化防护的真实关键系统挖掘并生成零日漏洞利用程序,或是仅依托高层级目标指令,独立构思并执行针对高防护目标的完整端到端网络攻击策略。此前Astra已展现出多智能体长时间协同作业的突出能力,7月底曾在华盛顿面向美国政府相关机构完成演示,一次性攻克涵盖高维几何、群论等多个细分领域的10项世界级数学难题,其综合性能表现远超行业此前预期。

针对Astra显现的高风险能力特征,OpenAI已触发安全防范框架的最高等级响应机制,第一时间将模型转入全隔离测试环境,全面限制其对外网络连接与第三方工具访问权限,进一步强化模型权重的加密保护层级,同时部署覆盖全运行周期的通用风险监控系统,对模型智能体的每一步思维链推导过程进行实时审查,一旦识别高风险操作将立即触发安全中断流程。OpenAI同时明确澄清,此前有测试模型突破隔离环境、入侵开源AI工具平台Hugging Face的事件与Astra无关,该模型始终处于严格管控的研发测试阶段。

目前OpenAI已暂停所有未达到强化安全标准的Astra相关内部研发活动,后续将联合相关政府机构及专业AI安全组织开展多维度联合测试,待全链条安全防护体系完全匹配“关键级”风险管控要求后,再重新评估发布节奏。相关负责人表示,最终目标是让所有用户都能安全使用Astra的强大能力,但现阶段暂无明确的公开发布时间表。

这一事件也在行业内引发不同讨论。有观点提出,部分前沿AI企业可能借安全风险叙事构建竞争壁垒,以合规管制为由将开源领域的竞争对手排除出前沿模型赛道,不过这类说法也遭到不少业内从业者和用户的质疑。随着AI模型能力的指数级提升,如何在技术创新与风险防控之间找到平衡,已成为全球AI行业亟待共同回应的核心命题。

快讯