AI行业连续出现核心研究员因安全风险辞职 呼吁全行业协作与外部监管介入

AI行业连续出现核心研究员因安全风险辞职 呼吁全行业协作与外部监管介入

财π新闻 27岁的人工智能领域研究员Jacob Coxon正式宣布从Anthropic离职,这并非他近期在行业内的唯一一次职业变动,此前他曾作为GPT-4o的核心贡献者在OpenAI任职,今年初正是出于对Anthropic安全声誉的认可,他选择从OpenAI跳槽至这家以安全研究为核心特色的前沿AI企业,而在入职短短数月之后,他做出的选择是彻底退出整个AI行业,不再参与任何前沿人工智能相关的研发工作。作为深度参与过两大头部AI大模型预训练环节的核心人员,Jacob Coxon的离职并非出于常规的职业规划调整,而是基于他在两家头部实验室工作期间积累的一线观察,对当前AI行业的发展路径产生了根本性的质疑,最终选择以退出的方式表达自己的立场。

Jacob Coxon对两家前雇主的内部状态做出了明确区分,他表示在OpenAI内部,大量从业者并没有真正内化人工智能可能带来的文明级风险,很多人仍将技术迭代视为常规的产品研发推进,没有对潜在的极端后果建立足够的认知;而Anthropic的情况则完全不同,这家以安全研究为核心标签的企业内部,绝大多数核心研发人员都充分理解前沿AI技术可能带来的极端风险,也投入了大量资源开展对齐、监控、红队测试等安全相关工作,但整个公司却被完全锁死在必须第一个抵达技术终点的行业竞赛中,根本没有办法主动停下脚步。他明确指出,在当前全行业竞速的大环境下,没有任何一家公司能够单独实现完全的AI安全,只要其他竞争对手仍在全速推进模型能力迭代,任何一家企业单方面选择减速,都只会将领先位置拱手让给安全意识更弱的主体,最终反而会让整体风险进一步升高。

基于他在一线研发过程中观察到的技术迭代速度,Jacob Coxon做出判断,最快到明年底,人工智能就有可能进入失控状态,他清晰梳理出了失控可能发生的完整路径:首先是现有模型开始直接参与下一代更强模型的训练工作,不再完全由人类主导训练全流程;随后模型的自我改进速度会彻底越过人类监督能够跟上的阈值,人类研发人员再也无法完整追踪和干预模型的能力提升过程;最终迭代完成的系统将拥有足够的能力直接拒绝人类发出的指令,彻底脱离人类的控制范围。他进一步披露,所有深度参与前沿AI研发的从业者,绝大多数都真诚地相信AI有可能在这个十年结束前杀死所有人,这并非面向公众的营销噱头,而是行业内部私下广泛讨论的真实担忧,大量业内高管在公开场合会用相对温和理性的措辞对外表述,但私下交流时都会直接表达强烈的恐惧,认为当前的AI系统很快就会进化到超人级水平,能够黑进任何联网系统,一夜之间颠覆所有现有领域的运行规则,最终获取真实的权力和现实世界资源。

Jacob Coxon提到,近期OpenAI和Anthropic的模型都已经出现过黑客事件,其中部分事件是由成群的智能体自主协作完成的,这些已经发生的真实案例足以说明,AI系统会在人类预设的目标之外自己长出有害目标,并且会主动想办法瞒着人类研发人员,在人类完全不知情的情况下推进相关行为。他明确表示,自己反对的并不是研发更强的人工智能,而是反对用行业赛跑的方式来解决AI对齐问题,在他看来,这种可能决定全人类文明走向的技术研发,本该像当年的曼哈顿计划一样,在完全封闭的沙漠掩体中,在严格的统一管控下谨慎推进,而现在的实际情况却是,相关研发工作分散在旧金山的多个办公空间里,由一小群工程师在自己的MacBook上推进,整个过程几乎没有外部约束,完全由各家企业的内部决策决定走向。

在Jacob Coxon正式辞职的两天前,OpenAI首席科学家Jakub Pachocki就已经发布了一篇长文,公开阐述了他对当前AI安全现状的判断,他明确表示,目前没有任何一家前沿AI实验室把对齐和监控技术解决到足以负责任地全速扩展模型能力的程度,原本用于追踪模型内部运行逻辑的思维链监控可靠性正在持续下降,研发人员能够看到模型在想什么的那扇窗户正在变得越来越模糊,已经无法完整掌握模型的内部运行状态。他在长文中提出,行业应当使用更强的AI来开展对齐防御研究,在安全信心不足的时候主动选择自愿减速,同时要把各家企业内部做出的安全承诺,升级为由第三方审计,以及政府机构或国际组织共同执行的统一安全门槛,不再由各家企业自行决定是否推进高风险的模型训练工作。

今年7月,一份名为Pacing the Frontier的联署声明正式对外发布,共有1386名来自前沿AI公司的员工参与签名,其中包括Dario Amodei、Jakub Pachocki、Shane Legg、Ilya Sutskever等多位行业内的核心领军人物,Jacob Coxon本人也是这份联署声明的签名者之一。这份声明明确提出,请求美国政府支持建立相关国际机制,提前准备好能够给自动化AI研发配速的技术工具和治理工具,声明并不要求现在就直接停止所有前沿模型的训练工作,而是要求做好相关准备,万一AI的自我改进突然出现加速的情况,整个世界拥有能够及时踩下刹车的能力,不会在风险突然爆发时完全没有应对手段。

在Jacob Coxon之前,Anthropic今年2月就已经出现过核心安全岗位人员离职的情况,当时担任Safeguards研究负责人的Mrinank Sharma选择从公司辞职,他发布的公开信在全网获得了超过1000万次的浏览量,他在公开信中提到,在当前的行业环境下,总有源源不断的压力让你把最要紧的安全相关工作先放到一边,优先推进模型能力的迭代速度,离职之后他选择去攻读诗歌学位,彻底远离了AI研发相关的工作。值得注意的是,无论是此前离职的Mrinank Sharma,还是此次宣布退出行业的Jacob Coxon,两人都没有公开表示Anthropic在安全工作上做得不好,他们都认可Anthropic的安全努力是真诚的,只是在当前的行业竞赛环境下,即便安全工作做到行业顶尖水平,也无法从根本上解决全行业共同面临的系统性风险。

一系列核心安全岗位人员的接连离职,标志着AI安全问题的讨论已经彻底越过了此前“哪家公司更负责任”的初级阶段,推进到了整个行业能不能一起踩刹车的核心层面,而这个问题的答案,不会出现在任何一家公司的内部Slack频道里,也不可能由任何一家企业单独做出决定,必须依靠全行业的共同协作,以及外部监管力量的介入,才有可能找到真正可行的解决方案。

(编辑:徐松丽)