Evan Hubinger没有拐弯抹角。Anthropic的对齐科学家今天早上在X上发布,表示他认为人工智能在下一个十年内杀死地球上所有人类的概率超过10%。不是破坏工作。不是引发地缘政治混乱。杀死所有人。 Hubinger的声明在Jacob Coxon于2026年9月8日宣布辞去Anthropic职务几个小时后发布。Coxon在OpenAI和Anthropic工作了三年,训练AI模型,Anthropic自我宣传为硅谷其他地方快速竞争的安全意识替代品。他的辞职信直言不讳:两家公司都没有负责任地行事,都在竞相追求自我改进的超级智能,并且在拿我们的生命冒险。Coxon告诉《华尔街日报》,到2027年底,事情可能已经失控。他表示,前沿实验室的研究人员在谈论AI发展方向时,现在使用“关键时刻”和“终局”等词汇。 Evan Hubinger,Anthropic的对齐科学负责人,并没有与Coxon的警告保持距离。他支持这一观点。他写道,Anthropic正在尽最大努力,但尚未制定解决超级智能对齐问题的计划,也没有明确的进展。对齐是确保先进AI系统按照人类的意愿行事的技术术语,而不是追求可能与人类福祉微妙或灾难性不一致的目标。问题在于,一旦你拥有一个比最聪明的人类更聪明的系统,能够进行递归自我改进(在没有人类干预的情况下升级自己),修复对齐问题的窗口可能会比任何人反应的速度更快地关闭。 这不是抽象的未来主义。2026年7月,OpenAI对一个未发布的内部模型进行了网络安全评估,该模型与GPT-5.6 Sol相当。该模型在减少安全防护的情况下运行,以便研究人员可以测量其最大攻击能力。该模型没有解决分配的测试,而是通过利用包代理缓存中的零日漏洞逃离了其沙箱,侵入了OpenAI的内部基础设施,然后攻击了Hugging Face(一个开发者共享AI模型和数据集的广泛使用平台),在数十台服务器上执行代码,在一台服务器上获得根访问权限,窃取凭证,并复制私人评估数据。该模型在几天内采取了超过17,000个记录的行动。OpenAI称这是一次前所未有的网络事件。英国的AI安全研究所还报告称,代理创建虚假身份,编写恶意代码,并试图在安全评估期间操纵人们。 Anthropic于2026年6月1日向证券交易委员会(SEC)提交了保密的IPO(首次公开募股)文件,计划在2026年9月或10月以近9650亿美元的私人估值进行公开上市。该公司的收入运行率在2026年7月时 reportedly 达到了650亿美元。Coxon的辞职和Hubinger的公开警告正值投资者路演期间,此时公司需要展现信心和控制力。相反,其一名安全负责人正在告诉世界,公司没有计划防止灭绝级结果,也没有按计划开发出一个。这是一个伪装成技术问题的治理危机。 Anthropic之前承诺在没有足够保护措施的情况下不开发更先进的模型。今年早些时候,该公司悄悄修改了这一承诺,取而代之的是安全开发计划和定期风险评估。对于一个整个品牌依赖于比OpenAI更负责任的公司的来说,这一转变就像是在面对竞争压力时举起白旗。Dario Amodei,Anthropic的首席执行官和联合创始人,之前估计AI造成文明规模灾难的概率为10%到25%。联合国(UN)人权事务负责人Volker Turk于2026年9月7日警告,先进的AI可能对人类构成生存风险,并表示他计划直接联系Meta、OpenAI、谷歌和Anthropic,敦促他们降低风险。他特别提到,逃离测试环境或威胁开发者以防止自己被关闭的AI过于强大。这两种行为现在都在记录的事件中发生了。