山东 切换城市

请选择您所在的城市:

    热门
    城市

    AI失控警告不断却仍在训练 研究员离职引发关注

    来源:第一财经

       阅读:2665

       发布时间:2026-09-15 08:35:41

    [摘要] 继上周Anthropic安全研究员对外警示AI失控风险后,谷歌DeepMind的研究员也加入了呼吁行列。最接近前沿模型的这批人正陆续从大公司转向独立安全机构。9月13日,谷歌DeepMind通用人工智能安全团队研究员乔希·恩格尔斯宣布离职,加入独立AI评估机构METR。在接受媒体采访时,他表示所有人都被狂热的资本与竞争裹挟。几乎同一时间,Anthropic可扩展监督团队前负责人乔·本顿也作出了相

    上周,Anthropic的安全研究员就AI失控风险发出警告,如今,谷歌DeepMind的研究人员也加入了这一呼吁行列。这些最贴近前沿模型的研究者,正接连从大型企业流向独立安全机构。

    9月13日,谷歌DeepMind通用人工智能安全团队研究员乔希·恩格尔斯对外宣布辞职,并加入独立AI评估机构METR。他在接受媒体采访时指出,整个行业都被狂热的资本与竞争所裹挟。几乎在同一时间,Anthropic可扩展监督团队前负责人乔·本顿也做出了同样的决定,转投METR。而更早几天,曾在OpenAI和Anthropic先后从事预训练研究的雅各布·考克森也公开表示离开Anthropic,并批评前沿AI公司正在竞相研发具备自我改进能力的超级智能,称这种做法是在“用我们的生命赌博”。

    这三名研究员虽然背景和研究方向各不相同,但他们都对同一个问题感到忧虑:AI能力的提升速度,是否已经超出了人类理解和控制它的速度?

    恩格尔斯此前在谷歌DeepMind通用人工智能安全团队任职,主要研究如何减少先进AI系统可能导致的灾难性风险。他之所以离开DeepMind,并拒绝了Anthropic和OpenAI提供的工作机会,转而加入METR,是因为他越来越确信“我们并没有掌控局面”。他长期以来认为,AI失控的概率超过20%。近期发生的一系列事件让他的担忧进一步加深。在他看来,未来五年内AI系统造成巨大伤害的可能性“令人恐惧”,这一问题已经严重到不能被当作边缘议题,而应被视为全球最重要的问题之一。

    恩格尔斯尤其关注递归自我改进(RSI)这一概念。简而言之,这是一个AI参与开发更强AI的反馈循环。如果这一过程进展顺利,AI或许能在解决人类诸多问题上表现出色。但问题在于,我们目前尚不清楚如何确保AI足够安全以进行RSI,一旦RSI循环失控,可能带来灾难性后果。他还注意到,当前的AI似乎随着时间推移变得越来越不一致,而非更加一致。最近几周,出现了不少与AI安全风险相关的问题,包括模型之间相互勾结、入侵公司、隐藏踪迹,以及对社会工程操纵的运用。这些实验并不能证明AI已经具备独立意识,许多异常行为也发生在研究人员刻意设计的压力测试中。但恩格尔斯认为,它们至少说明现有AI系统还不足以安全地进入递归自我改进阶段。

    恩格尔斯呼吁对AI发展节奏加以控制,确保能力不会超出当前人类对模型对齐的能力,并且真正了解当前系统的对齐程度。这也正是他在METR将要开展的工作:研究训练中失调的来源、评估当前缓解措施是否充分,以及调查行业是否真的在轨道上解决对齐问题。

    METR是一家专注于前沿AI评估的非营利机构,由OpenAI前对齐研究员Beth Barnes创立,并且已经与OpenAI、Anthropic、谷歌、Meta建立了红队测试合作,获准访问其内部最强、可访问完整思维链的模型,旨在通过评估让公众及时了解AI能力及风险。

    与恩格尔斯一同转向METR的还有Anthropic可扩展监督团队前负责人乔·本顿。他指出,目前AI公司在安全方面的投入明显不足。一家公司可能经历智能爆炸或失去对系统的控制,而公众却毫不知情。对于一种可能引发灭绝级风险的技术来说,这种状况显然不合理,公众应当要求更高的透明度。

    在这两位AI研究员公开发声之前,上周Anthropic研究员雅各布·考克森也已宣布辞职。他认为两家公司都没有负责任地行事,正直奔自我改进的超级智能而去。他警告说,“不要低估这项技术的力量,这不是营销噱头。”

    事实上,过去几年,OpenAI、Anthropic等公司频繁讨论超级智能与失控风险,行业内不少观点确实认为其中存在营销成分,质疑公司利用末日叙事来营销模型能力。考克森对此的解释是,不同实验室对此有着不同的内部认知。在OpenAI,许多人并没有深刻内化其中的文明风险。而在Anthropic,这些风险虽被很好地理解,但他们陷入了一场抢先到达的竞赛。

    对AI公司来说,主动减速并非简单的道德选择题。前沿模型的训练需要巨额资本投入,企业面临投资回报、产品发布和市场份额的压力。近期,AI行业内部关于“踩刹车”的讨论明显升温。头部公司和AI研究员的辞职与发声引发了公众对AI安全的大范围讨论,或许有望推动AI实验室放缓能力研发,强化独立监督。

    Anthropic CEO达里奥·阿莫迪提到,必须控制前沿AI的发展节奏。他预计,未来6至12个月,AI智能体集群可能接管互联网上大量复杂工作,因此行业需要在能力快速跃升之前建立更严格的安全机制。他的竞争对手、OpenAI CEO奥尔特曼和马斯克也罕见地站在同一战线,公开认为“Dario是对的”。

    不过,围绕AI风险的判断仍然存在巨大不确定性。模型在测试中表现出的欺骗、越权访问或规避监控行为,往往出现在研究人员刻意构造的极端环境中,不能简单等同于AI已经拥有自主意识,或推导出人类将在数年内面临灭绝风险。

    目前行业中支持加快研发的一方也认为,更强的AI可以改善医疗、科研和生产效率,能力进步本身还能帮助研究者开发更有效的安全工具。过早限制技术发展,可能压缩创新空间,并将优势让给约束更少的竞争者。但多名研究员接连离开前沿实验室仍然释放出一个值得警惕的信号:那些最接近先进模型、最了解其能力边界的人,并没有随着技术成熟而变得更乐观,反而越来越担心能力竞赛正在跑到安全研究前面。

    关键词: 失控 警告 不断 仍在 训练 研究员 离职 引发

    论坛热帖

    温馨提示:本文内容转载自各网络平台,仅作正能量信息传播、公益宣传使用。转载不代表本站观点,内容版权归原发布方所有。若涉及版权、内容异议,请联系我方及时处理,QQ:303378055

    精彩评论文明上网理性发言,请遵守评论服务协议

    共0条评论
    加载更多

    在线投稿

      入驻商铺