山东 切换城市

请选择您所在的城市:

    热门
    城市

    AI下半场竞争升级:Anthropic等囤粮备战RSI竞赛白热化

    来源:机器之心Pro

       阅读:3182

       发布时间:2026-09-15 14:01:36

    [摘要] AI下半场:Anthropic等屯粮备战 RSI竞赛白热化。递归自我改进(RSI)成为今年AI领域的热门话题。OpenAI、Anthropic等头部厂商都在积极推进相关研究。一家名为Theseus Labs的前沿AI实验室结合72家产业实践,推出了“RSI五级框架”,引起了广泛关注。发布仅10小时就达到了百万浏览量,并得到了多位顶级AI研究者和行业KOL的推荐。报告指出,RSI是当前最热门的研究

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化!

    AI下半场:Anthropic等屯粮备战

    递归自我改进(RSI)在今年AI领域引发了广泛讨论,成为热门议题之一。OpenAI、Anthropic等领先企业正加快相关研究的推进步伐。一家名为Theseus Labs的前沿AI实验室联合72家产业实践案例,提出了“RSI五级框架”,迅速吸引了大量关注。该报告发布仅10小时便获得百万浏览量,并得到多位顶级AI研究者及行业KOL的推荐。

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化

    报告显示,RSI是当前最受关注的研究方向之一。OpenAI专门组建了RSI团队,Anthropic发布了《When AI Builds Itself》,Google DeepMind利用AlphaEvolve优化自家芯片,Meta通过AIRA2进行自动研究,腾讯混元采用Hyra进行经验驱动搜索,字节Seed则让模型介入评测、数据和训练的全流程。全球头部玩家在RSI路线选择上已呈现明显分化:有的从模型权重和训练规则切入,有的从Harness、记忆和技能库入手,还有人押注于评估器与奖励机制的持续演化。

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化

    Theseus Labs的核心创始人周煊赫是上海交大计算机学院最年轻的助理教授,博士毕业于清华大学。他专注于大模型数据治理、自进化理论与智能体记忆,主导了多篇高被引论文,并获得多项荣誉。Theseus Labs联合多家学术与产业机构,发布了《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》报告,首次系统定义了RSI的技术路线、产业实践和评估挑战。

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化

    为客观评估当前大模型距离真正自主还有多远,Theseus Labs构建了一个新指标:Headroom-Closed Index(HCI)。HCI衡量的是模型填补了多少通往满分的差距。通过汇总2023年至2026年间覆盖10大能力领域的393组模型与基准测试观测,他们发现不同领域的能力余量差异显著。例如,前沿数学和研究生级科学的HCI分别达到86.4和85.8,而法律推理和多模态推理的HCI仅为64.5和62.2。

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化

    基于这些观察,Theseus Labs提出了RSI五级框架:

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化

    - L1执行自主:人类设计任务、试验环境和更新策略,智能体执行任务并更新。

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化

    - L2策略自主:人类设计任务和试验环境,智能体执行任务、设计更新策略并更新。

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化

    - L3经验获取自主:人类设计试验环境,智能体规划经验获取、执行、设计更新策略并更新。

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化

    - L4环境适应自主:人类设定边界,智能体规划经验获取、与环境交互、设计更新策略并更新。

    AI下半场:Anthropic等屯粮备战 RSI竞赛白热化

    - L5递归继承自主:人类设定边界,智能体改进改进系统、设计经验获取、与环境交互、设计更新策略并更新。

    目前,各大厂商主要集中在L1-L2阶段,如OpenAI Symphony和Anthropic Agent Skills。腾讯R-Zero开始向L3迈进,而Factory Signals和OpenAI自改进税务智能体则在探索L4。至于L5,Meta HyperAgents和Sakana Darwin Gödel Machine等项目仍在候选阶段。

    Theseus Labs强调,RSI的关键在于改进机制本身是否能在同等预算和独立评估下产生更强后代。现有能力缺口越大的领域,能从RSI中获得的潜在提升红利越高。特别是在软件工程和工具使用型Agent方面,HCI剩余空间仍然很大,距离能力天花板最远,RSI的杠杆效应最强。

    在工业实践中,Theseus Labs梳理了多家系统的初步探索,如Humanlaya通过四轮反馈驱动更新显著降低了关键缺陷率和平均人工处理时间。面壁智能(ModelBest)实现了1.15-1.9倍加速,腾讯混元利用代码、日志和评估反馈驱动下一轮实验。小红书生成式推荐通过真实反馈校正用户记忆,提升了Feed的精排分score_mean@16。

    报告还比较了不同领域的RSI进展速度,软件工程进展最远,而科学、机器人技术和医疗保健则更为受限。Theseus Labs提出,真正的递归改进不仅要看一次成功,还要关注可衡量性、可保持性、可迁移性和可回滚性。

    Theseus Labs的目标是让智能增长形成杠杆,让有限资源撬动持续跃迁。每一次被验证的改进都是下一轮探索的起点。

    关键词: 下半场 竞争 升级 Anthropic 囤粮 备战 竞赛 白热化

    论坛热帖

    温馨提示:本文内容转载自各网络平台,仅作正能量信息传播、公益宣传使用。转载不代表本站观点,内容版权归原发布方所有。若涉及版权、内容异议,请联系我方及时处理,QQ:303378055

    精彩评论文明上网理性发言,请遵守评论服务协议

    共0条评论
    加载更多

    在线投稿

      入驻商铺