Schmidhuber回顾始于1987年的递归自我改进研究
递归自我改进(RSI)近期因头部人工智能实验室的相关项目再次受到关注。OpenAI披露了内部量化进展,谷歌团队发布“Deam-RSI”框架。OpenAI首席科学家Pachocki认为,RSI可能成为科学发现的重要路径,但当前没有实验室真正解决对齐问题,推进研究的同时应放慢速度并建立统一安全标准。
Jürgen Schmidhuber在长文中回顾了近四十年的探索,涉及1987年的元进化与元强化学习、1994年以来的自修改策略强化学习、1991至1992年的快速权重和自指神经网络、2002年的OOPS课程学习,以及2003年提出的Gödel Machine。他还讨论了人工好奇心、内在动机、MetaGenRL、VS-ML、SRWM和基于大语言模型的Gödel Machine等后续方向。Sakana AI联合创始人David Ha转发文章称,当前真正值得警惕的或许不是超级智能,而是少数公司掌控前沿技术造成的权力集中;独立实验室和强大开源社区才是重要保障。
Schmidhuber表示,1987年其毕业论文发表了首批具体的RSI算法,当时计算成本约为今天的10⁸倍。如今软件层面的自我改进已更具可行性,但完整的RSI还需要机器和机器人在现实环境中同步改进硬件。真正的元学习不只是迁移知识或调节超参数,而是让系统用通用编程语言表示学习算法,并允许它以任意可计算方式修改自身,同时通过递归机制筛选出有用的修改。
1987年,他与合作者发表了早期遗传编程研究,使通用编程语言中的任意长度程序能够被进化。其毕业论文进一步让遗传编程系统递归改进自身,形成元进化、元元进化等层级;论文还提出用于收益最大化和强化学习的PSALMs。这些工作将I.J. Good关于自我改进产生“智能爆炸”的设想转化为具体算法,也与Bellman关于元策略的思考相呼应。
1994年提出的增量式自我改进面向只有一次生命周期的通用强化学习机器,不依赖可重复、相互独立的试验。其自修改策略是一种可修改的程序概率分布,连同“如何修改自身的学习算法”也能被修改。EIRA或“成功故事算法”通过更有效的自我修改提升单位时间奖励,即使当时计算成本约为现在的10万倍,仍在困难实验中取得良好表现。
在神经网络方向,Schmidhuber把连接权重视为程序,构建了能够输出其他网络程序或权重矩阵的快速权重编程器,并设计出可以检查自身权重更新或学习算法的自指循环网络。由于其程序由实数权重表示,生成器能够通过梯度下降在程序空间寻找更优方案。相关思想延续了1965年的深度网络学习研究,也与1981年关于快速变化连接的重要性研究相衔接。
他还提出OOPS,让系统复用已有程序和知识,逐步解决新任务,并以Gödel Machine在数学意义上定义自我改进的最优性。Schmidhuber最后强调,软件自我改进只是RSI的一部分;真正的人工智能必须嵌入物理世界,与可自我改进的机器和机器人结合。近年来快速权重与大语言模型的结合,正在推动这些经典框架走向更实际的应用。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文