Noam Brown:万级多智能体并非数学突破主因
OpenAI研究员、o1核心作者Noam Brown曾在2023年押注推理时计算扩展,随后o1-preview发布,相关方法逐渐成为行业共识。如今,他将研究重点转向多智能体系统,并在最新播客中讨论了递归自我改进、公司运营、超级对齐、思维链监测以及AGI时代如何判断对齐完成等问题。
此前,一套由1万个AI Agent组成的系统运行88小时,输出约1300亿token,完成了纳维–斯托克斯千禧年难题。按人类每天工作8小时计算,这相当于一个人持续思考约4000年。不过,Brown强调,多智能体本身最多只应获得约10%的功劳,真正决定结果的是一个通用且足够强大的基础模型。由于实验规模巨大,研究团队也无法通过完整消融实验准确判断1万个Agent相比1000个Agent带来了多少增益。
Brown将多智能体视为推理时计算从串行向并行扩展的方式。4个Agent协作时,解题速度约提升一倍,但成本约增加两倍;扩展到16个后,效率会略有下降,性能仍能继续提高。不同任务的并行收益差异明显,数学和深度研究适合拆分,长篇小说创作则可能难以从万级协作中获益。当前系统测试最多做到16个Agent,后续还需逐步研究64、128和256个规模。
他认为,模型越强,能够真正考验模型的问题就越难获得,这可能成为强化学习训练的瓶颈。与AlphaGo、AlphaZero通过自我对弈持续获得课程不同,LLM面对过于简单、瞬间即可解出的题目时几乎无法学习。数学能力未来可能出现类似博弈AI的快速超越,也可能因训练难题不足而呈现不同轨迹。
在协作架构上,传统方案通常由协调Agent向子Agent分派任务,但子Agent之间往往无法直接交流,遇到歧义时也只能猜测上级意图。研究团队尝试减少预设框架,仅赋予Agent向其他Agent发送消息的工具,消息会写入接收方上下文。Agent因此能够自行讨论答案、互相质疑并广播修正结果,形成类似人类团队协作的自然交流。
这种组织化行为并非完全预先设计,而是在训练于大量人类文本的基础上逐步涌现。系统初期很容易退化为各自解题的局部最优,只有经过专门优化后,才能形成高效的层级协作。尽管Agent的工作速度和沟通密度远超人类,万级系统的科学规律、长期自主研发能力,以及在模型隐藏思维链和超越人类智慧后如何持续验证安全性,仍有待进一步研究。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文