Anthropic称Claude已主导26% AI研发任务
Anthropic披露的内部数据表明,截至2026年8月,Claude已“主导”约26%的AI研发任务,超过90%的任务至少达到AI协作水平;内部Agent平台约有3万个Agent同时执行研究和工程工作。2月时,达到主导级别的模型研发任务占比还不到1%,半年内增长超过25个百分点,相关指标被用于观察递归自我改进(RSI)的进展。
这里的“主导”并不等于无人化或替代四分之一研究人员。Anthropic采用Epoch AI提出的AL0至AL5标准:AL3是在人类密切指导下完成大块工作,AL4则是人类设定高层目标并监督决策,AI端到端完成大部分执行,只有AL5才代表完全自主运行。
为计算该比例,Anthropic从模型研发相关部门每周随机抽取20%的员工,让Claude Research Agent读取Slack和内部文档,整理出约1.5万项任务,再构建包含542个节点、378个叶节点的任务树,覆盖预训练、强化学习、评测故障诊断、沙箱网络策略和事故复盘等环节,并按人力投入加权。评估由Claude完成,人与模型完全一致率为59%,人类评估者彼此一致率为35%,相差不超过一个等级的比例达97%,但公司承认评级仍有主观性。
为管理3万个并发Agent,Anthropic为每个Agent设置独立身份,模型升级后身份仍可延续;Agent通过带身份和原始资料链接的共享消息系统通信,系统还会把消息与完整运行轨迹关联,以追踪跨Agent协作。
Anthropic认为,AI研发正从人工编码、聊天机器人辅助和Coding Agent,推进到能运行代码并继续委派任务的自主Agent。Claude归因代码已占正式代码库合并代码的80%以上,工程师日均合并代码行数约为2024年的8倍,但代码量不能代表质量。在固定目标的训练优化实验中,Opus 4的加速约为3倍,2026年4月的Mythos Preview达到约52倍;目前人类仍主要负责研究品味、方向判断和结果可信度评估。OpenAI、Google DeepMind及Recursive也在探索RSI,但路线各异。
OpenAI重点打造自动化AI研究员,2026年9月称已实现“AI研究实习生”目标,并计划在2028年3月前推进到研究员级别。8月中旬,按每天8小时折算,人类工作一天时Agent约并行运行24.8小时;但研究优先级和是否继续、暂停或部署仍由人决定。其跨研究、工程、产品和基础设施的RSI团队还在评估研究判断、假设验证和长周期实验能力,并强调对齐与监控尚未足够,必要时会放慢或停止开发。
Google则更关注改进“寻找答案的方法”。其9月2日披露,Gemini 3.8研发使用长时间运行的Agent循环,对底层模型进行递归评估和改进,但这不代表模型已能自主训练下一代Gemini,具体参与训练、数据、评测或后训练的环节尚未公开。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文