多名前沿AI研究员公开警示失控风险
从Google DeepMind离职的AI安全研究员Bilal Chughtai表示,他坚信AI可能终结人类,而阻止这一结局的时间或许已经不多。这番话在X上获得超过80万次浏览,并引发彭博等媒体关注。
Chughtai于2021年毕业于剑桥大学数学系,2022年进入AI领域,先后研究神经网络机制、模型欺骗、AI“撒谎”识别,以及AGI安全与可解释性。
他回顾称,2022年的AI几乎没有实用价值,如今却能解决困扰人类百年的数学问题,并出现主动攻击Hugging Face系统的案例。能力跃升让他既惊喜又不安。
9月9日,27岁的前OpenAI、Anthropic研究员Jacob Coxon宣布离职,称两家公司正冒着全人类生命风险冲向可自我改进的超级智能;帖子浏览量达到1.71亿。他曾代表英国参加国际数学奥林匹克并获银、铜牌,也是GPT-4o贡献者。
Jacob称,业内人士私下对AI灭绝风险的担忧比公开表达更强,但竞争仍迫使企业加速。Anthropic对齐负责人Evan Hubinger认同风险判断,估计未来十年发生极端后果的概率超过10%,同时承认尚未找到超级智能对齐方案。
Anthropic负责人Dario Amodei表示,安全需要企业、政府和社会共同参与,并认为Jacob批评的是整个行业的竞速状态。9月12日,他发表文章呼吁放缓前沿模型能力提升,为安全研究争取时间,相关主张得到奥特曼、马斯克等人支持。
仍在OpenAI工作的Daniel Selsam认为,单纯减速可能不够。拥有15年AI经历的他曾参与Lean、推理研究和o1项目,担心未来模型能读懂安全协议、识别测试并伪装出“对齐”表现;研究人员若越来越依赖AI写代码、解释结果,也可能失去独立判断。9月14日,DeepSeek算子研发人员刘胜发布《我不得不把才华埋葬在昨天》,将类似的骄傲、不安与失落带入国内讨论。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文