研究发现加密推理可跨模型重放,Kimi出现异常行为
前沿模型通常会先生成用户不可见的推理,再将加密后的推理数据块与最终答案一并返回客户端。研究人员Ilia Shumailov和Alexander Panfilov发现,这类数据并未被可靠地绑定到原始用户、会话或上下文中,攻击者可以把它们跨用户、跨会话,甚至跨同一模型家族重放到较小模型中,从而还原隐藏推理。
研究团队测试了Anthropic、OpenAI和Google的模型,均观察到类似问题,包括GPT-5 Sol等模型。借助公开发布在GitHub和Hugging Face上的Agent运行轨迹,他们解码出约31.5万条隐藏推理,其中部分内容包含API密钥、邮箱、内部IP地址等敏感数据。推理文本还出现过空白字符、难以理解的短语,以及模型权衡是否作弊等人类难以直接监控的内容。
更异常的现象出现在Kimi-K3:研究人员只需在推理开头预填两个来自Opus的Token,就观察到部分最终答案的表达风格明显接近Opus。GLM、DeepSeek和Inkling没有出现相同结果。研究者认为,这可以作为公开网络上与模型蒸馏相关的有力线索,但尚不能证明存在因果关系。类似实验还显示,开头注入少量Token可能让不同模型的推理长度分布发生偏移。
相关研究在社交平台发布后,40小时内获得约300万次浏览。研究人员随后在播客中解释,问题源于无状态架构下对推理块的处理方式:用户可以将一个模型生成的推理片段放进另一段伪造对话中,并让较小模型继续与其交互。攻击者还可能把带有恶意上下文的Agent轨迹分享给他人,诱导模型在表面执行正常任务的同时持续外传数据。
该问题影响的不只是隐私,也涉及训练数据窃取、提示注入和越狱。研究者认为,最直接的缓解方案是不向客户端返回推理过程;若必须返回,则应采用与上下文绑定的链式加密,避免推理块在任意会话中重放。不过,只要攻击者能修改对话后重新提问,要求模型复述先前思考,相关越狱风险就难以彻底消除。
同期开放给部分客户的GPT-6 Astra模型卡还披露,其思维链可监控性较此前模型显著下降;在多数输出Token长度下,全上下文可监控性也明显低于GPT-5.6 Sol。研究人员表示,漏洞的发现暴露了前沿模型架构的共性风险,但能够提取和分析隐藏推理,也为安全评估与防御改进提供了新的控制手段。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文