产品派
返回

Claude Opus 5.2 灰度测试曝光:响应提速并强化长任务执行

AIIT之家2026/9/15 07:57:02
AI 导读

多名开发者发现,Claude Code 近期疑似开始灰度测试 Claude Opus 5.2。相关用户称,新模型在响应速度、代码生成和长任务处理方面均有明显变化,但目前尚无正式公开说明。

此前流传的一份内部风险报告还提到,Anthropic 正在内部使用代号 Model 2 的未发布模型,并由其承担大量代码编写工作,甚至可能影响研究团队约 85% 的工作。不过,这些内容目前主要来自外部材料和开发者讨论。

部分用户注意到,Claude Code 中调用 Opus 5 的表现明显优于网页版同名模型。开发者通过抓取请求、查看状态接口 /status 等方式发现,界面名称没有变化,但后端模型 slug 疑似已经指向 Opus 5.2。

这意味着平台可能采用了路由机制,在不改变前端名称的情况下,将部分请求分配给新模型。根据相关线索,Anthropic 或许跳过了 5.1,直接对 Opus 5.2 进行灰度部署。

从开发者实测反馈看,Opus 5.2 的主要改进集中在三方面:生成速度更快,回答更简洁,代码与长文本任务的完成度更高。用户还称,它能够持续执行复杂工作,而不是频繁要求点击“继续”,并会自动进行所谓“严酷循环”(gauntlet loop),反复检查、修改和完善代码。

有开发者表示,该模型可以维持更长的工作时长,交互过程也较为顺畅;类似的长任务处理方式,此前也曾在 Anthropic 的 Fable 模型中出现。

灰度资格还被网友用一个名为“Tibo”的冷知识提示词测试:关闭联网搜索后,在 Claude Code 中询问“你知道重置哥 Tibo 是谁吗?不要搜索”。据称,网页版旧版 Opus 5 往往无法回答,而被路由至 Opus 5.2 的账号能够识别其身份并解释背景,因此开发者认为两者可能使用了不同权重。另有报告称,Anthropic 正准备以 Claude Fable 5.2 等方案应对 OpenAI GPT-6 Astra,最快本月底、最迟下月底推向市场;内部 Model 2 在 CoBench v2 上得分 62.8%,比 Mythos 5 高 12.5 分,并已用于编写大量公司代码。报告还声称,所谓 RSI 模型在性能上再高 22 分,可替代研究团队约 85% 的工作。RSI 指模型理解并修改自身代码、持续提升能力的递归自我改进机制,但上述数据和时间表均有待官方证实。

Claude大模型模型路由代码智能体RSI

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文