GPT-6与Claude Opus 5.5转向成本和可用性竞争
9月23日,OpenAI与Anthropic先后发布GPT-6 Sol、GPT-6 Luna和Claude Opus 5.5。Sol面向专业工作、Coding及复杂Agent,Luna主打高频低成本调用;Opus 5.5继续强化Coding与Agent,并将Communication列为独立升级方向。两家公司的竞争重点,正从单纯提升能力转向可用性和整体调用成本。
GPT-6本轮最明显的变化是降价。Sol输入价格由GPT-5.6 Sol促销价的每百万Token 4美元降至2美元,输出由20美元降至10美元;Luna输入由0.20美元降至0.10美元,输出由1.20美元降至0.50美元,较上一代约降一半。OpenAI更强调完成一次任务的总成本,而非单独比较Token单价。
在AutomationBench中,Sol以xhigh推理强度取得33.2%,平均单任务成本0.27美元;Claude Opus 5得分26.9%,OpenAI估算其成本约为Sol的11.1倍。Claude Fable 5.1搭配Opus 5得分31.4%,成本至少高8.9倍。DeepSWE 1.1中,Sol得分68.8%,与Claude Fable 5的69.9%相近,但单任务成本低约80%。Luna得分66.6%,成本较Opus 5低约93%、较Fable 5低约96%。
Luna因此获得较多性价比评价,部分用户已将生产分类任务迁移过去,但也有人认为GPT-6更像成熟且便宜的GPT-5.6 Sol,未体现明显代际跃迁。相比之下,Opus 5.5针对上一代表达冗长、术语生硬、过度设计和擅自扩大任务范围等问题,承诺减少无用措辞、优先呈现关键信息,并改善长时间协作的可读性。
Opus 5.5典型工作负载成本较Opus 5下降40%,输出速度提升超过30%,Cache Read价格下降60%。与此同时,开发者越来越不把Benchmark的几分差距等同于真实生产力,代码库结构、技术债、任务边界、工具调用和人工复核成本同样重要。评价重点已从能否生成正确代码,转向Agent完成任务所需步骤、无关改动和人工介入程度。
OpenAI还把Prompt Caching作为Agent降本核心。其称内部研究人员每天使用Coding Agent的Token成本中位数超过600美元,前10%超过7000美元;GPT-6命中缓存的输入Token可享90%折扣,并新增缓存监控与诊断工具。近期改进使GitHub Copilot数十亿次请求中需重新处理的Prompt Token比例下降超过50%。由于缓存利用率会显著影响账单,低输入单价不一定带来同等幅度的任务成本下降。
两家公司也同步调整交互体验:GPT-6延续Astra的风格改进,减少术语堆砌并区分已完成、已验证和未验证内容;Opus 5.5则加强每一步Agent动作的分类与Prompt Injection防御。不过,已有用户报告普通Bash操作偶尔被误判为“Third-Party Attack”而中断流程,模型的长期稳定性仍需更多真实使用验证。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文