产品派
返回

Haiku 5.5升级:OSWorld成绩升至72.4%

AI雷锋网2026/10/8 23:37:00
AI 导读

Anthropic发布了Claude Haiku 5.5。新模型在OSWorld 2.1上的成绩从上一代的15.7%提升至72.4%,知识工作和复杂推理能力也有改善。官方称其平均运行成本下降约75%,同时加入自适应推理机制,支持100万Token上下文。此前Haiku主要用于摘要、分类和信息提取等高频任务,优势是速度快、价格低。

升级后,Haiku 5.5可以承担更复杂的工作,部分评测结果接近Sonnet 5.5,但复杂编程仍存在差距。模型会依据任务动态分配推理资源;当上下文输入或输出超过10万Token时,输入和输出单价都会提高至原价的5倍,因此实际成本仍取决于任务类型和上下文规模。

在OSWorld 2.1离线子集中,Haiku 5.5得分为72.4%,Haiku 4.5为15.7%,Sonnet 5.5为83.9%。该测试要求模型通过计算机界面完成长流程任务,包括理解页面、执行点击或输入,并根据环境反馈继续操作。与文本问答相比,这类任务更依赖对界面状态的持续维护。

一次操作失败后,模型还要判断当前环境是否仍符合目标并调整方案。不过,72.4%只是特定测试集的完成率,不能直接等同于所有浏览器或桌面任务的成功率,动态页面、权限限制和异常状态仍需在具体业务环境中验证。知识工作评测中,Haiku 5.5在GDPval-AA v2.1获得1620分,上一代为735分,Sonnet 5.5为1840分,该测试覆盖44类职业任务。

在AA-Briefcase v1.1中,Haiku 5.5得分由614分升至1578分;在Humanity's Last Exam多学科推理测试中,无工具得分为45.9%,使用工具后为57.4%。这些任务要求模型整合多来源信息、处理限制条件并生成结果。编程评测则不完全相同:FrontierCode 1.1中Haiku 5.5为46.4%,接近Sonnet 5.5的52.1%,但Terminal-Bench 4.0中仅为39.2%,Sonnet 5.5达到70.6%。

Terminal-Bench考察命令行环境下的多步骤任务,模型需要读取文件、执行命令、处理错误,并根据测试反馈持续调整。Anthropic因此表示,复杂智能体编程更适合使用Sonnet 5.5或Opus 5.5,Haiku 5.5主要面向边界清晰的子任务、摘要和上下文压缩。企业测试中,Asana称其任务完成延迟降低超过30%,单轮推理速度最多提升2.5倍。

HubSpot在模拟CRM环境中进行三次测试,平均成绩为92.8%;AlphaSense在400次文档问答中测得0.84分,高于上一代的0.76分。由于这些测试采用的任务和标准不同,结果更适合反映特定业务场景,不能直接作为统一能力排名。

02 自适应推理加入Haiku

Claude大模型AI编程智能体

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文