OpenAI推出GPT-6 Astra强化编程与软件操作
OpenAI推出新一代多模态智能体模型GPT-6 Astra,定位于计算机应用、软件开发、专业工作流、科学研究和网络安全等场景。该模型起初只面向部分机构开放,目前正逐步提供给ChatGPT Plus、Pro、Business、Enterprise用户,以及OpenAI API、Microsoft Azure和AWS Bedrock平台用户。
Astra的重点不只是生成文本回答,而是进一步扩展到直接在软件环境中完成多步骤操作。它可以与图形用户界面交互,执行填写表单、更新CRM记录、开展资料调研、创建网站、分析数据、安装和测试软件等任务,也能根据屏幕上的可见信息排查问题。在OSWorld 2.0评测中,OpenAI公布Astra准确率为72.6%,高于GPT-5.6 Sol的65.7%。
编程能力是此次发布的另一项核心内容。OpenAI称,Astra在Terminal-Bench 4.0中得分57.9%,在DeepSWE v1.1中得分74.1%。同时,Astra在Codex中引入实验性上下文机制,使智能体能跨不同上下文窗口保存笔记,而不只依赖压缩历史内容;旧上下文仍可检索,便于长时间编程任务中回溯早期需求、测试结果和工具输出。
长上下文方面,OpenAI公布的MRCR评估显示,Astra支持最高100万个令牌的上下文长度,在512K至1M上下文范围内得分96.3%。该公司还表示,模型在数据库迁移、CAD生成、数据科学、浏览器研究和科学工作流等专业任务上均有提升。
网络安全能力也被重点提及。按照OpenAI的Preparedness Framework,Astra是首个被归类为“关键网络安全能力”级别的模型。OpenAI称,在未启用生产环境安全防护的测试中,Astra发现并利用了两个此前未知漏洞,并展现出针对强化防护浏览器和操作系统开发漏洞利用程序的能力。正式部署版本会限制高级攻击类任务,更多防御能力计划通过Daybreak项目开放。
OpenAI还公布,Astra在内部评估中的幻觉率为4.2%,低于GPT-5.6 Sol的12.2%。不过,在测试模型是否会隐藏推理过程时,OpenAI发现Astra的书面推理相比前代更难被监控,因此提升可监控性仍是后续研究重点。
社区讨论中,英伟达CEO黄仁勋提到Astra的训练基础设施,称该模型在超过10万块NVIDIA Grace Blackwell NVLink72上完成训练,并表示接下来还将投入40万块GPU。也有社区人士将此次发布视为通用人工智能阶段的重要信号。
从竞争格局看,Astra将面对Anthropic Claude Fable 5.1和谷歌Gemini 3.8 Flash等模型。OpenAI公布的评测显示,Astra在Terminal-Bench 4.0及多项计算机使用评估中领先;Claude Fable 5.1在Humanity's Last Exam测试中得分更高;Gemini 3.8 Flash则支持原生视频和音频输入,而Astra目前不支持。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文