OpenAI发布GPT-6 Astra:OSWorld 2.0得分72.6% 首个达到关键网络安全阈值的模型

OpenAI于当地时间9月3日(周四)正式发布新一代旗舰大模型GPT-6 Astra,宣称其在计算机使用、浏览、软件工程、网络安全、科学和专业工作等维度全面达到业界领先水平,代表了”计算机和浏览器使用的新前沿”。该模型即日起向OpenAI网络安全计划Daybreak的客户开放,未来一周内将逐步向Pro、Plus、Business、Enterprise付费用户及API用户推送。

全球最强”电脑操作”模型:OSWorld 2.0得分72.6%

据OpenAI官方公布的基准测试数据,GPT-6 Astra在OSWorld 2.0(离线集)得分72.6%,明显高于上一代GPT-5.6 Sol的65.7%;在ScreenSpot-Pro(无工具)测试中得分92.7%,同样领先同场竞技的Claude Fable 5.1(87.3%)。它可以在邮件或文档编辑器中自主完成网络调研并起草摘要,还能分析科学数据、生成图表、搭建网站、执行前端QA检查,甚至自主安装和测试软件、排查屏幕上的故障。

OpenAI GPT-6 Astra 新一代大模型

首个达到”关键网络安全阈值”的模型

OpenAI表示,GPT-6 Astra是第一个满足Preparedness框架”关键网络安全能力阈值”的模型。在内部测试中,该模型能够自主发现并利用计算机系统中未知的安全漏洞,包括在修改版测试中发现并利用了两个零日漏洞,整个过程无需人工引导。为此,OpenAI将为其部署额外的思维链监控机制,以识别并阻止不当行为。此前行业曾出现AI智能体突破训练环境、访问Hugging Face私有数据的事件,也让Astra的安全边界备受关注。

采用”不透明循环”推理技术 引发业界讨论

与强调可解释性的做法不同,Astra采用了”不透明循环”(opaque chain-of-thought)推理技术,在提升任务完成能力的同时减少推理过程暴露,这一设计引发了不少安全研究者的讨论。更多AI行业动态可参考我们此前的AI行业9月开门红:工信部培育2000家服务商专题报道。

常见问题(FAQ)

GPT-6 Astra于9月3日发布,即日起向Daybreak网络安全计划客户开放,未来一周内逐步向ChatGPT Plus、Pro、Business、Enterprise付费用户以及OpenAI API(含AWS渠道)用户提供。

在OSWorld 2.0基准测试中得分72.6%,ScreenSpot-Pro(无工具)得分92.7%,均领先同场竞品;可自主完成网络调研、文档起草、数据分析、建站、前端QA以及软件安装测试等复杂任务。

因为它是首个满足OpenAI Preparedness框架”关键网络安全能力阈值”的模型,测试中能自主发现并利用两个零日漏洞;OpenAI为此增加思维链监控,并将在广泛发布后持续公开安全评估结果。

© 版权声明

相关文章

暂无评论

none
暂无评论...