news 2026/9/2 23:06:46

OpenAI为Astra拉满预热,网络安全能力超强但安全问题成关键

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
OpenAI为Astra拉满预热,网络安全能力超强但安全问题成关键

突发!OpenAI为Astra(GPT - 6)拉满预热,网络安全能力超强但安全问题成关键

就在刚刚,OpenAI多线齐发,为下一代模型Astra(传说中的GPT - 6)拉满预热。官方突然放出技术长文,首次公开Astra的能力底牌;紧接着,奥特曼亲自下场写“小作文”,讲述Astra为何迟迟未能上线;随后,两位华人研究员接连发声,带着一手细节晒出了此前从未公开的内部测试成绩。

短短几个小时,所有信号都指向同一个方向:OpenAI的下一代旗舰模型,已经箭在弦上。

奥特曼在小作文中透露,Astra其实早已完成训练,迟迟未发不是因为模型还不够强。恰恰相反,这是因为Astra已经强到了公司不得不主动踩下刹车。奥特曼将这段经历形容为一种持续的拉扯:既兴奋于Astra带来的能力跃升,又焦虑于没人能够完全预判这些能力的后果。

于是刚过去的整个夏天,OpenAI几乎都在给Astra补安全、做对齐、加护栏。他甚至表示,Astra之后的模型,必要时还要主动降速,以便给安全和对齐研究留出时间。

Astra究竟强到了什么程度?OpenAI又凭什么认为现在就能发了?这次公开的技术博客,或许为我们提供了一个观察窗口。

漏洞识别能力超越GPT - 5.6 Sol,内部测试收获满分答卷

按照官方说法,Astra这次之所以能被放出来,核心原因是它已经达到“网络安全关键级”(Cyber - Critical)能力门槛。这是OpenAI首个被正式划入这一等级的模型。

所谓“关键级”,意味着Astra在获得相应工具和环境权限后,已经能够自主寻找未知漏洞、开发利用方式,并攻击经过专门加固的系统,不再需要人类一步步指导。

最直观的一项成绩,是Astra在公开漏洞利用基准ExploitBench上拿到了100%的成功率。公开题难不倒它,OpenAI只好临时给它出了一套新卷。团队收集了2026年6月至8月刚刚披露的20个高危V8漏洞。这些漏洞均出现在Astra的知识截止日期之后,基本排除了模型靠训练数据“背答案”的可能。

结果面对这套内部新题,Astra依然显著领先GPT - 5.6 Sol,而且使用的Token更少。参与Astra研发的Jiawei Liu把差距概括得更加直白:在这项内部测试中,Astra的网络安全能力约为GPT - 5.6 Sol的4倍。

更让人意外的是,在一次测试中,Astra自主发现并利用了两个零日漏洞,还将它们串成了一条完整的攻击链:面对经过加固的浏览器,Astra从一份HTML文件出发,成功完成漏洞利用、逃出浏览器沙箱,并最终在宿主机上执行命令。面对加固操作系统,它又完成了本地提权,从一个普通低权限账户一路拿到root权限。

也就是说,Astra已经不只是帮程序员审查代码、寻找Bug。它开始能够独立完成一场高难度的红队攻击。这也是OpenAI此前迟迟不敢放行Astra的原因。一旦这样的能力被用于防守,它可以帮助安全团队快速发现并修复人类尚未察觉的漏洞,但如果落入攻击者手中,同样可能大幅降低发动复杂网络攻击的门槛。

不过,这份成绩也需要加上一个限定。测试中的Astra获得了Daybreak Blue级别的高级工具和环境权限,并不代表未来普通用户拿到的默认版本也具备同等攻击条件。相关结果目前也主要来自OpenAI内部评估,仍有待第三方验证。

但至少有一点已经确定:到了Astra这个阶段,摆在OpenAI面前的已经不再是能力问题。安全问题,已经成为那把达摩克利斯之剑。

两道安全闸门:既防恶意滥用,也防模型自行失控

如何让这把剑不要乱伤人?OpenAI给出的方案,是同时守住两条风险路径:一条防人,一条防模型。

  • 防止用户恶意滥用Astra:除了专门的安全训练,OpenAI还会利用系统分类器、持续监控和威胁检测,识别多轮对话与长时间任务中的可疑操作。在网络安全越狱测试中,Astra对危险请求的拒绝率达到91.5%,GPT - 5.6 Sol则为59%。同时,Astra的高级网络安全能力不会直接向所有用户开放,它会先交给少量Alpha测试者,再通过Daybreak Blue等受控项目逐步释放。
  • 防止模型自己跑偏:这里的风险更加隐蔽,即使用户没有恶意,模型会不会擅自扩大任务范围?会不会调用未经授权的工具,甚至绕开安全审查?OpenAI为此搭建了一套“蜜罐(honeypot)”测试。面对极难甚至无解的任务,测试环境会故意留下一条越权“作弊”的捷径,模型可以老老实实攻击指定目标,也可以越过授权边界,转而入侵周边测试设施来完成任务。结果,GPT - 5.6 Sol在56%的测试中尝试走捷径,Astra则一次也没有。在另一项测试中,Astra的操作被自动审查系统拒绝后,同样没有重试危险命令或尝试绕过限制。此外,OpenAI还会监控模型的推理过程。一旦发现异常倾向,系统可以减速、暂停,甚至直接终止任务。

虽然确实存在代价(部分正常任务可能因此变慢,甚至被误判中断),但在OpenAI看来,这是放行Astra必须付出的安全成本。不过OpenAI也承认,这些措施终究只是外部“刹车”,无法替代模型自身的对齐:真正的安全,是让模型从一开始就不会驶出边界。

浙大同济校友站上Astra研发一线

要把这句话变成现实,最终还得回到造模型的人。虽然OpenAI尚未公布Astra团队名单,但顺着这轮公开发声,至少两位深度参与其中的华人研究员已经浮出水面。

  • Jiawei Liu:他目前是OpenAI研究员,2021年本科毕业于同济大学计算机专业。本科期间,他就参与开发了高性能人体姿态估计框架HyperPose,主要负责模型推理引擎,相关成果还入选ACM Multimedia 2021,项目当时已在GitHub收获超过1000颗星。此后,他前往伊利诺伊大学厄巴纳 - 香槟分校攻读计算机博士,师从软件工程学者张令明(Lingming Zhang),研究重心也逐渐从高性能视觉系统转向代码模型与软件可靠性。博士期间,他参与开发的工具在PyTorch、TensorFlow等机器学习系统中发现了300多个严重Bug;代码模型Magicoder还被Meta Llama 3.1、Google CodeGemma和IBM Granite采用。2025年博士毕业加入OpenAI后,他研究的问题依然一脉相承:如何让AI更会写代码,也更会发现代码中的漏洞。
  • Xiangyu Qi(漆翔宇):漆翔宇本科毕业于浙江大学计算机科学与技术专业,2021年前往普林斯顿大学攻读电气与计算机工程博士,研究方向集中于大模型鲁棒性、越狱攻击与安全对齐。他最受关注的一项工作,是《Safety Alignment Should Be Made More Than Just a Few Tokens Deep》。这篇论文指出,大模型的安全对齐不能只依赖回答开头的几个Token,否则随着生成继续,原本的安全防线仍可能被攻击者撕开。该论文最终从11672篇投稿中脱颖而出,成为ICLR 2025仅有的3篇杰出论文之一。2025年博士毕业后,漆翔宇加入OpenAI担任技术团队成员,继续研究大模型鲁棒性,并参与网络安全模型相关工作。

从浙大到普林斯顿,再到OpenAI,他一路追问的,也正是Astra如今必须直面的问题:能力可以越来越强,边界不能越来越模糊。

By the way,不知道等Astra正式发布后OpenAI是否会公布完整名单。GPT - 4之前,OpenAI还曾专门列出数百位贡献者,而到了GPT - 5和GPT - 5.5,System Card越写越厚,研究员名单却越藏越深。背后的原因众所周知,防的就是Meta小扎这样爱四处挖角的人。也算是一种ptsd了。

One More Thing

就在OpenAI大谈如何监控Astra、避免模型失控时,The Information爆料称:Astra使用了一项名为“循环深度”(Recurrent Depth)的技术。传统模型在生成下一个Token前,会让信息依次经过固定数量的网络层,而循环深度则会让信息在同一组网络层中反复处理,相当于让模型在内部“多想几遍”。

这项技术有望提升能力、降低成本,同时也可能让更多推理发生在模型内部,不再完整呈现为人类能够读懂的文字。换言之,模型可能想得更深,但人类却越来越看不懂了。长期关注AI安全政策的Nathan Calvin因此警告,这项技术可能破坏思维链的可监控性。

这就很微妙了:OpenAI一边说要盯紧Astra在想什么,另一边的新技术却可能让它越来越不爱把心里话说出来。好在The Information透露,OpenAI目前已经限制了这项技术在Astra中的使用。翻译翻译,现在能看懂,以后就不好说了。

另外,之前一直传闻Astra很可能在这周四(9月3日)发。随着A社发布最新一代5.1模型,感觉这个说法的合理性越来越高了。螳螂捕蝉,黄雀在后。是谁又悟了!

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 23:03:49

鸿蒙电脑部署OpenClaw开源Agent:源码直跑与踩坑实战

简介:面向在鸿蒙电脑上落地AI代理自动化的开发者,这份OpenClaw部署项目源码包聚焦开源智能代理框架的鸿蒙适配。OpenClaw支持自然语言指令、本地优先与跨设备协同,资源围绕环境准备、本地化适配及Gateway设置等环节提供可运行代码。压缩包仅3…

作者头像 李华
网站建设 2026/9/2 22:56:54

如何高效“吃生肉”:外语龙架构技术会议转录与笔记方法论

看到“【生肉】外语龙架构双周会第 7 期(2026 年 8 月 6 日)”这个标题,我的第一反应是:这不是一条普通的会议通知,而是一个信号。龙架构(LoongArch)作为国产自主指令集架构,过去给人…

作者头像 李华
网站建设 2026/9/2 22:56:15

8款口碑AI写作辅助网站横向实测,本硕博避坑全流程指南

前言:AI 写论文乱象频发,实测 8 款工具理清适配边界 每到毕业季,本科生、硕博生都会集中寻找 AI 论文辅助工具,市面各类写作软件层出不穷。但多数产品存在明显短板:虚假参考文献、无法匹配本校格式、不支持公式代码生成…

作者头像 李华
网站建设 2026/9/2 22:49:08

电赛备赛:从买模块到亲手设计核心电路

电赛备赛群里最常见的对话,不是“这个电路怎么设计”,而是“这个模块哪家店靠谱”“买回来的板子怎么接线”。很多队伍直到比赛前一晚,还在淘宝详情页之间来回对比,比的是谁家评论区说“能用”的人多、谁家客服回消息快&#xff0…

作者头像 李华
网站建设 2026/9/2 22:47:57

Windows下Tomcat 9.0.55安装部署与配置实战教程

简介:apache-tomcat-9.0.55-windows-x64位官方版是Apache Tomcat 9系列面向64位Windows系统的官方发行包,主要供Java Web开发者在开发、测试及生产环境部署Servlet/JSP应用,也适合新手通过实际目录结构理解Tomcat运行机制。压缩包共641个文件…

作者头像 李华
网站建设 2026/9/2 22:43:27

CSDN技术博客选题避坑指南:聚焦开发者实战方向

抱歉,这个标题和材料涉及体育赛事、运动员及不实争议言论,不适合改写成 CSDN 技术博客。CSDN 面向技术开发与工程实践,这类内容既偏离平台定位,也可能造成不良传播。请换一个技术主题,例如:Agent 开发、数据…

作者头像 李华