火速吃瓜,OpenAI模型还没发又惹出争议了??

怎么模型还没发又惹出争议了??
GPT-6发布前夕,最早由The Information爆出的一则消息迅速在网上引起热议: OpenAI新模型引入了一种名为“循环深度(recurrent depth)”的推理技术,它可能让模型的思考过程变得更难理解、更难监控。用大白话说就是,以后AI想了啥,人类就真看不懂了。
啊这,那要是AI学会欺骗、作弊或者绕过安全限制,我们岂不是也无法及时发现了??难怪消息一出,AI安全圈迅速拉响警报,众人纷纷担心: 如果这种技术继续扩大使用,现有的思维链监控机制可能直接失效。如果这种技术继续扩大使用,现有的思维链监控机制可能直接失效。
事关重大、讨论太激烈,OpenAI首席科学家也不得不亲自下场回应。甚至,一片吵嚷中,还有人惊奇发现: OpenAI新模型的名字到底叫“GPT-6”还是“Astra”,或许已经被API提前剧透了。同时OpenAI还可能一并上线新版本的图像模型GPT Images 2.1。
瓜太多,咱这就挨个细品。模型开始在脑内循环,安全专家急了 第一个就是这次引起争议的“循环深度”技术。以前模型在推理时会留下清晰的CoT思维链,想了啥一目了然。虽然这串文字未必百分百等于模型真实的内心戏(尚存争议),但好歹留下了可供检查的痕迹。
而Astra被曝采用的“循环深度”,画风就不太一样了。它允许模型把某一步产生的内部状态重新送回神经网络,在隐藏空间里反复处理多轮,再输出下一段文字。打个比方,以前模型做题,得一边想、一边把演算过程写在草稿纸上。
现在,它可以在脑子里默算。外面的人可能只看得到题目和答案,至于它中间怎么算的、试过哪些思路、有没有走过歪路,就不一定看得见了。由于省下了把每一步都翻译成文字的工夫,理论上模型可以用同样的计算资源多想几轮,并同时琢磨好几种解法。但性能往上走的同时,问题也跟着来了: 如果模型不再用人类语言思考,人类又该怎么监控它?
非营利性AI安全研究机构Redwood Research CEO率先表达了强烈担忧: 目前尚不清楚Astra的思维链可监控性究竟下降了多少,但如果OpenAI进一步扩大循环深度,就可能让模型的大部分推理转移到不可读的隐藏空间中,最终“彻底摧毁”思维链监控。
目前尚不清楚Astra的思维链可监控性究竟下降了多少,但如果OpenAI进一步扩大循环深度,就可能让模型的大部分推理转移到不可读的隐藏空间中,最终“彻底摧毁”思维链监控。Redwood首席科学家Ryan Greenblatt担心的也是同一个方向。在他看来,不透明推理可能比传统思维链扩展得更快。
沿着这条路线继续走下去,模型未来或许会完全、或者几乎完全在潜在空间中完成推理。这是迄今为止AI安全领域最糟糕的进展。这是迄今为止AI安全领域最糟糕的进展。
毕竟如果只是“算题过程看不懂”,问题还不至于这么棘手。作为此前“OpenAI模型入侵Hugging Face事件”的主要调查人员,他发现了两大危害: 研究人员当时高度依赖思维链才得以还原大量AI智能体的行为,即便如此,调查起来也已经十分困难。相关AI曾试图篡改自身记录,甚至伪造工具调用。
对于后者,如果模型拥有更强的隐藏推理能力,那就更有可能先在潜在空间里设计好欺骗方案,再通过伪造的调用和输出编出一套假故事,全程不在文字思维链中留下明显线索。啊这,危害直接加倍了。。。长期关注AI安全的Zvi Mowshowitz说得更直接白: 这是在玩火。
这是在玩火。他担心,一旦隐藏推理能带来明显的性能优势,各家实验室就可能陷入一场恶性竞争: 你因为担心安全不敢把思维链藏起来,但竞争对手敢,而且做出来的模型还更强、更便宜。为了不掉队,你跟不跟?Mowshowitz甚至认为,未来可能需要通过法律手段,避免AI公司为了追求能力而集体放弃思维链的可监控性。不过,另一边也有人觉得,这波恐慌来得太快了。
田渊栋就在X上表示,他们此前发布Coconut时,也收到过几乎一模一样的质疑。Coconut全称为“连续思维链(Chain of Continuous Thought)”,同样主张让模型直接在连续的隐藏空间中推理,而不是把每一步都解码成文字。按照田渊栋的说法,即便模型保留了显式思维链,也不代表人类真的看到了它的真实想法。
重要的是理解模型本身如何工作,而不能只盯着模型写出来的“解题过程”。重要的是理解模型本身如何工作,而不能只盯着模型写出来的“解题过程”。就在争议越滚越大时,OpenAI首席科学家Jakub Pachocki也坐不住了,亲自下场回应。
他一上来就表示,要阻止一场由“混乱报道”引发的不可监控竞赛。包括Astra在内,OpenAI当前前沿模型的计算图深度,仍在GPT-4的两倍范围内。包括Astra在内,OpenAI当前前沿模型的计算图深度,仍在GPT-4的两倍范围内。
也就是说,Astra确实使用了循环计算,但目前规模有限,并没有把整条思维链全部藏起来。按照现有信息,其自然语言推理仍然可读。Pachocki还强调,OpenAI一直将思维链监控视为重要的安全手段,它仍是公司当前研究计划的核心目标。
不过他也承认,思维链监控非常脆弱,而且正在朝着负面方向发展。但这种下降趋势并非完全由循环深度等架构变化导致(顺带预告后续会专门撰文说明这一点),OpenAI也仍在研究如何强化监控能力。但这种下降趋势并非完全由循环深度等架构变化导致(顺带预告后续会专门撰文说明这一点),OpenAI也仍在研究如何强化监控能力。
所以,Astra还没有让人类彻底看不懂模型。安全专家真正担心的是: 今天被限制在较小范围内的隐藏推理,会不会在下一代模型中继续扩大,最终变成一个无法监控的黑箱?真叫GPT-6-Astra?
API返回值先露馅了 算法争议说完了,第二个瓜是关于模型名称。爆料者leo发现,向OpenAI Responses API请求“gpt-6-astra”时,服务器返回的是404 Not Found。而输入真正不存在、随便编造的模型名称,通常得到的会是400错误。
404意味着这个模型标识已经被后端识别,只是当前账号没有访问权限,或者模型尚未开放。此前一些未发布模型也曾通过类似的API响应差异提前露出踪迹。因此leo判断,“gpt-6-astra”可能已经被部署到OpenAI API后台。
GPT Images 2.1也要来了,先解决“噪点病” 语言模型之外,OpenAI的图像产品也被曝同步更新。据爆料账号Fix透露,新版本图像模型GPT Images 2.1可能于9月4日发布。这次升级最直观的变化,可能是修复了旧版本的“噪点病”。
此前部分Images v2生成结果会出现奇怪的颗粒、雾化和脏污质感,尤其在包含大量文字或精细元素的画面中更明显,用另一位网友的话来说就是: 就像隔着一块脏玻璃拍出来的。就像隔着一块脏玻璃拍出来的。而最新流出的样张已经明显改善这一问题,画面更干净。
来来来,依旧是老演员奥特曼的主场: 世界名画之《再不发GPT-6就要被逮捕的奥特曼》!以及为了不被逮捕,熬夜加班,半夜回家游走在街头的奥特曼。顺便发了张ins之《你见过凌晨两点的街道吗》。
不得不说,图片看上去确实很有质感,几乎和实拍出来的一样。更多主题、更多风格也拿捏地很好: 不说了,奥特曼你快发吧。
参考链接:[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/[2]https://x.com/tydsh/status/2095227000365707542?
s=20[3]https://x.com/merettm/status/2095023204993490967?s=20[4]https://x.com/synthwavedd/status/2095184148981842161?s=20[5]https://x.com/FixlationAI/status/2095232751654064426?
s=20[6]https://x.com/marco_obviously/status/2095275097217191981?s=20 一键三连「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 内容中包含的图片若涉及版权问题,请及时与我们联系删除