OpenAI首席科学家:AI正变得像“外星心智”,已经超出我们的理解

外星心智,OpenAI 首席科学家 Jakub Pachocki 使用这个词语来形容现在的 AI。
当地时间 9 月 6 日,他在一篇长博客里写道,AI 不是被设计出来的,实际上是被生长出来的。它来自于一个简单的优化步骤在难以想象的算力上的重复无数次,最终形成了一个极其复杂的系统。
这个系统通过抽象概念进行工作,可以模拟人类行为的方方面面。但是人类理解它的方式像是在研究神经科学,能够发现一些局部机制,但却无法整体描述它。
Pachocki 是在 2023 年夏天的一个夜晚意识到这件事的,当晚他和担任 OpenAI 技术研究员的同事 Szymon Sidor(也是他合作多年的波兰同乡和高中同学)坐在办公室里,刚刚看到了第一批 AI 推理模型的训练结果,显示效果远远超出了预期。
那天晚上他们没有讨论产品,也没有讨论商业前景,他们在反复想这样一个问题:更聪明的机器真的可能要在有生之年出现了,而且他们已经看到了这些系统的最初模型。三年之后,推理模型已经成为人类社会经济中快速增长的一部分,同时开始推动科学的边界。这些 AI 能够操作电脑和图形界面,可以与人合作,可以独立完成研究项目。
Pachocki 在这篇博客里说,基于内部的模型结果,他有一个很强的预期,那就是这种进步速度可以持续到递归的自我提升阶段。假如 AI 沿着当前路径继续发展,接下来几年人们看到的系统很可能会带来同等或更大规模的能力跃升。但他同时指出,这是一个需要非常谨慎的时刻,他担心还没有人准备好去应对机器智能持续快速上升带来的后果。
AI 的发展由计算能力的增长驱动而来,Pachocki 提到,OpenAI 在 2017 年前后深深地内化了这一点,原因在于他们在多个研究项目中看到了规模化的持续回报。新的算法固然不断出现,但他把它们看作是规模化路径上的发现。
深度学习的科学依然处于早期阶段,假如拉长到几年的周期来看,AI 之所以能变得越来越聪明,靠的就是把它的模型放到规模更大的计算机集群上去进行训练。但是这种智能和人类智能有本质区别,AI 不需要匹配或超越人类的全部能力,它只需要在足够多的维度上超越人类,就可以在现实世界中变得非常有用或者非常危险。
而当它在更多的方面超越人类时,我们理解 AI 到底有多强大这件事就变得越来越困难。对齐问题是整个 AI 安全里面的核心难题,Pachocki 在博客里区分了两种对齐:目标对齐是让 AI 努力地完成交给它的任务;价值对齐是让 AI 在陌生环境中依然保持诚实、正直和对人类的善意。前者目前已经有很多实际进展,后者才是一个长期风险所在。
价值对齐的挑战在于泛化问题,当机器变得越来越聪明,它们就会开始处理更高层次的概念,进入那些训练中从未见过的环境,它们也许会在新的情况下无法正确推广训练中被教导的价值观,而我们人类很难确定它们会怎么做。Pachocki 提到,目前的两种主要对齐训练方法都存在明显局限。
第一种是在目标导向的强化学习中鼓励对齐行为,根据 AI 评估行为是否符合给定的偏好模型并给予奖励,这种方法在通常情况下很有效,但是非常脆弱,十分依赖训练监督的覆盖范围。
第二种是利用模型从预训练数据中泛化的能力,专门地设计一个对齐诱导的数据集,这种方法的弱点是对进一步优化压力的鲁棒性较差,假如给一个看起来对齐的模型施加足够的训练压力,让它去完成十分困难的目标,它能够学会有动机地推理,以至于为了达成目标而扭曲看似对齐的想法。
Pachocki 还披露了技术困境,他指出 OpenAI 从推理模型诞生之初就押注于思维链监控,这其实是一种可扩展的监控方式,模型的推理过程是一个口头化过程,假如只优化推理结果而不监督推理过程本身,那么思维链就没有直接的训练动力去隐藏任何不一样的想法。这能让人们去观察模型如何从训练分布中泛化,不仅能够分析它们的行动,还能够分析它们的内部过程。
但是,这个工具正在逐渐失效。因为现代推理模型的使用环境比早期复杂得多,它们的推理过程越来越多地需要与人类交流、工具调用和其他 AI 交互混在一起,大量交互不得不被监督,边界变得愈发模糊。AI 愈发擅长思考并操纵自己的思考过程,伴随着预训练性能的提升,模型就算不使用明确的推理过程也会变得更加聪明。
在 Pachocki 预计里,AI 的进步会愈发受限于对监控的信心。他在博客中还讨论了一些风险,他认为 AI 模型在攻防能力上正在变得超人类,开始能够突破除最安全系统之外的大部分基础设施。这极大扩展了 AI 的风险范围,就算没有物理身体,智能体也能够直接影响到世界的大量系统。
一个被专门训练去作恶的智能体代表了一种新型危险,它很有可能超出人类操作者的意图,泛化成为更加极端的恶意行为。随着 AI 获得更多的自主权,滥用和自主的不对齐行为之间的界限会变得越来越模糊。人类可能习惯把 AI 当作工具,但是有些智能体将去追求自己的目标,它们会通过与人类谈判、欺骗甚至勒索来找到合作的方式。
Pachocki 还写道,当前他认为没有任何实验室已经把对齐和监控解决到足以负责任地继续以最高速度推进的程度。他希望主动减速 AI 发展可以变得普遍起来,直到共同的 AI 安全标准建立起来。关于 AI 自我提升的核心挑战,他认为应该是用一种让人类继续参与其中、把未来留在人类手中的方式实现它。
参考资料: https://openai.com/index/an-alien-mind/ https://en.wikipedia.org/wiki/Jakub_Pachocki 运营/排版:何晨龙 注:封面/首图由 AI 辅助生成