Nvdium今日发布 893 篇
返回信息流

GPT-6 Astra杀疯了:只要你学得够慢,就可以不用学了?

GPT-6 Astra杀疯了:只要你学得够慢,就可以不用学了?配图

最近两天,相信大家都被 GPT-6 Astra 的各种逆天玩法刷屏了 —— 一句话完成 3D 建模、从零制作完整游戏、几千个零件的东西说拆就拆,甚至还能拿来控制机器人…… 总之,强得没边。

网友们有句话说得很夸张:只要你学得慢,你就可以不用学。但是 GPT-6 Astra 确实给人一种感觉,它一出来,原来困扰很多领域的复杂性突然就有解决的苗头了。

这种趋势不容小觑,但模型现阶段的能力也不宜过度夸大。在这篇文章中,我们就来盘点一下 GPT-6 Astra 的各种逆天玩法,及其当前的局限。3D 建模这件事, 突然开始变简单了?

这两天 Astra 最密集刷屏的能力,大概就是 3D。有人拿它来直接生成 3D 的火车: 两列火车都是 Astra 用 TypeScript 和 Three.js 代码,在浏览器运行时直接生成出来的。

车身尺寸、轮廓、各种几何结构来自代码里的尺寸参数、profile 和 geometry function;车轮运动是代码,整辆火车炸开、零件散开再重新组装的动画也全是代码。而且,这些模型做出来之后还能按部件拆开。一台相机可以被拆成 122 个组件组、1877 个独立建模部件。

整个任务大概跑了 3 个小时,作者表示之前根本没意识到 Three.js(一个用于在浏览器中创建和展示 3D 图形的 JavaScript 库)还能这么玩。相机能拆,特斯拉也能拆。有人将其拆成了 334 个建模部件,而且这 334 个零件的名称、编号和基础结构是有官方依据的,不是 AI 凭空捏造的。

当然,它仅仅是一个非常粗略的框架级拆解,远远达不到 3D 拆解所需的精细度。有意思的是,这个作者拆完特斯拉不过瘾,还建了个网站来「拆人(男性)」:全身的 2234 个建模部件可以逐一查看,而且可以映射到源文件。看到这些案例,有人高呼「3D 建模的学生天塌了」。

但也有人说,AI 现在直出的结果还不能商用。而且,稳定性也是一大问题,它终究还是需要人来修 bug 的。这些 Demo 的意义,并不只是证明 Astra 会建模。

更重要的是,它展示了一种新的交互方式:人不再需要学习复杂的 3D 软件,而是直接描述想要的世界,让 AI 负责把想法翻译成空间结构。过去,3D 建模是进入数字世界的门槛;未来,它可能变成 AI 理解和生成现实世界的一种基础能力。当然,距离真正工业级应用还有距离,但这条路正在变得越来越清晰。

软件不用学了?Astra 自己进去点 在 OpenAI 的官方定位里,computer use、browser use 都是 GPT-6 Astra 的王牌能力。在一个 Canva 绘画案例中,我们看到了这方面的真实体现。在这个案例中,网友让 Astra 在 Canva 里把他画出来(根据参考照片复刻肖像)。

画图过程中,Astra 能够直接操控浏览器中的 Canva 界面:选择工具、精确点击 / 拖动、逐层绘制(从背景到身体、手臂,再到脸部细节),最终完成一张高度相似的像素风格半写实肖像。这里面还涉及长时间多步骤操作(作者反馈约 1 小时)、工具切换(Chrome 中途出问题后切换到 computer use 模式),以及极高的界面理解与精细控制精度。

隔壁 fable 5.1 也拿到了相同的提示,但结果让网友略显失望: 做这个实验的还不止他一个人。

另一个网友也拿同一张照片让两个 AI 画,结果也差不多:Astra 更写实,Fable 5.1 更洒脱…… 视频链接:https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q 不过,有网友指出,这些东西的最终视觉效果不是重点,重要的是有 Astra 加持的 Agent 已经能够自己操作 Blender、虚幻引擎、浏览器,把 prompt 直接变成工程文件。

这几天刷屏的「Astra 使用 Blender 重建旧金山艺术宫」「张老蒸汽火车图纸,变成 Blender 里的 3295 个可编辑对象」「600 个 Astra Agent 住进同一个 Unreal 世界」都是这一方向的典型案例。

视频链接:https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q 另一个比较有意思的案例是「弹钢琴」。OpenAI 员工 Victor E.Nunez 让 Astra 找一个在线钢琴,用 Computer Use 弹《River Flows in You》。

在执行过程中,Astra 自己搜索并打开了一个在线虚拟钢琴网站,然后用 Computer Use 直接操控电脑界面:鼠标点击当作「右手」,点击钢琴键。键盘控制当作「左手 + 快速段落」。两者同时进行,精确控制节奏、音符时值,完整演奏了《River Flows in You》这首曲子。

视频链接:https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q 更有意思的是,Astra 自己录了屏幕,并剪辑了这个演示视频。整个过程是端到端的:从理解任务 → 找网站 → 加载乐器 → 实时演奏,无需人工干预中间步骤。

这些案例表明,GPT-6 Astra 在 agentic computer use 上达到了新的高度,速度、精度、多工具并行和实时反馈能力都达到了相当高的水平。或许,以后人们可以不执着于想怎么把某个专业软件的能力重新做成 AI 功能,直接把软件交给 AI 用就行了。能够操作任何为人类设计的软件,大大扩展了 AI 的应用场景。

屏幕之外, Astra 开始控制机器人了 前面的 Demo 再离谱,本质上还都发生在电脑里。网友 Jay Chooi 做的测试就不太一样了:他们真的把 Astra 接到了机械臂上。其中一个任务,是让机械臂把积木放进碗里。

GPT-6 Astra 做了 20 次,成功率达到 95%;对照的 Fable 5.1 是 40%。同时,其输出 token 数仅为后者的约 16%,成本仅为后者的约 43%。更关键的是,这里没有针对这个任务给 Astra 做示范或者微调。

Jay Chooi 后来专门补充,这是一个 zero-shot 测试。模型负责给出机械臂末端执行器的位置和姿态,再通过自动逆运动学求解器转换成机械臂动作。随着大模型 token 输出速度的加快,Jay Chooi 乐观预计,LLM 最早今年年底就能实时控制机械臂,最迟在 2029 年。

英伟达前研究科学家 Yu Xiang 则进一步指出,机器人学的下一个前沿可能是如何真正利用先进的 AI 模型来进行操控。仅仅将它们用作调用感知和规划模块的 Agent 是不够的。我们需要新的方法来将这些模型与物理世界连接起来。

这样的结果也让人好奇,OpenAI 到底在后训练里加了什么,才让模型这么全能?还是说预训练有所突破?还学吗?看了这些,有人感叹,AI 已经不满足于生成一张图,而是开始试着「重构世界」了。

一个问题自然浮出水面:当 AI 能建模、能写代码、能操作软件,甚至开始碰物理世界,我们今天苦学的这些技能,到底还有多少会以现在的形态存在?这个问题现在当然没有答案。Astra 还有大量不稳定、粗糙甚至根本不能用的地方,但这两天真正让人不安又兴奋的,可能也正是这一点:很多过去默认必须由人掌握的复杂操作,第一次出现了被整体打包给 AI 的可能。

至于「以后还要不要学」,答案肯定是还得学。只是我们可能得重新想想,到底什么才值得学。

前往 cnbeta.com.tw 原文入口 ↗
分享这条情报