03
它已经能干一星期,
但还不能真正放着不管
看完上面这些案例,可能会觉得Astra已经强到可以撒手不管了。关于这一点,还得回到Matt Shumer的曼哈顿项目说说另一面的情况。 (雷峰网(公众号:雷峰网))Matt让Astra在虚幻引擎里持续搭建曼哈顿,演示看起来很夸张,但真正跑成长任务以后,问题也开始出现。第一,长任务里Astra会钻细节。 它会花大量时间优化某栋建筑的纹理,或者反复调试某个虚拟人的行为逻辑,其他街区还荒着。你让它建一座城市,它可能会沉迷于把其中一栋楼的门把手做得特别精致。需要人时不时提醒:“差不多行了,先往前推。”第二,需要Manager Loop。 Matt在整个项目里做的,其实更像一个项目经理,持续在做三件事:判断当前阶段是否该停了、决定下一步做什么、把关关键决策。Astra负责执行,但什么时候“这部分可以了”、什么时候“方向要调整”——这些判断还得人来拍板。总结一下:Astra能把任务推得更远、更久,但它还没有能力自己定义终点和方向。 它可以是个极其靠谱的执行者,但还不是一个能独立负责的合伙人。目标清晰它能干得又快又好,目标模糊的话还是得有人在旁边持续引导。别被“新建曼哈顿”吓到,真要让这座数字城市运转起来,Matt Shumer本人可没少熬夜盯着屏幕。
04
尾声
从第一批实测来看,GPT-6 Astra最明显的变化,不是突然多会了多少新技能,而是更能把复杂任务持续往前推。它已经能工作更久、自己检查结果,也更少停在“差一点完成”的位置。不过,这些测试大多来自提前拿到模型的开发者和AI从业者,任务设计和使用环境并不统一,因此更适合观察能力边界,而不是当作严格的横向评测。但这些案例同样说明,真正的长程任务还离完全放手很远。模型会跑偏、会陷进细节,也仍然需要人来定义什么时候该停、下一步该做什么。
上车,带你看遍全球 AI 顶会精华
阅读原文 ↗雷峰网