光合及目
1lux.xyz
← 报道
产品新闻1lux· 2026-09-30

Dyna 发布 Dyna-2.1 + Taku:工作流编排如何让机器人真正"上岗"

Dyna 发布 Physical Agent 系统 Dyna-2.1 + 半人形机器人 Taku,通过三层控制架构和统一机器人表征 URR,实现一小时无剪辑自主完成 79 步洗衣工作流。

Dyna 发布 Dyna-2.1 + Taku:工作流编排如何让机器人真正"上岗"

8 月那次发布,Dyna 亮出了一个数字:100 万小时人类视频和语言数据训练的 Dyna-2 世界-动作模型。行业的第一反应是"数据量确实大",紧接着的问题是——然后呢?

今天 Dyna 给出了回答:Dyna-2.1 + Taku,一个完整的 Physical Agent 系统。不是更大的模型,不是更多的数据,而是把模型、硬件、控制器和任务编排器捏成一个整体,让机器人真正跑完一个完整的工作流。

一、从 1.7% 到可用:一道乘法题暴露了整个行业的问题

Dyna 在博客里放了一个交互式图表,算了一笔所有做长程任务的人都回避的账:

79 个子任务,每步 95% 成功率 → 完整流程完成概率约 1.7%。平均每 8 分钟需要一次人工介入。

这个数字刺眼,但诚实。行业里大量 demo 展示的是单个动作的成功率——叠一条毛巾、抓一个物体、开一扇门——然后在宣传里暗示"把这些串起来就能干活了"。Dyna 直接把乘法做出来,告诉你串起来之后会发生什么。

这也解释了为什么"一小时无剪辑"是这次发布最重要的信号,而不是任何单项指标。一小时无剪辑意味着机器人在没有人类 babysit 的情况下,连续通过了约 79 个可能失败的节点。哪怕每步成功率提升到 99%,79 步下来完成概率也只有约 45%。要让一小时流程可靠跑完,单步成功率需要逼近 99.5% 以上。

Dyna-2.1 真正要证明的事:不是模型更大了,而是单步可靠性被推到了足够高的水平,使得长程复合之后仍然可用。

二、URR——这次发布中最容易被低估的东西

行业讨论大概率会聚焦在"一小时无剪辑"和 Taku 的硬件设计上,但 URR(Unified Robot Representation)才是这次发布中技术含量最高、长期影响最大的部分。

问题:人类数据和机器人数据之间有一道鸿沟

Dyna-2 的核心资产是百万小时人类视频数据。但人类视频里只有像素,没有关节角度。传统做法是先做视觉重建、再做运动学重定向(retargeting)——把人体姿态映射到机器人关节空间。

Dyna 在博客里指出了这条路的致命问题:关节空间的重定向会把手从物体接触点上拉开。人在视频里手是贴着毛巾边缘折叠的,retarget 到机器人关节空间后,由于运动学差异,手的位置偏了,但标签仍然标记为"正确动作"。这种 label noise 在单个动作上可能不致命,但在 79 步的长链中会被放大。

URR 的解法:不走关节空间,走任务空间

URR 用手腕、肘部、胸部和足迹的任务空间位姿(task-space pose)来描述身体状态,而不是关节角度。这个表征有三个关键性质:

  1. 具身无关(embodiment-agnostic):人类、人形机器人、半人形机器人、桌面机械臂都可以用同一套表征。
  2. 任务空间聚焦:手在哪里、手相对于物体的位姿是什么——这些才是任务完成的关键约束。
  3. 无损可逆:给定参考坐标系和起始状态,可以从相对位姿动作中无损恢复完整状态。

所有数据源——遥操作、第一人称视频、动作捕捉、UMI 手持夹爪——汇入同一个表征空间,策略模型看到的是一个统一的、任务语义一致的数据分布。这比"更多数据"重要得多——数据的一致性决定了模型能否从数据量中真正受益。

更深一层:URR 让硬件迭代不再清零数据资产

硬件改版后只需要重新训练底层控制器,策略层积累的数据可以继续用。机器人公司最痛苦的事情之一是换一代硬件,之前花几个月采集的数据就作废了。URR 把策略层锚定在任务空间,硬件变化只影响"任务空间指令→关节执行"这一层。Dyna 把自己的数据资产从硬件绑定中解耦了,这是一个战略级的架构选择。

三、三层架构:把"理解"和"执行"拆干净

Dyna-2.1 的控制系统分三层:

  1. 全身控制器(100 Hz):基于大规模 GPU 并行强化学习在 Isaac Sim 中训练,将任务空间轨迹转化为关节目标和轮速指令。
  2. Dyna-2 策略层(~5 Hz):改进的世界-动作模型,从当前观测生成全身目标轨迹。
  3. 工作流编排器:视觉-语言模型跟踪工作流状态,处理非线性、条件性的决策分支,驱动 Dyna-2 的执行。

100 Hz 控制器和 ~5 Hz 策略层之间 20 倍的频率差意味着控制器在策略给出每一个目标轨迹后,有 20 个周期来做实时修正——补偿执行误差、处理接触力变化、维持平衡。

四、工作流编排:Physical Agent 真正的大脑在哪一层

一条毛巾走的是直线,机器人走的不是

Dyna 在博客里有一句话点出了核心难题:

"Towels follow a linear progression from wash → dry → fold → stack, but the robot does not."

毛巾的生命周期是线性的:脏→洗→烘→折→上架。但机器人不能按这个顺序一条条处理——它面对的是多台并行运转的洗衣机和烘干机,每台有自己的时间表,任何一台完成都意味着一个新的高优先级事件插入当前任务流。机器人必须在"继续当前动作"和"响应新事件"之间持续做出判断。

13 个决策节点,拆开看

Dyna 在博客的 Figure 2.3 里画出了完整的洗衣工作流,13 个决策节点按四个阶段分布:

阶段 A — 装载洗衣机(循环)

  1. 洗衣机是否空闲可用?
  2. 从脏衣篮取毛巾
  3. 毛巾掉了吗?→ 掉了则进入回收路径
  4. 篮子空了吗?→ 没空继续取;空了关门启动

阶段 B — 洗衣机→烘干机转移(循环)

  1. 洗衣机是否完成且烘干机空闲?
  2. 打开两扇门,转移湿毛巾
  3. 洗衣机掏空了吗?→ 没空继续掏;空了关门启动烘干

阶段 C — 卸载烘干机

  1. 烘干机完成了吗?
  2. 将毛巾转移到折叠台

阶段 D — 折叠与上架(可中断循环)

  1. 折叠当前毛巾
  2. 按尺寸分类
  3. 架子有空位吗?→ 有则放置;满了换架子
  4. 机器在等吗?→ 是:中断折叠,跳回"检查机器"节点

这个流程图在结构上像一个带记忆的分层状态机:四个阶段是顶层状态,每个阶段内部是循环,循环之间有条件跳转,而第 13 个节点是一个全局中断触发器。

中断与恢复:编排器最难的部分

第 13 个决策节点("机器在等吗?")是整个编排逻辑中最有技术含量的部分。折叠是一个耗时操作,但洗衣机或烘干机可能在折叠过程中的任何时刻完成。闲置的机器等于浪费的产能,在商业场景中直接影响吞吐量和 ROI。

编排器必须做到四件事:

  1. 异步监控:折叠的同时持续感知机器状态
  2. 中断决策:检测到机器完成时,判断是否值得中断当前折叠
  3. 上下文保存:中断后需要记住折到哪里、哪些毛巾已分类、架子还剩多少空位
  4. 无缝恢复:处理完机器后回到折叠任务,从中断点继续

这不是简单的 if-else,而是一个需要工作记忆(working memory)的实时调度问题。

VLM 做编排器:优势和风险

Dyna 选择用视觉-语言模型(VLM)做编排器,而不是传统的有限状态机(FSM)或行为树(BT)。

为什么不用 FSM / 行为树:FSM 的状态转移是硬编码的。换一个场景需要重新写一个完全不同的 FSM;真实环境中的异常情况很难穷举;FSM 无法处理"这个情况没见过但可以推理应该怎么做"的场景。

VLM 的优势:通过视觉观测理解当前场景,通过语言推理做出决策。看到一条毛巾挂在烘干机门上,不需要专门编程,VLM 可以从视觉理解"这条毛巾需要被取下来"。更重要的是跨场景的可迁移性:同一个 VLM 编排器,给它不同的流程描述就能编排不同任务。

VLM 的风险——Dyna 没有展开讨论的:

  1. 幻觉在物理世界的后果不对称。VLM 编排器产生幻觉——比如"判断洗衣机已完成"但实际还在转——后果可能是机械损坏或水溅出来。
  2. 长程状态追踪的可靠性。VLM 需要在数小时的连续运行中保持对过去事件的准确记忆。博客提到了"长期记忆"作为编排器组件,但没有说明实现机制。
  3. 推理延迟与实时性的矛盾。策略层跑在 ~5 Hz(200ms 周期),编排器需要在每个决策周期内完成完整推理链路。

编排器应该学出来还是设计出来?

Dyna 的技术路线是设计出架构,学出执行——编排器的分层结构是设计的,但内部决策逻辑是 VLM 学出来的。

行业里存在两个相反的思路:纯端到端派认为不需要显式编排层;经典规划派认为高层决策应该用符号规划器(PDDL/HTN)保证可验证性。Dyna 选了中间路线:用 VLM 替代符号规划获得灵活性,但保留显式的分层架构约束 VLM 的行为空间。VLM 在一个结构化的决策图上做节点选择和条件判断,决策图限定了输出空间,减少了幻觉和离谱决策的概率。

编排器是 Physical Agent 的真正分水岭

底层控制器和策略模型负责把每一步的成功率从 95% 推向 99%+。但编排器决定了这 79 步的序列本身是否合理——是否在对的时间做对的事、能否从失败中恢复、能否在并行任务间高效切换。

这就是为什么 Dyna 把 VLM 编排器放在架构的最顶层——它不是辅助组件,它是整个 Physical Agent 的大脑。底层控制器是小脑(运动协调),策略模型是运动皮层(动作生成),编排器是前额叶(规划、决策、工作记忆)。三者缺一不可,但最终决定机器人能否"独立当一个员工"的,是前额叶。

五、Taku 硬件:每个设计选择都在服务数据飞轮

为什么是半人形而不是全人形:全人形(双足)的平衡控制消耗大量算力和训练数据,而且引入了不必要的失败模式——摔倒。Taku 用四轮底盘换取绝对的移动稳定性,把资源集中在上半身的操作能力上。可折叠下半身让它覆盖从地面到头顶的全高度作业范围。

为什么用行星减速器而不是谐波减速器:Dyna 选择低速比行星减速器,牺牲一些精度,换取更高的关节速度和加速度。在有 100 Hz 控制器做实时补偿的前提下,关节层面的绝对精度不是瓶颈,执行速度才是。

尺寸对标人类:Taku 的手腕、肘部、胸部位置与人类体型对齐,最小化人类数据到机器人数据的映射误差。

六、"三天部署"意味着什么

Dyna 声称新场地三天达到生产级可靠性。如果属实,意味着泛化能力到了"微调"级别——预训练模型具备通用操作理解,部署时只需几小时在线数据适应新场地布局。

如果这个能力是真实的,它解决了机器人商业化最大的阻碍之一——部署边际成本。每个新客户不再需要工程团队驻场数月调试,而是变成可规模化的交付流程。

七、没说的部分

  1. 失败恢复的具体机制:恢复策略是硬编码的、模型学到的、还是编排器推理出来的?
  2. 实际的单步成功率数字:一次成功跑完一小时不等于统计显著。
  3. 编排器的幻觉防护:VLM 在物理世界的错误判断代价极高。
  4. 数据飞轮的冷启动成本:百万小时视频→URR→策略预训练管线的构建成本和可复现性。
  5. 经济性:Taku 的硬件成本、单台时薪产出、与人工的对比。

结语

Dyna-2.1 最大的贡献不是某一项技术突破,而是把一个正确的架构选择贯彻到了每一层——URR 统一数据、三层架构分离关注点、硬件设计服务数据效率、部署流程追求边际成本递减。这是一个系统工程层面的答案,回应了"100 万小时数据然后呢"这个问题:数据本身不是产品,把数据转化为可部署的、可靠的、可规模化的物理 agent 才是。

成为付费用户可以阅读 Dyna Robotics 所有资料

了解更多 →