▎Humanoid Badminton: Bringing Athletic Robots from the Lab to the Court
主讲人:刘晨澔,动易科技(PHYBOT)
01
为什么偏偏是羽毛球
大家早上好!能受邀参加本次研讨会,并与在座各位探讨人形机器人在体育运动领域的最新进展及未来前景,我深感荣幸,也倍感兴奋。我是来自中国动易科技的刘晨澔,目前带领团队做人形机器人在球类体育运动中的研发工作。今天我演讲的题目是《人形羽毛球:把运动机器人从实验室带进球场》。
和许多来自学术界的资深研究人员不同,我将更多地从工业视角来探讨这一主题,不仅分享我们如何开发这些运动能力,还将介绍如何将它们从实验室带到实际赛场,并使其真正投入使用。过去几年,人形机器人在运动任务上取得了显著进步。跑步、跳跃和跳舞等传统运动技能已经变得越来越稳健和可靠。因此,研究界开始关注一个更具挑战性的问题:人形机器人能否应对动态体育运动?我们目前在球类运动中看到了快速进展。在足球和篮球领域,人形机器人已经能够完成射门、守门和投篮等动态任务。这些任务通常只需与球进行一次短暂接触即可完成。最近,我们看到球拍类运动(racket sports)里也出现了一些令人印象深刻的演示,包括网球、乒乓球,当然还有羽毛球。更重要的是,这些系统已不再局限于孤立的演示:机器人开始和人对拉、相互竞技,甚至参加一些有组织的比赛。这一转变对我们来说尤为有趣,因为球拍类运动带来了截然不同的挑战。这种挑战既涉及控制,也涉及感知。首先,目标体积小得多,对精度的要求大约高出一个数量级。其次,这些都是以多回合对打为基础的运动。因此,机器人必须不仅要一次,还要反复、可靠地击中球。再次,机器人通过球拍与球体进行交互。因此,在关节处微小的误差会在球拍处被放大,再加上极高的球速,形成了一个非常狭窄的击球窗口。此外,触球、飞行动力学和旋转,让问题变得更加棘手。那么,为什么选择羽毛球呢?羽毛球在飞行中会承受极强的空气阻力,导致它的速度迅速且非线性地衰减,这让轨迹预测变得尤其困难。打羽毛球还需要频繁的加速与减速,既考验下肢的敏捷,也考验精准的挥拍时机。此外还有一个实际原因,中国有庞大的羽毛球爱好者群体。因此,对我们而言,人形机器人打羽毛球不仅是一个具有挑战性的研究课题,也是将人形机器人引入现实人类环境的充满前景的应用场景。正如今天演讲题目说的那样,我们的目标是让人形机器人从实验室走向真实的运动场。不仅限于羽毛球,还包括更广泛的体育场景。
02
小脑先练步法与挥拍
实际部署与实验室环境有着根本性的差异。机器人必须应对噪声、延迟、干扰以及分布外的输入,这对可靠性的要求大大提高。而且,进行体育运动只是系统的一部分,实际部署还要求具备导航、捡球、跌倒恢复以及长期稳定运行的能力。因此,这不仅仅是一个算法问题,还需要在实践中进行广泛的测试、系统集成和硬件迭代。最佳解决方案往往并非理论上的最优解,而是能在现实世界中可靠运行的方案。我想这也是具身智能之所以有趣的原因之一。
这张图给我们一个整体路线图的概览。今天,我们将从移动和发力开始,先让机器人移动到正确的位置,并在恰当的时机挥动球拍击球。随后,我们将转向机器人需要掌握的各种技能,以应对不同的球路、覆盖更广的场地范围,并控制羽毛球的落点。一旦掌握了这些基本技能,我们就可以开始思考战术了,不仅要考虑如何击球,还要考虑使用哪种击球方式以及将球打到什么位置。除了进行多拍对打,我们还希望机器人能够自主运作,例如,在球场内自主导航并捡拾羽毛球。最后,我们将所有内容整合起来,实现真实环境部署,届时整个系统需要在实验室之外可靠地运行。因此,本次演讲的其余部分将遵循这一路径:从控制到技能,再到策略,继而到自主性,最终实现真实环境部署。那么,让我们从移动和步法开始。在我们的早期研究中,我们通过一套退火式课程的全身控制训练方案解决了这一问题,从而在动作捕捉环境中首次实现了人形机器人打羽毛球的实地演示。羽毛球运动集中体现了人形机器人面临的诸多挑战。其中最关键的一点是,需要协同学习步法和击球动作。尤其是考虑到宽广的三维工作空间以及击打动作对全身稳定性的影响,这两个目标在优化过程中往往会相互冲突,我们通过退火式课程学习的训练方案解决了这一冲突。具体来说,在第一阶段,我们在训练中仅引入下肢移动项。随后,我们逐渐移除下肢移动奖励,并使击球奖励占据越来越主导的地位。通过这种设计,移动奖励可以在早期为稀疏击球目标提供引导,从而稳定早期的训练过程。与此同时,已习得的下肢动作和能力会被保留在策略中,即使在下肢移动奖励被移除后也是如此。因此最终形成了协调的全身动作。
右侧的视频记录了我们去年 11 月首次在实验室完成击球测试。在基础击球能力的基础上,我们进一步扩展了该系统,使其能够学习多种击球技巧并实现目标落点的精准控制。这使得机器人具备了多种击打方式,从而提升了回球的可靠性。我们的机器人单回合可以连续对拉 40 拍以上。与我们之前基于标准 PPO 且仅采用奖励设计的成果不同,我们收集了一组涵盖不同风格的参考动作,并采用多个判别器来分别捕捉这些风格。这种多判别器方法使策略能够习得多样化的击球技巧,同时允许在未来融入更多技巧。目前,我们使用了三个分别对应上手、下手正手和下手反手的判别器。为了实现精准的回球控制,我们引入了两项改进:目标回球控制和学习型技能选择器。首先,基于退火式课程设计,我们引入了回球奖励,在模型成功掌握击打动作后,进一步训练策略以控制落点。此外,我们还在策略观测中加入了目标区域的独热编码。这些修改综合起来,使得落点分布更加准确且集中,如图所示。
其次,我们训练了一个技能选择器。它实际上是一个已学习的状态—动作价值函数,即 Q 值函数。因此,对于每个来球轨迹,我们在模拟中评估了在相同击打条件下所有可用的技能,并记录了它们的任务效用。这里的任务效用定义为击中奖励与回球落点奖励的乘积。随后,我们训练该网络在不同击打条件下预测这些技能的任务效用,并执行任务效用最高的技能。通过这种方式,技能选择器能够利用所有技能的互补优势,为每种情况选择最合适的技能。正如这里的模拟对比所示,没有技能选择器的系统会导致回合过早结束。然而,配备技能选择器的系统则能继续对峙。
把上述方法结合在一起,我们取得了如下成果。据我们所知,我们的系统在腿式机器人羽毛球比赛中实现了最长的对峙回合。我花几分钟放一下视频,让大家更直观地了解系统表现。视频里,正在和机器人对打的这个人就是我。我们的机器人只有 1.35 米高,但它能覆盖 4.4×4.4 米的场地。技能选择器会替机器人选合适的技能——比如现在,因为我把球打到了那个区域,它就选了反手,因为在那个位置反手是最优解。和我们的 PHYBOT C2 对打真的非常有趣,但很遗憾,我们没法把机器人运到美国来,所以今天不能做现场演示。好,因为时间非常有限,我就先停在这里,继续往下讲。
03
大脑上场学会算球
人形机器人不应止步于娱乐性演示。下一步是让机器人具备竞争力,能够做出战略决策、适应不同的对手,并最终获胜。为此,我们将这一高层级问题表述为零和博弈,即零和多智能体强化学习问题。在此,主智能体持续针对一组历史对手进行训练,而优先采样虚拟自博弈(PFSP)则将训练重点放在当前策略仍难以战胜的对手身上。一旦胜率达到足够高的水平,我们会保存一个新的快照,并从该检查点继续训练。
高层策略会观察机器人状态、击球状态、对手状态以及之前的决策,并利用循环神经网络。在此,我们使用 GRU 输出两个离散决策。第一个是决定使用哪种击球方式,即击球技巧;第二个是决定将回球打向何处。这些决策随后被传递给固定的低层全身控制器,该控制器负责执行选定的击球方式和落点目标。因此,这里的职责划分非常明确。低层负责回答如何执行击球,而高层负责学习战术。然而,仅靠纯粹的自博弈是不够的,因为如果策略仅针对一组有限的对手,会陷入循环支配的困境。循环支配的一个简单例子就是“石头、剪刀、布”游戏,针对一种策略的改进可能会立即暴露对另一种策略的弱点。因此,我们采用不同角色的联盟训练。其中,主智能体(Main Agent)负责提升整体表现;主力陪练(Main Exploiter)主动寻找主智能体的弱点;联盟陪练(League Exploiter)则引入更多样化的联盟级策略。三者一起,源源不断地制造出强对手,从而暴露并修复策略层面的弱点。此处的图表显示,随着训练的进行,主智能体在面对历史上的强敌(尤其是陪练策略)时,表现逐渐提升。与此同时,训练中智能体不断暴露新的弱点,而训练重点始终放在那些仍难以战胜的对手上。因此,该智能体不仅是在提高整体胜率,还在学习如何弥补自身的弱点并利用对手的弱点。
目前,这些结果仍仅限于模拟环境。我们的下一步是在真实机器人上对这些结果进行验证。我们还希望通过这种竞争性训练过程,更好地理解这些高级策略是如何自我进化的。正如视频中所示,我们的智能体 12 的表现远胜于智能体 10(历史版本)。除了羽毛球之外,我们还测试了这些能力能够多快地迁移到其他球类运动中。利用前面提到的同一框架,我们仅用一周左右就成功将模型迁移到了乒乓球和足球领域。
这种快速迁移表明,许多核心能力——如全身协调、动态交互和任务层面的适应——并不局限于羽毛球,而可以在不同的体育任务中重复使用。打羽毛球只是向前推进这一通用能力的一部分。
04
从实验室到球场
机器人还需要具备一些辅助技能,例如自主拾取羽毛球。这是一个具有挑战性的全身移动操作问题,因为在任务执行过程中,机器人的视角和自身构型都在不断变化。为解决这一问题,我们提出并开发了 DQ-Flow,其核心思想是将运动生成与运动执行分离。DQ-Flow 决定执行何种运动,而全身控制器则负责如何可靠地执行该运动。从视频中可以看到,机器人即使存在一些干扰,它也能自主靠近并拾取羽毛球。图片是对整套系统的概览。
DQ-Flow 接收第一人称观测和机器人状态,生成一个全身运动参考。在训练期间,我们引入辅助的深度监督,帮助策略学到更好的几何表征。重要的是,这些深度信息在部署时是不需要的,它只是一个训练信号。生成的参考随后由我们的混合全身控制器来执行。右侧是我们使用的数据采集管线,用来采集演示并生成训练参考。现在我们更仔细地看一下 DQ-Flow 背后的关键思想。策略利用一段短时的 RGB 观测历史,再加上本体感知信息,通过 flow matching 生成全身运动参考。这里的核心做法,是在训练时引入深度查询,它们帮助动作表征从场景中学到几何信息,而动作策略本身并不依赖深度。所以在部署时,机器人只需要 RGB 图像和本体感知即可。随后,生成的运动将通过混合式接口交由全身控制器执行。下肢和躯干用强化学习控制器来跟踪,这些部位对平衡和鲁棒性要求更高;而上肢和夹爪则直接跟踪生成的目标,以实现精准操作。重要的是,演示数据和 DQ-Flow 使用的是同一套参考表征。这给了我们一个统一的接口,把数据采集、策略学习和全身执行连接在了一起。最后一点,是 DQ-Flow 如何与低层控制器实时协同工作。这两个模块是异步运行的:当机器人正在执行当前动作时,新的参考通过一个时间对齐的交接平滑地对齐到当前执行上。这样机器人就能持续移动,而不必停下来等上层策略推理。简而言之,策略生成未来动作,而控制器则确保机器人持续移动。最后,这是在真实机器人上运行的完整系统,仅利用安装在头上的摄像头,机器人便能自主靠近羽毛球、拾取、运输并将其放入目标箱中。
在整个任务中,DQ-Flow 生成运动参考,混合接口全身控制器实时执行它,从视觉到运动生成,再到真机上的全身执行,这就是我们的完整链路。我们还利用常规的策略蒸馏方法,探索了自主捡球的另一种实现路径。首先,我们在模拟环境中利用羽毛球位置的特权信息训练一个教师策略,然后通过退火 DAgger 让学生策略只用安装在夹爪上方的摄像头采集的 RGB 观测数据,去克隆教师的行为。学生策略直接输出全身关节目标,完成下蹲、抓取、最后把球提起的整套动作。最终,我们将该系统带出了实验室,并部署在真实的公共环境中。这些照片来自我们的羽毛球快闪场馆,在一家商场里,机器人与不同的人直接互动。
对我们来说,这是整个项目里非常重要的一部分,因为真实部署会暴露大量在实验室里难以复现的问题,包括通信、感知、噪声、形形色色的用户,以及长期的系统可靠性。这才是我们所说的把机器人从实验室带进球场的真正含义。
05
五条要点
最后,让我总结几点要点。第一,人类先验仍然非常重要。一味的扩大数据规模是不够的,如何有效地利用这些先验,仍然是一个开放的问题。第二,人类先验提供的是基础,而竞争驱动的是进一步的提升。就像学羽毛球,看教练示范当然有帮助,但真正的进步来自实战,尤其是和强对手交手。第三,仅靠仿真已经不够了,我们需要更广泛的方法,可以是更好的系统辨识,可以是世界模型,甚至可以是真实世界的强化学习。第四,工程和算法创新同样重要。对于同一个策略,更好的微调、更低的延迟、更好的控制、更好的硬件,都可能带来巨大的差异。最后,运动智能是一个系统级的问题。把机器人从实验室带到球场,需要策略、自主性、可靠性,以及真实世界的运行能力。我想,今天要讲的都在这里了。谢谢大家。
06
现场问答
▎Q:在刚才的视频里,和羽毛球机器人对打时,它用的是外部感知吗?一共用了多少个摄像头?球速有多快?
是的,用的是动捕系统,一共 8 个摄像头。至于球速,快球(比如杀球)能达到每秒 20 米以上。▎Q:你提到技能选择器会观测球的状态,还提到了对手状态,这个对手状态具体是什么?
技能选择器里其实没有对手这个概念,我们训练它只是为了给来球落点区域选出最合适的技能。至于对手状态,是在后面那套高层多智能体强化学习里出现的.仿真环境里有对手,对手状态包括对手的位置、线速度和角速度,这样它就知道对手在哪里。这些也是通过动捕来估计的。▎Q:真实世界里有空气阻力这样的空气动力学效应,你们在仿真器里也模拟了吗?
是的,我们模拟了空气动力学。▎Q:从仿真到真实世界,你们做的是零样本迁移,还是用了其他方法?
是零样本迁移,主要通过域随机化和加噪声来实现,没什么特别花哨的东西。▎Q:如果想让机器人更快、更有竞争力,尤其是面对羽毛球里的杀球,你会怎么做?
我认为目前的主要限制在硬件——关节力矩和关节峰值速度。我们可以通过改进、迭代硬件来做得更好。摄像头不是瓶颈,因为动捕系统可以做到 200 赫兹以上。▎Q:实际实时运行时,你们用的是动捕,还是端侧相机?
目前用的是动捕。会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 探讨,错过也能追;
成为付费用户可以阅读 动易科技 所有资料
了解更多 →阅读原文 ↗雷峰网