光合及目
1lux.xyz
← 报道
行业报道创业邦· 2026-10-08

三位科研创业者对话:机器人走出实验室,真实场景才是下一道门槛

随着大模型不断进化,具身智能真正的难点,不再只是让机器人“看懂”世界,而是让它真正“进入”世界。 当机械手抓起杯子、拧动螺丝,或在超市里给顾客递上一份试吃时,视觉和语言只是第一步。机器人还需要理解接触、力、形变,需要面对实验室里从未出现过的细碎问题,也需要在真实场景中不断获得数据、修正能力。 因此,一条更加务实的路线正在出现:不必等待一个足够强大的“通用机器

随着大模型不断进化,具身智能真正的难点,不再只是让机器人“看懂”世界,而是让它真正“进入”世界。

当机械手抓起杯子、拧动螺丝,或在超市里给顾客递上一份试吃时,视觉和语言只是第一步。机器人还需要理解接触、力、形变,需要面对实验室里从未出现过的细碎问题,也需要在真实场景中不断获得数据、修正能力。

因此,一条更加务实的路线正在出现:不必等待一个足够强大的“通用机器人”在实验室中突然涌现,而是先让机器人进入超市、工厂等现实场景,通过触觉、人机共驾、真人与真机数据一步步提升操作能力。

在2026(第二十届)DEMO CHINA现场,戴盟机器人联合创始人兼首席科学家王煜、灵御智能联合创始人兼首席科学家莫一林、OriginFlow创始人兼CEO秦深涛围绕具身智能如何从科研走向现实展开讨论。对话由慧言未来创始人、清华大学外聘教师刘慧凝主持。

以下是他们在2026(第二十届)DEMO CHINA上的对话实录,由创业邦整理。

图片

迈出实验室:从科学家到创业者

刘慧凝:三位都是从科研走向创业,什么促使你们迈出从实验室到真实场景的第一步?

王煜:机器人本身就是一个应用学科。我们做机器人科研,目标一直很明确,就是让机器人真正能够做事情。

我40多年前开始研究机器人操作。机械手要把螺丝拧进去、把一个物体放到指定位置,背后都涉及手和物体之间的力学关系。很早我们就意识到,如果不了解接触力,很多操作根本无法完成,因此机器人需要触觉,也需要理解力的信息。

到2023年,我们觉得应该把这些技术真正带到市场上。一方面接受市场检验,另一方面也从真实场景中获得反馈,缩短从科研突破到创造实际价值的距离,让研究更直接地转化为生产力。

莫一林:我的路径没有王老师这么直接。

我最开始做控制,比较偏理论和数学,后来逐渐接触自动驾驶和机器人。真正让我觉得具身智能值得做,是2024年和一家做灵巧手的公司合作。当机械团队需要算法能力时,我开始看到机器人背后巨大的可能性。所以到2025年年初,我们创立了灵御智能。

秦深涛:我看到两个信号。

第一个来自人机交互。人与人交流主要依赖语音、视觉,但人真正操作物体时,还有大量信息没有被数字化。

第二个来自物理AI。文字、图像、音频和视频之所以能够推动大模型发展,是因为过去20年互联网和移动互联网积累了海量数据。但进入物理世界以后,触觉、力以及人体如何发力等信息,还缺少能够在自然操作场景中持续、规模化积累的数据基础设施。

我们觉得这会成为物理AI的重要基础设施,所以创立OriginFlow,希望用无感、非侵入的方式,把这些过去缺失的数据采集下来。

机器人不必等到“涌现”,可以先去超市干活

刘慧凝:现在很多机器人公司希望模型足够强之后,再进入真实场景。灵御为什么选择更早落地?

莫一林:我们并不认为一定要等到具身智能出现类似大模型“涌现”的时刻,才能进入现实世界。

我们提出的是类似自动驾驶L2的人机共驾模式。机器人自己能解决大部分问题,遇到困难时,人再远程介入。

现在我们的机器人已经进入一些超市场景,比如做试吃,把饮料或者食品倒进小纸杯递给顾客,也做过捞螃蟹、调饮料等任务。

如果允许背后有一个人介入,目前机器人已经能够在很多场景中,以人的百分之七八十效率完成百分之七八十的工作。

很多人会问:原来一个人干活,现在变成“一个人+一个机器人”,意义在哪里?

第一,人和现场可以解耦。比如行动不便的人可以远程操作机器人,危险场景也能够把人和环境隔离开。

第二,一个人未来可以管理多台机器人。机器人并不是时时刻刻都需要人工介入,随着自主能力提高,人机比可以从1:1变成1:2,甚至1:5。

第三,在服务场景中,机器人本身还有情绪价值。我们在超市做试吃时,消费者会因为新鲜感主动靠近,实际参与率会明显提升。

更重要的是,真实场景本身就在生产数据。

比如一个小朋友伸手拿东西,机器人又把手缩回去,跟他互动。这些人机交互数据在实验室里非常难采,但机器人在真实场景运行时,它自然就产生了。

所以我们不认为一定要先在实验室造出一个“终结者”,再把它放进超市。现在的技术已经能够做很多事情,可以在落地过程中逐步走向更高级的具身智能。

机器人的“眼睛”越来越好,但真正困难的是“手”

刘慧凝:王老师长期研究触觉。为什么视觉已经这么强了,机器人仍然需要触觉?

王煜:如果只是让机器人看见世界,视频和视觉数据非常重要。但机器人真正进行操作时,就不能忽略机械手和物体接触时发生的物理现象。力、位移、形变,这些信息单靠视频是不够的。

过去一年多,行业才越来越认识到触觉数据的重要性。语言和图像可以把机器人的能力提高到一定程度,但如果希望它像人一样真正完成复杂操作,就需要知道手指接触了什么、用了多大的力、物体发生了什么变化。

所以视触觉传感器只是第一步。接下来还要获得大量真人、真机操作数据,再训练真正面向操作的模型。

对机器人来说,最终真正有价值的能力不是“看懂”,而是“做出来”。

刘慧凝:秦总采集的则是更难看见的信息。

秦深涛:对。我们希望捕获的是动作发生之前或者同时产生的人体信号。

人在操作物体时,肌肉活动会产生微弱的电信号。我们通过非侵入式方式采集表面肌电,结合视觉和运动信息,尝试在特定任务和标定条件下,通过模型估计手部姿态、力和接触状态,补充视觉难以直接获得的信息。

具身智能行业的什么被高估了?

刘慧凝:现在具身智能领域大家关注模型、算法、硬件、融资和团队。哪些东西可能被高估了,什么才是真正的护城河?

莫一林:如果说得直接一点,我觉得现在“模型”有一点被高估了。

2023年以来出现了很多具身智能模型公司,但直到今天仍然不断有新的模型公司成立、融资。这恰恰说明前面的企业还没有建立足够高的护城河。

相比之下,我觉得“身”的部分被低估了。

机器人真正进入现实场景以后,会遇到大量实验室里根本想象不到的问题。比如我们到了超市才发现,机器人喇叭功率不够,周围顾客根本听不见它讲话。

类似这样的细碎问题非常多,而且不是单纯靠融资就能够快速解决的。你必须一个个场景去跑,一个个坑去踩。

所以目前来看,我觉得“身”的部分比“智能”更有门槛。

王煜:对戴盟来说,最困难同时也最有价值的,始终是机器人的操作能力。

从触觉传感器,到获取包含力和触觉信息的大量真人、真机数据,再到训练真正能够落地执行任务的操作模型,这是一整条链路。

机器人最终还是要学习人。因为到今天为止,真正能够完成复杂操作的还是人。我们需要观察人是怎么做的,把这些信息记录下来,再用模型学习。

我认为这条路一定能够打通,这也是戴盟希望建立的护城河。

秦深涛:我创业这一年最大的感受是,真正的壁垒首先是系统工程能力,最终还是经济效率。

数据不是采得越多越好。即使积累了上百万小时的数据,如果场景覆盖不足、内容高度重复,也未必能带来相应的模型收益,最后真正有价值的可能只有很小一部分。

所以关键是:能不能用更低的成本获得更多样、更高质量的数据;能不能判断新增数据到底有没有价值;最后这些数据进入模型之后,能不能真正提高机器人在真实场景里的成功率。

如果整个链路的经济效率跑不通,再漂亮的数据规模也没有意义。

从触觉、人体信号,到人机共驾和真实场景数据,三位嘉宾选择的技术路径并不相同,但最终都指向同一个问题:具身智能真正的考验,不只是让模型变得更聪明,而是让智能进入一具能够感知、接触、行动,并接受真实世界检验的“身体”。

而从实验室走到超市、工厂和千千万万个真实场景,或许正是具身智能从“科研”走向“现实”最关键的一步。我们希望把人类自然操作中的多模态信息,组织成可用于机器人训练和评测的数据。

关于2026(第二十届)DEMO CHINA:

9月22-24日,2026(第二十届)DEMO CHINA在杭州举行。本届活动以“From Research to Reality|从科研到现实”为主题,汇聚近百家创新科技公司、200+一线VC、CVC及全球知名跨国企业代表,通过创新市集、播客Live、Final Pitch终极展示等环节,聚焦人工智能、硬科技、医疗与生物科技等前沿领域,推动科技成果从科研走向产品、市场与产业。

二十年来,DEMO CHINA累计吸引4.9万家创业企业报名、1720家企业现场展示,其中327家企业参加活动后进入下一轮融资,37家企业成功上市。