光合及目
1lux.xyz
← 报道
创始人访谈qimingvc· 2025-08-11

对话

对话 | 启明创投周志峰对话它石智航陈亦伦、原力灵机唐文斌:关于具身智能的宏观共识与微观非共识 | 启明创投

-->

EN

团队

投资企业

启明动态

新闻

关于

-->

启明新闻

--><br/> <br/>对话 | 启明创投周志峰对话它石智航陈亦伦、原力灵机唐文斌:关于具身智能的宏观共识与微观非共识

2025/08/11<br/> <br/> | <br/> IPO早知道

由启明创投主办的2025世界人工智能大会(WAIC)“启明创投·创业与投资论坛——创业投资开启AI技术与应用共振周期”于7月28日在上海世博中心蓝厅成功举办。

在对话环节中,<br/>启明创投主管合伙人周志峰担任主持人,与它石智航创始人兼首席执行官陈亦伦,以及原力灵机联合创始人兼首席执行官、旷视科技联合创始人唐文斌围绕“具身智能的奇点时刻”展开讨论。

启明创投主管合伙人周志峰(左),它石智航创始人兼首席执行官陈亦伦(中)和原力灵机联合创始人兼首席执行官、旷视科技联合创始人唐文斌(右)

陈亦伦表示:“具身智能是当下AI市场最火爆的子领域,具身技术正以指数级速度进步发展,我们已经站在奇点到来的早期窗口。”<br/>他指出目前具身智能技术有四大趋势:机器人本体控制技术逐渐成熟、端到端技术正从自动驾驶领域扩展到机器人、数据不断积累即将发挥Scaling Law、高自由度灵巧手方案已经出现。同时他认为具身智能和自动驾驶在任务场景和底层技术上同宗同源,模型技术可以复用,工程能力可以迁移,自动驾驶行业的经验与认知也能帮助具身智能领域的探索与落地。<br/>最后在赛道选择上,它石智航遵循高价值、有规模、有难度的“黄金三角”逻辑,会选择用户非常在意的真实需求、存在较大市场空间且上一代机器人技术难以解决的问题,最终实现通用机器人的AGI终极目标。

唐文斌围绕具身智能领域的技术发展、创业逻辑及场景落地等话题分享了核心观点,展现了对具身智能这一新兴赛道的深刻洞察。<br/>他强调其创业的初心一直是机器人,从早前以物流机器人切入,到现在投身具身智能,最大的信心还是来自于对技术的深刻信仰,尤其是大模型、CoT和Agent能力的显著进步。<br/>唐文斌认为机器人从专用走向通用有两个必要条件,一个是对物理世界的精确感知能力,一个是对复杂任务的规划和推理能力。唐文斌指出,最终机器人能不能用得起来其实核心看两点,能用、好用是第一点,因为要真正能解决问题;第二点是它的经济模型得成立,这两点大概率还是会从后端开始,再走向一些偏商用,最后走向民用的状态。

以下系对话精选:

01/

具身智能技术发展得越来越快

周志峰:

感谢亦伦和文斌来参加这个论坛。我还记得2015年启明创投在投优必选的时候,市场上没有太多投资人关注人形机器人、工业机器臂以外的泛机器人行业。我记得有一个机器人创始人群,很长时间内群里就几十位极客。但从两年前开始,我们统计中国出现了100多家做具身智能和通用人形机器人的企业。我们论坛讨论的AI这么多细分领域中,从创业公司的数量来讲,热度没有比具身智能领域更热的,所以今天大家肯定很关注这个对话。

请先简单介绍一下自己和公司。

陈亦伦:<br/>各位来宾好,我是陈亦伦,我是它石智航的创始人。在过去的十年我和团队比较幸运的是能够参与一些比较领先的自动驾驶核心技术的开发,作为一个具身智能的子命题,<br/>我们经历了10年完整的过程,从最开始的实验室原理样机,到现在来说,我身边很多朋友也能够在日常生活中体验到我们的产品,并且它每天在改善每个人的出行体验。

在未来十年,我们希望能够打造更加通用的机器人形态,以及更加强大的物理世界的AI,能够加速这些技术更快、规模化地融入到人的生产和生活之中,我们希望具身智能技术能够成为未来十年产业升级的一个重要引擎,<br/>谢谢。

唐文斌:<br/>大家好,我是唐文斌,我创业的第一家公司是旷视科技,今天我代表的是原力灵机,原力灵机是一家比较新的公司,专注具身智能领域的研发和落地。

我们做机器人的时间已经很长了,从旷视科技成立的第一天,我就想说先给机器人安上一双眼睛,让它能够看到世界,<br/>但我们创业的初心其实一直是要做机器人。<br/>旷视科技最早从物流场景切入,第一次做了机器人的尝试。像亦伦师兄一样,我们今年看到了很多的技术变量,有可能能够从专用的机器人走向通用的机器人,<br/>我们希望能够真正用大模型、机器人的能力,为物理世界带来终极AI的形态,这是我们现在在努力做的事情。

周志峰:

第一个问题,作为这个行业中的领军人物,您二位看到具身智能、人形机器人、通用机器人在过去一年有哪些大的变化、大的进展?可以和大家分享一下,对这个领域的发展更有信心了吗?

陈亦伦:<br/>我个人对这个领域一直非常有信心,我觉得大家可以在每年的WAIC上看到,过去这两年整个具身智能或者机器人的技术前进的速度已经超过了此前累积下来的前进速度,这还是非常能够振奋人心的,作为从业者,我们自己预判之后它的发展速度会越来越快。

现在,在一年之前整个WAIC的各个机器人展都以静态展示为主,现在在机器人的全身域控制上,locomotion和WBC上,这个领域我认为已经接近于收敛的形态了。另外一个重要的AI,比如说端到端,我认为可能在一两年前,学术界会有一个比较强烈的信心,但工业界的人还是有疑虑的,但至少现在,<br/>在机器人的移动领域,可能在它最大的场景自动驾驶领域上已经充分产品化了,而且大家可以在日常生活中体验它的能力。<br/>在操作领域,其实大家在实验室级别的产品样机上已经看到巨大的飞升潜力。

第三个,我觉得非常重要的一件事情是<br/>多模态的大模型,它的整个基础能力一直在显著提升,<br/>而且不同于纯语言模态的大模型,多模态包括视觉、语言形式,整个数据的Scaling Law还是没有见顶,还是有巨大的提升空间,这几个因素综合下来,我觉得在具身智能AI领域,这几年会处在一个越跑越快的时间。

同时硬件技术也在高速成熟,<br/>我们看到一些非常高自由度的终端形态,比如灵巧手,一些接近于量产形态的方案已经开始出现,这些飞速发展都是比较振奋人心的。

唐文斌:<br/>我觉得本质来讲,<br/>最大的信心其实是来自于大模型上CoT和Agent的能力达到了一定的临界值。我认为机器人真正走向通用有两个必要条件:

第一个是对物理世界的精确感知能力,<br/>这其实也是旷视科技在过去很多年一直在做的事情,我们也看到不管是从小模型还是到大模型,其实整个多模态的感知能力是在不断加强的,而且现在已经可以做得非常好了;<br/>第二个是复杂的规划和推理能力。

只有这两件事情结合起来,机器人才能够走向一个通用的状态,而我们今天看到Agent的发展、CoT的发展,其实都给我们带来非常多的惊喜,所以我觉得这两点结合起来,从技术判断上,我们觉得这其实是在非常快速地朝着可行的方向发展。

02/

宏观逐渐形成共识

微观仍显多元化

周志峰:

非常好,关于技术这块刚才也提到很多,我想多聊两句。

我记得2014年、2015年投资旷视科技的时候,启明创投有自己的投资思考和逻辑。当时我们认为2012年ImageNet其实是深度学习的一个转折点或者是一个技术的突破点,因为那之后基本上技术开始收敛,全行业最优秀、最出色的人都向着一个大方向去奋斗,所以我们认为可以布局旷视科技这样的深度学习技术驱动的企业。

我们在2022年投资智谱AI,后来投资阶跃星辰,也是认为2020年的GPT-3是大模型技术的突破点,那之后技术相对收敛,大家都朝着共同的方向努力,肯定能够看到很好的结果。

在投资它石智航和原力灵机的时候,我们内部一直有很多争论,具身智能的技术到底有没有收敛?还是依然处于百花齐放?如果百花齐放的话,投资人的风险是很大的,今天投资的公司,有可能

队很优秀,但是三年后技术没有收敛到这家公司所在的方向上,那是不是一个很大的风险?我们聊聊,到底具身智能技术有没有收敛?以前大模型技术发展受限于数据、算力,现在具身智能这个领域,有没有一些大的瓶颈阻碍技术更快速往前走?

唐文斌:<br/>我的判断是技术并没有收敛,<br/>因为今天不管是从算法的框架上,还是从数据的来源上,还是从硬件的形态和稳定性上,以及最后场景落地的先后顺序,每一个问题仍是开放问题。

目前大家普遍认为技术逐渐收敛,应该走端到端、纯数据驱动这条路线,用类似于VLA的技术框架,这是逐渐形成的共识,<br/>并且我觉得大家对于未来的技术发展也有一些共识。

比方说多模态,大家今天都会觉得光靠视觉引导很难走向智能,因为人在物理世界的时候,不仅是通过眼睛去感知物理世界,还通过触觉,看不到的东西还会通过脑袋探一探,比如说能不能学习自动驾驶,如何能够直接把有深度的信息用在VLA里面,这一系列的多模态数据如何灌入大模型?我觉得在逐渐形成共识。

但这个模型架构长什么样子?其实现在并不知道。

我们现在其实还在探索的一些技术方向,包括今天的VLA大部分是单帧模型,如果用VLA去驱动机器人炒菜,让它放三勺盐,它其实放不了三勺盐,因为它放完第一勺盐以后很快就不记得有没有放过盐了,从视觉的角度来讲,放过盐和没放过盐的状态是一样的。由于这个模型现在并没有memory(记忆)的机制,当然我们也可以在外部做一个规则引导的机制,但是如何让模型具备原生的记忆机制?我认为也是一个非常重要的问题。

第三,我们内部在研究的问题是,今天很多公司,比如从Figure开始,大家都在提大小脑模型,但我认为大小脑模型并不是一个终极的状态。

大小脑模型其实是人为按照频率把模型做了切分,因为大脑区在思考,小脑区做执行,它输出的频率不一样,所以我们人为切成两个模型。

但这样的人为切分是一个好的方式吗?它智能吗?其实不智能,因为人操作的时候会想一想再做,做完之后这个状态发生改变了,我再想一想。<br/>所以机器人怎么才能像人一样形成一个动态的、柔性的思考和决策链?它其实可能还是基于一个模型,然后变成一种动态频率和柔性频率对模型的输出,这可能又是一个开放性的问题。

那么回答刚才的问题,我认为今天的模型框架远没有收敛,有非常多的问题等待我们解决,但正是因为这些开放性的问题,我认为这件事情才让我们对未来充满激情和想象力。

周志峰:

印奇(编者注:千里科技董事长)说,2011年创立旷视科技的时候是学生创业,当时是大学生创业的热潮,讲得最多的一句话是“先跳下悬崖,然后在坠落过程中组装飞机式的创业”。但今天的总结是,如果没有先想清楚一个完整的技

成为付费用户可以阅读 它石智航 所有资料

了解更多 →