2026年,产业投资进入深水区,资本、技术与产业加速融合,旧的投资逻辑不再使用,新的共识正在诞生。2026产业未来大会聚焦新周期机遇,共探产业未来与“中国之光”的诞生。 9月9日至10日,由36氪主办的2026产业未来大会以“深水之上,共振新生”为主题的在北京亦庄举行。来自国资平台、产业投资基金、企业CVC、创新企业及专家学者走到一起,聚焦量子科技等未来产业走向产业化。大会深度探讨当下前沿技术与产业视角,集中展示超导、光量子、离子阱等技术路线突破,分享大量具体产业场景、产业体系搭建、与异构计算前景。共同探讨科技产业投资的未来。
以下对话,经36氪整理编辑:
金涛 | 高鹄资本 合伙人(主持)
赵优 | 新石器无人车 执行总裁
林天威 | 墨奇智能 算法科学家
金涛:大家好!我是高鹄资本合伙人金涛,高鹄是一家专注于新经济领域的精品投行。过去一年多,我们在AI、具身智能、前沿科技领域完成了80多亿美元的融资项目, 其中包括 _MiniMax_、苏度科技、新石器无人车、墨奇智能、天机智能、沃兰特、不筹量子、逆矩阵科技等优秀企业。今天到场的两位嘉宾——新石器无人车执行总裁赵优、墨奇智能算法科学家林天威,也都来自高鹄长期深度服务的伙伴企业。
去年在36氪大会上,我也曾与赵优(Will)讨论自动驾驶的商业化落地。当时,新石器刚刚迈过万台规模门槛;时隔一年,其无人车运营规模已经超过2万台,并仍在持续增长。对AI如何真正进入真实世界而言,这是一个很有代表性的产业样本。
天威目前担任墨奇智能算法科学家,此前是地平线端到端预研及具身操作负责人,曾领导地平线首版端到端实车方案研发,如今继续聚焦具身操作与机器人智能。
很有意思的是,两位都与汽车和自动驾驶有很深的渊源,如今又分别站在AI进入真实世界的不同位置:一位已经将自动驾驶推向数万台规模的真实运营,一位从端到端自动驾驶走向具身操作。借这个机会,我们想讨论一个更具体的问题:当AI离开屏幕,进入道路、工厂、酒店、家庭等复杂的物理世界,我们需要的究竟只是更强的模型,还是一整套系统能力?
第一个问题想请教两位。自动驾驶可以说是AI进入物理世界最早、规模最大、投入最高的长期实验之一。回看过去十年的发展,它给今天这一轮Physical AI和具身智能带来了哪些最重要的启示?
赵优:非常同意!自动驾驶确实是AI进入物理世界规模最大、投入最高的一场实验,创业公司和投资机构都投入了大量资金。结合我们的实践,有几点体会:
1、AI进入物理世界后,第一个限制来自本体。它面对的并不是无限算力,而是需要让参数规模受限的模型真正部署到车端运行。本体本身又受客户成本和产品需求约束。归根结底,企业必须真正理解客户和运营,定义好本体,并在此基础上形成数据飞轮,才能让系统持续运行和迭代。这是我们多年实践形成的一个底层认知,也可以说已经逐渐成为行业共识。
林天威:从物理AI角度看,智驾和具身有很强的相似性。回顾过去10年的智驾发展,对具身智能有一个重要启示:评价效果不能只看某个场景中的最优表现,更应长期关注系统在通用场景下持续运行的稳定性以及处理常规问题的能力。
早在10年前,我们就能看到一些Demo车辆,例如在北美完成无人直行、转弯和特定路线行驶。但直到最近一两年,才逐渐看到车辆能够在真正无人状态下实现几十万小时级别的无接管驾驶。这个过程更多是在解决最后1%的问题。让车辆具备基本驾驶能力并不难,难的是长期、稳定地持续运行,以及建立数据飞轮并解决异常情况下的闭环问题。
相比大家经常讨论的模型架构变化,这更像是一项长期的闭环工程,可能没有那么吸引眼球,但真正要走到规模化应用,这又是不可或缺的一环。
从智驾对具身智能的启示来看,更需要关注最终的评价指标和实际效果,例如长期稳定性。智驾会关注接管率,具身智能未来也可能形成类似指标,比如能够完成哪些任务、能够持续多长时间无需人工介入等。在此基础上,才进一步讨论具体模型方案。
智驾经历了从传统规则、分模块AI到端到端模型的演进,未来还可能出现新的技术范式。从最终需要闭环的指标和验收方式来看,底层逻辑并没有变化,更重要的是从一开始就明确测评标准是什么。
林天威:我非常认同从规则到模型演进的方向。真正进入海量数据阶段以后,最近几年可以非常明显地看到能力涌现,也能够看到scaling law在真实场景中发挥作用,这是让我们非常兴奋的一件事。
在大模型和自动驾驶快速发展之前,大家对这件事还没有那么强的信心;现在已经明显看到了规模化数据和模型带来的效果,我认为这对未来AI进入物理世界具有很强的借鉴意义。
金涛:我再请教一下Will。去年新石器刚迈过万台规模,如今已经超过2万台。随着运营规模不断扩大,你们有哪些新的体会和发现?
赵优:我觉得有几个不一样的点。
第一,在千台规模时,研发投入占比显得很高,摊到每台出货量上,单台成本也很高,因此公司在研发管理上非常关注ROI,并尽量控制总体投入。当规模达到数万台以后,我们反而发现,研发投入已经不是成本的大头,日常每台车的运维、耗电、车辆折旧,以及算法导致的接管、维修等成本开始更加突出。这些成本会反过来影响研发方向,使研发更多聚焦于降低单台运营成本。这是量产和商业化之后非常明显的变化。
第二,与此相关,在千台规模时我们更看重研发能力;到了更大规模,组织能力会成为更大的挑战。车队或本体规模扩大后,相应人员数量增加,随之带来管理和协同问题。公司的能力建设,也会从单纯研发问题进一步变成组织问题。这是从研发走向量产过程中一个非常明显的变化。
最后,从千台到万台,对泛化能力提出了更高要求。进入的城市和场景越来越多,长尾问题逐渐从偶发情况变成日常问题。
因此,对数据飞轮和模型能力的要求也越来越高,这是我们过去一年体会非常深的一点。
金涛:天威,你此前在地平线负责端到端预研及具身操作,也领导过首版端到端实车方案研发。自动驾驶过去十年已经形成了相对成熟的技术闭环和验证体系。当这些经验迁移到具身智能时,哪些可以复用,哪些又存在本质差异?
林天威:首先,智驾和具身智能是差异很大的两件事。自动驾驶面对的硬件相对成熟,包括车辆本身、车上传感器的安装方式等,目前都已经形成较稳定的形态;而具身智能的硬件形态仍处在相对不收敛的阶段。
其次,在任务定义上也有显著差异。自动驾驶相对规范,任务目标很明确:在道路网络中,与其他交通参与者共同运行,并安全抵达目的地。任务本身相对收敛,而且核心原则之一是避免与其他物体发生碰撞,安全性优先。
具身智能在这两点上恰好相反。我们希望具身智能能够解决通用任务,而这类任务的潜在范围非常大,很难像智驾那样用高度结构化的方式定义。例如智驾中可以区分静态任务、动态任务,但在具身智能里,很难用同样方式完成通用性定义。
另外,具身智能具有强物理接触特征。我们需要操作物体,而不是规避物体。操作过程中会遇到大量与物理属性相关的问题,例如流体、柔性物体等,差异都会非常明显。
比如两件衣服看起来可能一样,但由于表面光滑程度或重量不同,如果策略缺乏足够的适应能力,换一个物体就可能无法完成任务。我认为这是两类系统非常重要的差异。
金涛:天威,最近墨奇发布了MORPHI KINO和MoRA等成果,一个重要变化是机器人正在从完成单一原子动作,走向更复杂的长程任务。但从“能够完成长程任务”到“真正可用、能够持续完成真实工作”,中间还需要跨过哪些关键门槛?
林天威:单点任务和长程任务有显著不同。以叠衣服这类单一任务为例,更多会通过模仿学习把任务流程学习下来,让模型知道在不同任务阶段应该执行什么动作。
但这种方式会伴随很多问题。有些情况下模型并不知道任务是否已经完成,因为它只是在模仿动作,并不具备对任务完成状态的判断能力。
如果模型只是针对单点任务进行拟合,对任务指令的遵循能力可能不足,也可能出现过拟合。长程任务通常会采用agent架构,相当于由一个System 2层的“大脑”把模糊指令拆解成更具体的任务指令。
随后,再由System 1层的具身模型负责动作执行。现在的主要卡点反而不在“大脑”的任务拆解,而在执行层:模型对指令的遵循能力和泛化能力仍不够好。
举个例子,一些模型训练过抓苹果,换一个场景去抓其他水果时就未必能够成功,这说明泛化能力仍然不足。如果System 1的动作模型无法稳定遵循指令,大脑也就难以有效调度。因此,第一个最大挑战,是让System 1的Action模型在指令泛化、物体泛化和指令遵循等方面进一步提升。
另外,长程任务由多个子任务串联组成,因此需要持续监控每个任务的进展,包括是否完成、是否发生错误等。在此基础上,再搭建harness agent相关模块,根据执行和调度情况进行反馈与调整。
例如出现错误时,单点模型失败后任务可能就直接终止;但长程任务一定会遇到中间环节失败的情况。一个任务如果有十个环节,不可能每个环节成功率都达到100%,因此系统必须能够在出现失败时调整策略、重新规划指令并继续完成任务。这也是我们后续重点研究的方向之一。
金涛:Will,新石器已经从技术验证走到数万台规模的真实运营。每天需要完成大量真实任务之后,评价系统的标准也从“能不能跑”进一步转向可靠性、安全性和运营效率。这些要求又是如何反过来影响你们的技术路线和系统架构的?
赵优:我们也发现,技术架构与早期相比出现了明显变化。可靠性在自动驾驶中直接关系安全,因此在端侧是第一优先指标。端侧算法必须首先保证智驾表现的安全性,但物流自动驾驶会遇到大量corner case。
像天威刚才说的,道路行驶这一段相对标准化,规则也更明确;但对物流而言,两端场景更加复杂,可能需要进入小区、批发市场、仓库、工厂等大量非标准末端场景。在这些场景中,车辆速度较低,安全风险形态会发生变化,但环境复杂度更高,对智能能力的要求也更高,有时甚至超过端侧算力能够独立处理的范围。
因此,我们在端侧之外增加了云端模型,由云端模型与端侧模型共同处理更复杂的场景;同时还有远程接管人员作为第三层保障。这样一套偏运营导向的技术架构,支撑当前万台级规模,并为未来数十万台车辆在全国乃至全球运行做准备。
简单来说,可靠性和安全性是最重要的,因此关键能力必须部署在端侧,以低延迟方式保障安全可靠。面对更复杂的场景,则通过云端和远程支持进一步提升系统表现。
金涛:过去我们习惯的路径是技术先成熟,再落地商业化;但今天很多科技领域,技术与落地往往是在共同演进中推动产业发展。
想请教两位,在各自方向上,你们如何实现技术与场景的共同演进?
林天威:我认为,具身智能的技术发展和场景进入不能相互独立。很难先用两年时间把技术打磨成熟,再去寻找场景,这并不是理想路径。具身智能的特点在于,如果不进入真实场景,甚至可能不知道真正需要完成哪些任务。比如我们现在进入酒店场景,会发现很多真实需求。以擦桌子为例,在实验室里可能只是简单擦拭,但酒店保洁人员有一套明确的流程和标准。
进入场景后,一方面可以明确这些任务的SOP究竟是什么、需要达到什么标准;另一方面,可以在真实场景中采集数据、形成闭环,更直接地迭代模型效果。
长期来看,这类真实场景也能够帮助我们提升模型对复杂环境的泛化能力。比如,如果最终希望在家庭场景中取得良好效果,酒店可以作为较好的中间验证场景:空间布置与家庭有一定相似性,但商业上更容易进入。直接进入家庭还会涉及隐私、管理等问题,因此我们会先在酒店场景中完成闭环并持续打磨整体方案。
赵优:在技术与场景结合方面,新石器比较特殊。我们从一开始就扎根物流,并选择物流作为核心场景。这里有两点体会。
成为付费用户可以阅读 理想汽车 所有资料
了解更多 →