光合及目
1lux.xyz
← 报道
行业报道与非网· 2026-09-29

数采中心,会变成远程作业中心——清科灵境潘余曦

在清科灵境CTO潘余曦博士的《面向科学场景的自进化具身智能》主题演讲中,他没有大谈特谈具身智能、通用人工智能的未来畅想,而强调的是如何在一个垂直领域里尽早落地、尽早实现数据闭环、从而实现持续迭代。 当谈到数采中心时,他的原话是这样的: 现在数采中心的这种商业模式受到质疑,在慢慢地变冷。我们会看到可能更加具有价值的、对于训练来说更加具有辅助能力的,是一些在真实

在清科灵境CTO潘余曦博士的《面向科学场景的自进化具身智能》主题演讲中,他没有大谈特谈具身智能、通用人工智能的未来畅想,而强调的是如何在一个垂直领域里尽早落地、尽早实现数据闭环、从而实现持续迭代。

当谈到数采中心时,他的原话是这样的:

现在数采中心的这种商业模式受到质疑,在慢慢地变冷。我们会看到可能更加具有价值的、对于训练来说更加具有辅助能力的,是一些在真实场景里面的作业的数据。我们预测这些数采中心可能未来会变成遥操作中心,这种远程的作业中心,类似于Robotaxi这样的一些远程驾驶的地方。用人类兜底来形成这个闭环反馈的数据,来支持具身大脑的迭代。

这个类比并非凭空想象而来,自动驾驶行业早就把这条路走通了:

Waymo的车辆配有车队响应(FleetResponse)后台机制,遇到施工路段、警察手势、非常规障碍时,会向远程支持人员发出协助请求;百度Apollo的萝卜快跑、各类Robotaxi运营商也都设有远程安全员席位。

远程安全员的价值体现,从来不是"驾驶水平高",而是他们介入的每一次接管,都是一次珍贵的Corner Case样本。

机器人行业也是同理,远程作业中心不是让人替机器干活,而是让机器干活,人负责接住掉下来的那部分。

人在在环兜底+数据

对于数采中心演化成远程作业中心的趋势,潘博士给出了两个理由:

理由一:机器人要真正落地,必须有人兜底

清科灵境把数据、大脑、操作系统集成在一台复合机器人上,支撑实验室场景下的灵巧操作——透明物体抓取,以及液体的倾倒、搅拌、过滤这类化学实验动作。

他们总结出大概约五十种原子动作,每种动作只需要几十条后训练遥操数据,就能完成比较好的部署,达到95%左右的成功率。

在很多场景里,95%已经很好了。但科学实验场景,尤其是医药前处理这样的场景,客户希望的是接近100%。

那最后5%怎么办?

"这时候我们就需要用人类在环反馈的这样一种机制,由远程的遥操员用人类来兜底,来实现能力的快速增长。"潘余曦说。

理由二:现场反馈回来的数据,才是机器人迭代的命门

相比实验室里搭建布景采集来的数据,潘余曦认为对训练更有辅助能力的,是真实场景里的作业数据。

他在分享中反复强调的那句话,值得单独摘出来:

在作业场景下面,我们产生的轨迹数据,包括纠偏的数据,包括失败的数据。这些数据比冷启动里面的遥操数据或者ego数据更加具有代表性,能揭示机器人到底在哪些场景下表现不好,在哪些场景下能够通过在线的数据生成和反馈学习来提高自己的能力。

布景实验室里一遍遍演示出来的百分百成功轨迹,记录的是正确的做法;真实岗位上每一次由远程操作员接管修复的数据,记录的则是失败的经验。

前者铺陈分布的中心,后者勾勒分布的边界。而决定一个模型能不能交付的,从来是边界而不是中心。

人在环回路:Agent Harness才是主角

这套理论逻辑没有问题,但实操中缺的是那套能把"人类兜底"真正跑起来的工程结构。

潘余曦反复强调的是:核心大脑之外,更重要的是在周边建立的那套Agent Harness(智能体驾驭层)。

Agent本身只是模型,Harness是那套把模型变成可用系统的脚手架——工具箱、记忆、路由、权限、验证与回滚。

移植到机器人上,指的就是围绕具身大脑搭出的那一整层调度与治理框架。

这套驾驭结构里有三层内容:

第一层是原子技能库。基于SAM这类分割工具、以及若干小型VLA,生成一批"原子动作"并组织成技能库——这些是可以直接被调用、组合、参数化的最小执行单元。

第二层是高层规划与编排。由GPT一类更高级的视觉语言模型负责整体任务规划和技能调用。这里有个关键设计叫认知与执行解耦:认知层回答"下一步该干什么",执行层回答"手臂具体该怎么动、用多大力"。前者需要世界知识和推理能力,后者由Pi系列action expert这样的专家模型承担。而历史经验——上次是怎么拆这个动作的、拆得好不好——被抽象成RAG记忆库,让系统不再每次从零开始理解任务。

第三层,就是人类的兜底入口。在机器人无法自主完成任务的情形下,系统会调用远程的人类在环遥操作。而这一层不只是"任务保底",它同时是数据采集的关键动作。

但真正让第三层能"该出手时才出手"的,是潘余曦口中更加重要的那个设计——语义验证器。

"你如何去判断当前这个任务是完成了,还是没完成,还是失败了,还是出现了异常状态需要人类的介入?"

这不是一个技术问题,而是一个治理问题。没有验证器,人类在环就没有触发条件——要么人得一直盯着屏幕,成本高到失去意义;要么机器人带着错误一路跑到底,失去纠偏机会。

于是完整的闭环是这样七步:

自主执行→VLM验证→问题诊断→自我修复→人类介入→In-Context学习→经验沉淀

精妙之处在第六步:人类纠偏的数据不只是攒下来等下一次离线训练,而是立刻进入当前任务的上下文窗口,让模型在几分钟之内就学会这次该怎么改。

也就是所谓的“自进化”。

支撑它的技术依据已经出现。NVIDIA的RoboTTT(Test-Time-Training Robot Policies)把TTT层集成进VLA,使模型循环状态变成一组"快权重",把视觉运动上下文Scaling到8000个时间步,比当时最优策略高出三个数量级,推理延迟却不随上下文增长;在真实机器人长程操作任务上,相比单步上下文基线整体性能提升87%。

换句话说,人接手一次,机器即时反馈,当次受益,在技术上已经不再是愿景。

而承载这条实时链路的另一个基础底座,是清科灵境从2022年就在开放原子开源基金会发起的开源项目Dora项目。Dora在数据传输延迟上是ROS的大概1/17到1/20。

延迟相差一个数量级,把"一边干活一边训话"从不可能变成了可能,这也是全双工人类在环能成立的前提:机器人正在打滑的夹爪,等得起一句"抓得紧一点"的人工指令。

最后,整套机制有三个时间尺度:秒级实时纠偏、天级记忆沉淀与技能库更新、周/月级离线重训新版本。

"只有通过这种验证,经过验证的纠正轨迹,才是对于模型训练至关重要的有价值的数据。"潘余曦说。

步日欣,创道硬科技创始人,北京邮电大学集成电路专委会副会长,浙商证券研究院专家,兼任多家投资机构投委。电子工程本科、计算机硕士学位,具有证券从业资格、基金从业资格,拥有IT研发、咨询、投融资十五年以上经验,关注投资领域为半导体、智能制造、新能源等。“硬科技新势力”平台覆盖5w+投资人和几千家科技型创业企业,并辅导几十家科技企业完成股权融资。