光合及目
1lux.xyz
← 报道
公司新闻雷峰网· 2026-10-08

至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026

▎ From Laboratory to Factory: Why Real-World CNC Lathe Manipulation Breaks Current Robot Learning Pipelines 主讲人:冯宗宝,至简动力(Simplexity Robotics) 强化学习负责人 01 用机器人造机器人 本次分享从一个制造目标说起——用机器

▎From Laboratory to Factory: Why Real-World CNC Lathe Manipulation Breaks Current Robot Learning Pipelines

主讲人:冯宗宝,至简动力(Simplexity Robotics)强化学习负责人至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026

01

用机器人造机器人

本次分享从一个制造目标说起——用机器人来制造机器人。CNC 操作看起来可能很简单,但要让它在真实工厂里稳定可靠,是完全不同的问题。它揭示了实验室基准测试的成功与工厂级精度之间那道清晰的鸿沟。今天,我将展示我们如何努力去弥合这道鸿沟。至简动力是一家全栈具身智能公司。我们自研的多模态模型,把理解和生成统一在一起;一套闭环的数据飞轮,让我们能够持续改进这些模型;统一的模块化硬件平台,让它们运行在真实的机器人上;SimpleClaw 平台则给开发者提供了一个构建与部署机器人应用的开放平台。至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026在硬件侧,我们有四条产品线。i7 Pro 是我们的轮式机器人,iX 是我们的轮式人形机器人。我们还提供两种配置的模块化力控机械臂,这里分别展示了搭配 Dexter 灵巧手和夹爪的形态。最后,我们的数据采集手套帮助我们规模化采集人类演示,为机器人学习提供数据。所以,我们的方法连接起三个部分:我们全栈自研,从硬件、软件到模型;数据采集手套让规模化采集人类演示成为可能;多模态模型把理解与生成统一在一起。目标是从这些数据中学到更多,抬高机器人在精密 CNC 操作上的能力天花板。本次分享聚焦三个互补的方法:SimpleWAM 从多模态观测中生成动作片段;DRAM,即 Delta 规则循环关联记忆,用固定大小的记忆矩阵处理长时序上下文;DPE 用一个单独训练的评估器对候选动作打分,同时保持策略冻结。三者合起来,分别解决了我们 CNC 系统中的动作生成、记忆与动作选择问题。至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026

02

真实工厂难题

这是我们面对的工厂难题。我们的目标是机器人造机器人,精密 CNC 操作正是其中的代表。它为什么难?至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026第一,工件与卡盘之间的间隙只有 0.5 毫米,几乎没有留给对位误差的空间。第二,反光的表面、微弱的纹理、外形相似的零件,让视觉对位变得困难。第三,机器人必须在受限的工作空间里完成一连串动作,而关键的接触界面并不总是可见的。因此,系统必须在整个任务过程中始终保持精度,即便视觉信息不完整。这些 CNC 约束塑造了我们的架构:弱纹理要求一个足够强的视觉编码器;长程接近需要头部与腕部相机提供的多视角;精密接触则需要接近感知的条件化。于是,视觉、语言和状态输入被转换为 token。SimpleWAM 提供多模态骨干和动作 DiT。我们在两者之间插入一个 DRAM 模块,在当前观测之外补充历史上下文。动作 DiT 提出候选动作片段,DPE 用一个单独训练的评估器对这些候选打分,同时保持训练好的动作提出器固定不变。被选中的动作片段随后下发给 i7 Pro。至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026

03

具体应对方案

SimpleWAM 是我们统一的世界动作模型。它的思路是:训练时从丰富的未来监督中学习,推理时直接预测动作。训练阶段,视频 DiT、3D DiT 和动作 DiT 在任务指令的引导下,联合重建未来的视频帧、3D 状态与动作片段,让模型能够同时学习视觉、空间与动作的动力学。到了推理阶段,我们只输入当前图像、当前 3D 状态和语言指令,模型直接输出动作片段,而不必再生成未来的图像或 3D 状态。在动手之前,我们分别提取特征,再对它们做自适应融合。一个共享的冻结编码器,保留来自头部与腕部相机的密集图像 token;随后,查询分别独立地读取每个视角,这样在融合之前,任何一个视角都不会压制另一个;门控再针对每个查询和每个特征通道,去平衡全局上下文与局部对位线索。最终,融合视觉历史与鲁棒的、状态条件化的动作 DiT,来预测动作片段。右侧的注意力图展示了更强的边界聚焦效果。在各方法的标称试验中,融合方法成功了 15 次,相比之下,Query-concay 为 0 次,π0.5 SFT 基线为 8 次。至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026要在一段长任务中持续稳定地动作,机器人需要来自此前步骤的上下文。为此,我们引入 DRAM——Delta 规则循环关联记忆(Delta-Rule Recurrent Associative Memory),把这种能力附加到预训练机器人策略上。这里,冻结的 SimpleWAM 骨干从当前观测中提取特征;DRAM 先用这些特征读取记忆中的相关历史;动作 DiT 把读取到的历史与当前上下文结合起来,生成动作片段;在这之后,通过门控的 Delta 规则更新记忆,供下一步使用。记忆是一个固定大小的关联矩阵,因此它的占用在任务变长时保持一致。DRAM 可以在不修改骨干架构、也不重新训练骨干的前提下附加进来,让长时序记忆更容易接入现有策略。至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026在精密插入的过程中,仅靠视觉可能无法判断工件正以怎样的状态接触卡盘。力与力矩恰好能补上这些缺失的接触信息。我们从两个方面使用它们:其一,接近感知条件化会调整机器人的状态输入,让动作 DiT 在生成下一个动作时把接触因素考虑进去;其二,实时阻抗控制器利用实时反馈让执行更稳健,并根据接触的变化调整运动。二者结合,能够在直接插入受阻时支持恢复。在精密 CNC 插入任务上,这套组合方法取得了 100% 的任务成功率。常见的做法是用评估器的反馈去更新动作器,但这可能导致策略漂移。DPE 先训练一个行为克隆的动作器,再用一个单独训练的评估器在部署时对候选动作打分;成功的和失败的 rollout 随后只更新评估器,闭环由此形成,而动作器在机器人上始终保持冻结。DPE 提升了任务成功率,并减少了执行步数。至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026

04

成果展示

我们最终实现了机器人单设备全自动值守双 CNC 机床的完整作业方案。本次主演示视频以五倍速呈现了机器人的全流程自主作业过程,同时通过多个细分片段,分别展示三项核心独立工序:工件自主抓取、精准上料卡盘、加工完成后的取件与归位放置。至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026抓取工件至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026把工件插入卡盘至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026取出并放置工件值得一提的是,整个模型训练过程,我们仅使用了 600 条真实机器人运动轨迹作为训练数据。这也是我们本次工作的核心价值:将具身智能从实验室的基准测试效果,真正落地到高精度、高真实度的工业制造场景中。

为了方便大家抱团交流、互通会议消息,我们专门建了 IROS 2026 参会交流群!进群你会解锁这些「福利」?

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 探讨,错过也能追;

成为付费用户可以阅读 至简动力 所有资料

了解更多 →