光合及目
1lux.xyz
← 报道
产品新闻网易· 2026-10-09

南方科大 & 腾讯开源 ReferTrack:单目 VLA 刷新具身视觉跟踪 SOTA

南方科大 & 腾讯开源 ReferTrack:单目 VLA 刷新具身视觉跟踪 SOTA ✨导读: 机器人要听懂语言并跟踪指定行人,传统VLA模型常在抽象空间推理,和图像实际目标对齐差。本文提出ReferTrack先指代‑后跟踪新范式,只用单台前向相机,靠索引检测框选出目标,搭配TVBI时序记忆,仿真取得SOTA,还能直接落地四足、人形机器人。 作者

南方科大 & 腾讯开源 ReferTrack:单目 VLA 刷新具身视觉跟踪 SOTA

✨导读: 机器人要听懂语言并跟踪指定行人,传统VLA模型常在抽象空间推理,和图像实际目标对齐差。本文提出ReferTrack先指代‑后跟踪新范式,只用单台前向相机,靠索引检测框选出目标,搭配TVBI时序记忆,仿真取得SOTA,还能直接落地四足、人形机器人。
  • 作者:Hanjing Ye , Tianle Zeng , Jiazhao Zhang , Shaoan Wang , Zibo Zhang , Weisi Situ , Yuchen Zhou , Yonggen Ling , Hong Zhang

  • 单位: 南方科技大学RCV实验室, 腾讯Robotics X, 北京大学, 福田实验室

  • 论文标题:ReferTrack: Referring Then Tracking for Embodied Visual Tracking

  • 论文链接:https://arxiv.org/abs/2607.20061

  • 代码链接:https://github.com/MedlarTea/referTrack

研究背景

具身视觉跟踪EVT,简单说就是:机器人只靠自身机载摄像头,听懂人类自然语言指令,持续跟随指令描述的特定行人。这项能力拆解成两大核心难题:

  • 目标识别:在一堆行人里,找出语言描述对应的那个人;

  • 轨迹规划:规划无碰撞运动,和目标维持合适跟随距离。

早期研究把识别和规划拆成两套独立模块:先用视觉大模型识别目标,再交给导航规划器做运动输出。但这套方案有明显短板——识别的误差会一路向下传递,越往后错误越严重。

近几年大火的VLA视觉‑语言‑动作模型,把识别、规划整合进同一个大模型策略中,借助思维链CoT完成推理。代表工作TrackVLA++引入空间感知Token做推理。

痛点:很多VLA模型的推理发生在抽象隐空间,不是直接基于图像上的检测框。不仅很难做监督训练,在人群拥挤、人物外观混淆的场景,目标定位很容易出错。想要提升效果往往要加装多台相机,硬件成本随之拉高。

那能不能把推理“落回图像上”?这篇论文给出思路:把目标识别任务,转化成在图像候选检测框里做选择的多选问题,既方便监督,又和视觉基础模型定位能力天然对齐。

主要贡献

  1. 提出先指代,后跟踪ReferTrack全新范式。将目标识别转化为索引边界框选择,用单个Refer‑CoT特殊Token选出目标,再基于选中目标预测跟踪航点。推理直接基于图像检测结果,摆脱抽象隐空间。

  2. ⏱️设计TVBI时序‑视点‑边界框指示Token。维护滑动窗口存储历史目标框,把目标几何信息注入历史视觉特征,保留目标运动时序线索;目标消失时用全零框作为占位标记。

  3. 搭建Refer‑QA辅助数据集联合训练。基于行人重识别数据集合成指代问答样本,离线强化模型区分、定位目标的能力,提升在线跟踪时识别准确率。

  4. 仿真+实物双重验证。EVT‑Bench基准上单目设置拿下SOTA,在目标极易混淆的任务上,效果甚至优于部分多相机基线;同时完成四足、人形机器人部署,证明强大的仿真到现实迁移能力。

️研究方法 任务定义

在时间步 ,给定语言指令 、前向摄像头RGB观测序列 ,机器人输出航点序列 。

每个航点 ,代表机器人自身坐标系下地面位移与转向角度。 任务成功判定标准:机器人和目标保持1‑3米跟随距离,并且目标持续出现在相机视野内。

整体推理流程

模型分两轮调用大模型完成推理,公式如下:

  1. 第一轮:输入语言指令 、行人候选框目录 、历史视觉特征 ,输出Refer‑CoTtoken ,用来选定目标。输出可以是 ... ,也可以输出 ,代表目标不在当前画面。

  2. 第二轮:把上一步选出的目标token作为条件,送入大模型得到动作特征,交由ActionHead解码输出机器人跟踪轨迹。

  3. 被选中的目标框存入FIFO先进先出滑动窗口队列,供给后续时刻TVBI模块使用。

1)观测编码 & TVBI Token

模型同时使用SigLIP、DINOv2双视觉编码器提取图像特征:

  • 细粒度 Token:捕捉当前图像细节;

  • 粗粒度 Token:留存历史场景信息;

模型设置滑动窗口,只保留最近H帧,控制算力开销。

论文在已有TVI(时序‑视点指示Token)基础上新增边界框几何信息,得到TVBI Token:

代表归一化的目标边界框;如果该帧看不到目标,则 作为占位标记。

✨小设计:TVBI只作用历史帧,当前帧不会注入框信息。强迫模型依靠原始视觉信息+历史时序记忆做目标识别,提升泛化性能。

2)候选框目录 Candidate Catalog

每一帧图像送入YOLO11检测器,检测画面内所有行人,构建带编号的候选集合:

每个检测框通过共享的两层MLP投影器 编码后输入大模型,模型依靠自回归预测输出对应目标索引Token。

3)Refer‑CoT 指代推理 + 轨迹预测

Refer‑CoT只输出单个特殊Token完成目标选择,推理步骤轻量化,也便于监督训练。完成目标指代之后,再以此为条件预测机器人跟踪航点。

4)目标框滑动队列

FIFO队列存储历史选中的目标边界框:

  • 训练阶段:使用仿真真值标注;还会随机混入错误目标索引,模拟跟踪出错场景,增强模型鲁棒性。

  • 推理阶段:完全自回归运行,每一步使用Refer‑CoT输出的检测框更新队列。

损失函数

总损失由三部分加权组合:

  1. 航点损失:预测航点和专家轨迹做 MSE 均方误差,权重系数

  1. 指代损失:交叉熵损失,监督Refer‑CoT输出正确的目标索引。

  1. :专门服务 Refer‑QA 样本的文本交叉熵损失,不走动作预测头,只优化视觉‑语言对齐能力。

训练方案:两阶段SFT监督微调

  1. 阶段1:冻结大模型主干与视觉编码器,仅训练视觉投影层,使用通用多模态QA数据集训练1轮。

  2. 阶段2:导航仿真样本(130万)与Refer‑QA指代问答样本(130万)按1:1混合训练;视觉编码器冻结,其余全部参数参与更新。

实验结果 仿真基准 EVT‑Bench

评价指标:SR成功率、TR跟踪率、CR碰撞率,测试三大任务:单目标跟踪STT、干扰跟踪DT、歧义跟踪AT。全部仅使用单台前向相机,模型参数量仅4B,全程只用SFT监督微调,没有用到强化学习RL。


对比之前最优单目基线TrackVLA++:歧义跟踪任务上,成功率SR直接提升22.9%! 有意思的是,在目标极易混淆的DT、AT任务上,这套单相机方案,性能可以媲美甚至超过部分多相机基线。

启示:显式的图像空间目标指代,一定程度可以弥补相机视野不足,降低对多相机硬件、昂贵RL强化学习的依赖。

消融实验(在干扰跟踪DT任务上开展)

  1. Oracle实验组:去掉Refer‑CoT,直接给TVBI喂真值目标框,SR达到81.5%,和专家策略差距很小。说明:拥挤干扰场景,性能瓶颈主要是目标识别,而不是运动规划模块。

  2. 保留Refer‑CoT,移除TVBI模块:SR下降到70.4%。证明TVBI时序框特征,对跟踪稳定性有明显增益。

  3. Refer‑CoT+TVBI全部移除:SR暴跌至55.7%。说明图像空间显式做目标选择,是抗干扰能力的核心来源。

真实机器人部署

硬件平台:Unitree Go2四足机器人、Unitree G1人形机器人,只搭载一台Intel RealSense D455前向相机。

模型部署在远端GPU服务器,机器人通过WiFi回传图像;整套感知+控制闭环平均10.6Hz,单步目标检测仅耗时12ms。

真实场景测试:面对人群干扰、目标部分身体被遮挡的情况,机器人依旧可以选对目标、稳定跟随。充分验证优秀的Sim‑to‑Real仿真到现实迁移能力。

✍️总结

本文提出ReferTrack,一套“先指代、后跟踪”的VLA范式用于具身视觉跟踪:

  1. 将目标识别转化为图像检测框索引选择,推理落地图像空间,训练监督更加友好;

  2. TVBI Token+滑动窗口队列,保存目标时序几何运动信息;搭配Refer‑QA数据集联合训练强化指代能力;

  3. 仅4B参数量、只用监督微调,单相机拿下EVT‑Bench基准SOTA,部分任务效果超越多相机方案;可直接部署到四足、人形实体机器人。

核心启发:把推理锚定到图像上的显式视觉证据,可以弥补相机视野局限,减少对强化学习优化的依赖。

成为付费用户可以阅读 腾讯 所有资料

了解更多 →