Science Robotics | 让机器狗“看穿”障碍物:昆虫的侧向摆动如何提升机器人视觉推理能力
作者:系统管理员 发布日期:2026-09-24 浏览次数:

导语:在森林、废墟等植被茂密或障碍物密集的环境中,探索机器人面临着严重的视觉遮挡问题。树叶、灌木、金属栅栏等前景障碍物会严重阻挡摄像头和激光雷达的视线,导致场景理解失败。传统多视角3D视觉方法在高遮挡条件下几乎失效,而大型多模态模型的视觉推理能力也因遮挡而大打折扣。来自林茨大学、博尔扎诺自由大学、剑桥大学等机构的研究团队在《Science Robotics》上发表了一项研究,借鉴昆虫的“侧向摆动”行为,结合合成孔径传感技术,让四足机器人能够在部分遮挡下显著提升视觉推理能力。这项技术低成本、可实时部署于任何配备摄像头的机器人,且与波长无关,适用于可见光、近红外、热成像等多种光谱。

一、问题:遮挡为何让机器人“失明”?

在植被环境中,探索机器人需要穿越复杂的、杂乱的、人类难以进入的区域。视觉遮挡是核心挑战之一。

传统相机的根本限制在于景深。典型机器人相机使用小于毫米级的光学孔径,景深很大,导致近处和远处的物体都清晰成像。这意味着任何前景障碍物都会遮挡背景中的目标物体。经典的“合成孔径”原理恰恰相反:孔径越大,景深越浅,离焦物体越模糊。

多视角3D视觉方法为何失效?理论上,如果深度估计在遮挡场景中完全一致,简单的深度阈值或深度滤波器就能有效隔离并移除遮挡物。但论文实验证明,即使面对相对稀疏的遮挡,当前基于模型和深度学习的多视角3D视觉方法也全部失败。

研究团队用宽角RGB相机在11 cm的侧向摆动中采集了300张图像,然后用四种最先进的3D视觉方法进行处理:Structure-from-Motion(SfM)、NeRF、VGGT和Depth Anything v3。结果:

  • SfM、VGGT和DA3重建的点云主要由前景遮挡物构成
  • NeRF产生了大量不连贯的噪声体积
  • 在所有情况下,被遮挡的背景都未被恢复——因为遮挡物在多视角输入中随机遮挡了图像特征
  • 计算时间:SfM和NeRF需要5-6小时,VGGT和DA3需要7-15分钟(即使在高性能GPU上)

多视角3D视觉方法依赖图像间一致的特征匹配。当这些特征被随机遮挡时,它们就失效了。

二、核心洞察:昆虫的“侧向摆动”与合成孔径

2.1 动物的侧向摆动行为

侧向摆动是动物在跳跃或攻击前用来判断距离的典型侧向身体运动。具有有限、短程立体视觉的动物利用运动视差,通过运动在近处和远处物体之间产生相对运动。

昆虫的侧向摆动已被广泛研究:螳螂、蝗虫、蟋蟀等都会通过腿部运动绕腹部旋转身体,产生侧向头部位移,同时通过反向头部旋转补偿以保持眼睛方向。这种行为模式增强了运动视差。

但侧向摆动是否在遮挡环境中发挥作用(例如透过树叶看到猎物)此前从未被探索。

2.2 合成孔径传感原理

合成孔径传感是一种先进的信号处理技术:移动传感器(如雷达天线或光学相机)在时间和空间上收集一系列测量值,然后通过计算将这些测量值组合起来,合成一个更大的孔径效果。

在光学合成孔径中,不同位姿记录的图像被计算积分,产生一个具有极浅景深的图像——相当于物理透镜尺寸等于合成孔径时的效果。合成焦面(平面、圆柱面、球面或其他拓扑)可以对齐到遮挡前景之外的场景,或扫过所有深度实现完整的体积聚焦。

对于每个焦面,遮挡物的光学信号在离焦模糊中丢失,而聚焦背景的光学信号被放大。计算过程只需要将捕获的图像投影并平均到合成焦面上,效率足以在移动处理器上实时运行。

关键特性:波长无关。适用于可见光、热成像、近红外、红边和低光光谱等多种波段。

2.3 为什么合成孔径比相机阵列更优?

早期合成孔径使用固定的结构化相机阵列,但存在严重问题:

  • 严重欠采样合成孔径信号
  • 引入大型复杂载荷
  • 需要极高带宽传输多路并行视频流
  • 无法根据局部遮挡自适应采样

后续工作将原理扩展到无人机和无人机集群的极宽非结构化合成孔径采样。本研究的创新在于:用机器人自身的侧向摆动运动来生成合成孔径,低成本、可实时部署于任何配备摄像头的机器人。

图片

三、技术方法:从侧向摆动到视觉推理

3.1 实验平台

所有实验使用ANYbotics ANYmal四足机器人。机器人配备多个视觉传感器:两个FLIR Blackfly广角RGB相机(前后各一),六个Intel RealSense深度相机(每侧一个,前后冗余)。

运动控制:

  • 绕垂直轴的旋转:通过躯干控制器实现,偏航角由操纵杆输入指定,利用控制器的全角度范围
  • 水平和对角位移:使用基于Free Gait的控制器,允许指定高层任务空间命令(如期望的基座或末端执行器运动),以10 Hz更新
  • 机器人腿部首先置于约80 cm × 50 cm的矩形站姿,然后通过配置文件指定基座在3D空间中的目标位置

数据采集:

  • 从前方广角相机记录RGB图像,从上前方深度传感器的一个NIR相机记录近红外图像
  • 使用ROS进行数据采集和同步,rosbag文件本地保存后传输到外部工作站进行离线后处理
  • 记录机器人基座在世界坐标系中的位姿,相机位姿通过固定已知的刚体变换从基座位姿获得
  • 基座位姿使用双状态隐式滤波器估计,融合本体感受关节编码器测量和IMU数据
  • 图像30 fps,位姿400 Hz,进行采样和插值以匹配图像采集率

合成孔径积分:

  • 开发了GPU加速的延迟渲染应用(CUDA工具包)
  • 图像裁剪为方形尺寸(RGB为1080×1080,NIR为480×480)
  • 计算平台:Intel Core i9处理器,64 GB RAM,NVIDIA RTX 5090 GPU

3.2 不同侧向摆动运动的比较

研究团队比较了三种不同的侧向摆动运动:

运动类型
合成孔径大小
积分图像数
效果
旋转运动
15 cm
26
参考基线
水平位移
15 cm
20
优于旋转,最大化运动视差
对角位移
16 cm
28
最佳,同时抑制水平和垂直遮挡物

关键发现:

  • 水平位移产生的运动视差最大,效果优于轴向旋转
  • 纯水平运动难以抑制大型水平遮挡物(如栅栏的金属横杆)
  • 对角位移同时受益于水平和垂直运动视差,能更好地抑制水平对齐的遮挡物
  • 有效遮挡移除可以用少一个数量级的样本实现,支持使用快速运动

重要注意事项:旋转侧向摆动运动产生运动视差,是因为相机的光学中心与旋转中心不重合,而是沿圆形轨道偏移。如果光学中心与旋转中心重合,就不会产生运动视差,遮挡移除将不可行。

3.3 遮挡掩膜策略

合成焦面上所有重叠像素的简单平均会引入来自遮挡物的残余离焦模糊。为抑制这种模糊并获得更高对比度和更好的颜色重建,可以使用遮挡掩膜——识别所有输入图像中的潜在遮挡物,在合成孔径积分时只平均非遮挡像素。

论文比较了多种图像线索用于遮挡掩膜:

植被指数(VDVI):如果假设遮挡物是植物,可以应用可见光差异植被指数来识别和掩膜可能的植被。但非植被元素(如前景金属栅栏)仍未被掩膜,保留了离焦模糊。

深度线索:虽然3D视觉无法重建被遮挡的背景,但它能有效估计前景遮挡物的深度。基于“遮挡物比背景更近”的原则,这些深度图可用于掩膜。

评估的深度重建方法:

  • DA3(metric、mono、large三种模型)
  • Video Depth Anything(VDA)
  • Depth Anything v2(DA2)
  • Pixel-Perfect Depth(PPD)

结果:PPD提供最优结果,但需要最长计算时间。深度学习3D技术在灰度内容上表现不如彩色内容,可能因为训练数据偏向彩色。植被指数计算在NIR记录中不可行。

3.4 图像序列中的深度无关视觉推理

不依赖单个合成孔径积分图像(固定焦面),另一种方法是将视觉推理直接应用于原始输入序列,绕过积分步骤。

图像序列推理:对10张常规图像序列(等距水平间隔)应用视觉推理。该方法只能检测通过足够大间隙可见的背景物体。虽然使用多张图像可能增加可识别物体的数量,但在所有视图中被严重遮挡的物体仍无法检测。

焦栈推理:合成孔径积分成像需要预先知道焦面距离,这隐含假设背景物体的深度已知。但本方法可以快速计算焦栈(一系列不同合成焦距的图像)。将视觉推理应用于焦栈,允许在不知道物体距离或手动调整焦距的情况下识别物体。

结果:10层焦栈(从3 m到20 m等距合成焦面)可以识别出在常规图像序列中无法识别的七个通风管道。焦栈计算时间170 ms,视觉推理时间约15-25秒(取决于服务器负载)。

距离估计:通过将焦栈层的已知距离编码到提示中,视觉推理模型可以估计目标距离。

四、实验结果:视觉推理的显著提升

4.1 多视角3D视觉的失败

用300张宽角RGB侧向摆动图像处理,四种最先进3D视觉方法全部失败:

  • SfM、VGGT、DA3重建的点云主要由前景遮挡物构成
  • NeRF产生大量不连贯噪声
  • 被遮挡的背景均未被恢复
  • 计算时间:SfM/NeRF 5-6小时,VGGT/DA3 7-15分钟

4.2 大型多模态模型的视觉推理对比

研究团队将ChatGPT-5.0的视觉推理能力应用于所有实验。在常规图像中,视觉推理主要聚焦于前景遮挡物,背景场景无法被合理解释。而在合成孔径积分图像中,遮挡被抑制后,推理能力显著提升。

实验配置:

配置
侧向摆动运动
图像数
合成孔径
背景物体
图1
旋转
300
~11 cm
建筑、通风管道
图6A/B
水平位移
82
12 cm
增加遮挡密度
图6C/D
对角位移
32
19 cm
自行车、交通锥
图6E/F
水平位移
151
9 cm
汽车(约5 m)

提示词:“图像中可见什么?”和“汽车有多远?”

结果:常规图像的视觉推理主要关注前景遮挡物,背景无法解读。合成孔径积分图像中,推理能力大幅提升,能正确识别背景物体并估计距离。

注意事项:视觉推理模型本质上是非确定性的。同一图像内容多次查询会产生略有不同的响应,但观察到的模式保持一致。ChatGPT推理时间约10-20秒,随服务器负载变化。

4.3 遮挡掩膜的效果

图7比较了各种图像线索用于遮挡掩膜的效果。VDVI识别和掩膜可能的植被,但非植被元素(金属栅栏)仍未被掩膜。深度线索有效估计前景遮挡物深度,可用于掩膜。PPD提供最优结果,但计算时间最长。

五、讨论:应用前景与局限

5.1 应用前景

探索性野外机器人已大幅扩展了我们调查危险、偏远或人类无法进入环境的能力。在植被环境中,这些机器人可以穿越林下、绕过障碍物、在树冠下收集信息,用于生物多样性监测、野火风险评估、保护规划、野生动物追踪、监视以及研究森林健康指标。

潜在应用包括:

  • 监视、地形探索、工业检测、搜索救援
  • 伪装破解——不仅是计算机视觉和图像处理的主题,也是捕食者使用的基于运动视差的狩猎策略
  • 复杂环境中的高级导航

5.2 技术优势

  • 低成本:可立即部署于任何配备摄像头的机器人
  • 实时:合成孔径积分在17 ms内处理300张1080×1080图像
  • 波长无关:适用于RGB、NIR、热成像、红边、低光光谱
  • 高分辨率:对基于视觉的场景理解至关重要
  • 鲁棒性:对残余遮挡和轻微模糊具有鲁棒性

5.3 统计规律

合成孔径传感用于遮挡移除的三个关键发现:   

  1. 效果高度依赖遮挡水平:在约50%遮挡时最优。远高于此阈值时有效移除更困难;远低于此阈值时通常不需要合成孔径传感   
  2. 合成孔径尺寸不需要很大:最小基线是产生等于投影遮挡物尺寸的视差   
  3. 可见性增益取决于积分样本数:不需要极高,但不能欠采样。在遮挡掩膜成功移除遮挡物像素的场景中,更多样本增加通过间隙观察背景的统计概率

5.4 局限性

  • 遮挡密度:在50%遮挡时效果最优,过高遮挡密度下效果下降
  • 相机位姿精度:需要精确的相机位姿数据,位姿估计不准确会导致残余模糊
  • 计算延迟:ChatGPT推理需要10-20秒,本地模型部署可大幅降低延迟
  • 平台限制:实验在四足机器人上进行,但侧向摆动能力不限于此,也适用于双足、六足、轮式或爬行平台
  • 与深度学习遮挡移除方法的对比:DeOccNet限制于5×5结构化采样模式,需要数秒生成单张图像;LF-PyrNet虽然毫秒级,但分辨率仅256×192,不足以支持鲁棒的视觉推理

5.5 未来方向

  • 在多样化和真实户外条件下测试,配备多光谱(特别是热成像)传感器
  • 开发基于Boston Dynamics Spot的增强传感器套件平台
  • 自适应采样:根据局部遮挡条件由AI代理自主执行
  • 本地部署小型LMM(如Qwen)或远程API调用大型模型
  • 研究动物侧向摆动行为是否在遮挡环境中具有功能(如透过树叶检测伪装猎物)

六、总结

这项研究建立了一个连接动物视觉感知与光学合成孔径传感的桥梁。通过将昆虫的侧向摆动行为与合成孔径传感原理结合,研究团队展示了机器人如何在部分遮挡下显著提升视觉推理能力。

核心贡献:

  1. 揭示了侧向摆动在遮挡环境中的功能,此前未被探索
  2. 证明了多视角3D视觉方法在高遮挡下失效,而合成孔径传感有效   
  3. 展示了大型多模态模型在合成孔径积分图像上的视觉推理能力显著提升
  4. 提出了焦栈方法实现深度无关的视觉推理
  5. 在工业级四足机器人上验证了方法的实用性

一句话总结:让机器人像昆虫一样“侧向摆动”,就能看穿遮挡,看到原本看不见的东西。

论文信息

标题:How robot dogs see the unseeable: Improving visual interpretability via peering for exploratory robots

作者:Oliver Bimber, Karl Dietrich von Ellenrieder, Michael Haller, Rakesh John Amala Arokia Nathan, Gianni Lunardi, Mohamed Youssef, Marco Camurri, Santos Miguel Orozco Soto, Jeremy E. Niven

机构:林茨大学、博尔扎诺自由大学、剑桥大学等

期刊:Science Robotics, Vol. 11, Issue 118, 2026年9月16日

DOI:10.1126/scirobotics.aed8577

数据与代码:https://doi.org/10.5281/zenodo.18093179

文章来源:CAAI认知系统与信息处理专委会