|
Science Robotics | 让机器狗“看穿”障碍物:昆虫的侧向摆动如何提升机器人视觉推理能力
作者:系统管理员
发布日期:2026-09-24
浏览次数:
一、问题:遮挡为何让机器人“失明”?在植被环境中,探索机器人需要穿越复杂的、杂乱的、人类难以进入的区域。视觉遮挡是核心挑战之一。 传统相机的根本限制在于景深。典型机器人相机使用小于毫米级的光学孔径,景深很大,导致近处和远处的物体都清晰成像。这意味着任何前景障碍物都会遮挡背景中的目标物体。经典的“合成孔径”原理恰恰相反:孔径越大,景深越浅,离焦物体越模糊。 多视角3D视觉方法为何失效?理论上,如果深度估计在遮挡场景中完全一致,简单的深度阈值或深度滤波器就能有效隔离并移除遮挡物。但论文实验证明,即使面对相对稀疏的遮挡,当前基于模型和深度学习的多视角3D视觉方法也全部失败。 研究团队用宽角RGB相机在11 cm的侧向摆动中采集了300张图像,然后用四种最先进的3D视觉方法进行处理:Structure-from-Motion(SfM)、NeRF、VGGT和Depth Anything v3。结果:
多视角3D视觉方法依赖图像间一致的特征匹配。当这些特征被随机遮挡时,它们就失效了。 二、核心洞察:昆虫的“侧向摆动”与合成孔径2.1 动物的侧向摆动行为侧向摆动是动物在跳跃或攻击前用来判断距离的典型侧向身体运动。具有有限、短程立体视觉的动物利用运动视差,通过运动在近处和远处物体之间产生相对运动。 昆虫的侧向摆动已被广泛研究:螳螂、蝗虫、蟋蟀等都会通过腿部运动绕腹部旋转身体,产生侧向头部位移,同时通过反向头部旋转补偿以保持眼睛方向。这种行为模式增强了运动视差。 但侧向摆动是否在遮挡环境中发挥作用(例如透过树叶看到猎物)此前从未被探索。 2.2 合成孔径传感原理合成孔径传感是一种先进的信号处理技术:移动传感器(如雷达天线或光学相机)在时间和空间上收集一系列测量值,然后通过计算将这些测量值组合起来,合成一个更大的孔径效果。 在光学合成孔径中,不同位姿记录的图像被计算积分,产生一个具有极浅景深的图像——相当于物理透镜尺寸等于合成孔径时的效果。合成焦面(平面、圆柱面、球面或其他拓扑)可以对齐到遮挡前景之外的场景,或扫过所有深度实现完整的体积聚焦。 对于每个焦面,遮挡物的光学信号在离焦模糊中丢失,而聚焦背景的光学信号被放大。计算过程只需要将捕获的图像投影并平均到合成焦面上,效率足以在移动处理器上实时运行。 关键特性:波长无关。适用于可见光、热成像、近红外、红边和低光光谱等多种波段。 2.3 为什么合成孔径比相机阵列更优?早期合成孔径使用固定的结构化相机阵列,但存在严重问题:
后续工作将原理扩展到无人机和无人机集群的极宽非结构化合成孔径采样。本研究的创新在于:用机器人自身的侧向摆动运动来生成合成孔径,低成本、可实时部署于任何配备摄像头的机器人。 三、技术方法:从侧向摆动到视觉推理3.1 实验平台所有实验使用ANYbotics ANYmal四足机器人。机器人配备多个视觉传感器:两个FLIR Blackfly广角RGB相机(前后各一),六个Intel RealSense深度相机(每侧一个,前后冗余)。 运动控制:
数据采集:
合成孔径积分:
3.2 不同侧向摆动运动的比较研究团队比较了三种不同的侧向摆动运动: 关键发现:
重要注意事项:旋转侧向摆动运动产生运动视差,是因为相机的光学中心与旋转中心不重合,而是沿圆形轨道偏移。如果光学中心与旋转中心重合,就不会产生运动视差,遮挡移除将不可行。 3.3 遮挡掩膜策略合成焦面上所有重叠像素的简单平均会引入来自遮挡物的残余离焦模糊。为抑制这种模糊并获得更高对比度和更好的颜色重建,可以使用遮挡掩膜——识别所有输入图像中的潜在遮挡物,在合成孔径积分时只平均非遮挡像素。 论文比较了多种图像线索用于遮挡掩膜: 植被指数(VDVI):如果假设遮挡物是植物,可以应用可见光差异植被指数来识别和掩膜可能的植被。但非植被元素(如前景金属栅栏)仍未被掩膜,保留了离焦模糊。 深度线索:虽然3D视觉无法重建被遮挡的背景,但它能有效估计前景遮挡物的深度。基于“遮挡物比背景更近”的原则,这些深度图可用于掩膜。 评估的深度重建方法:
结果:PPD提供最优结果,但需要最长计算时间。深度学习3D技术在灰度内容上表现不如彩色内容,可能因为训练数据偏向彩色。植被指数计算在NIR记录中不可行。 3.4 图像序列中的深度无关视觉推理不依赖单个合成孔径积分图像(固定焦面),另一种方法是将视觉推理直接应用于原始输入序列,绕过积分步骤。 图像序列推理:对10张常规图像序列(等距水平间隔)应用视觉推理。该方法只能检测通过足够大间隙可见的背景物体。虽然使用多张图像可能增加可识别物体的数量,但在所有视图中被严重遮挡的物体仍无法检测。 焦栈推理:合成孔径积分成像需要预先知道焦面距离,这隐含假设背景物体的深度已知。但本方法可以快速计算焦栈(一系列不同合成焦距的图像)。将视觉推理应用于焦栈,允许在不知道物体距离或手动调整焦距的情况下识别物体。 结果:10层焦栈(从3 m到20 m等距合成焦面)可以识别出在常规图像序列中无法识别的七个通风管道。焦栈计算时间170 ms,视觉推理时间约15-25秒(取决于服务器负载)。 距离估计:通过将焦栈层的已知距离编码到提示中,视觉推理模型可以估计目标距离。 四、实验结果:视觉推理的显著提升4.1 多视角3D视觉的失败用300张宽角RGB侧向摆动图像处理,四种最先进3D视觉方法全部失败:
4.2 大型多模态模型的视觉推理对比研究团队将ChatGPT-5.0的视觉推理能力应用于所有实验。在常规图像中,视觉推理主要聚焦于前景遮挡物,背景场景无法被合理解释。而在合成孔径积分图像中,遮挡被抑制后,推理能力显著提升。 实验配置: 提示词:“图像中可见什么?”和“汽车有多远?” 结果:常规图像的视觉推理主要关注前景遮挡物,背景无法解读。合成孔径积分图像中,推理能力大幅提升,能正确识别背景物体并估计距离。 注意事项:视觉推理模型本质上是非确定性的。同一图像内容多次查询会产生略有不同的响应,但观察到的模式保持一致。ChatGPT推理时间约10-20秒,随服务器负载变化。 4.3 遮挡掩膜的效果图7比较了各种图像线索用于遮挡掩膜的效果。VDVI识别和掩膜可能的植被,但非植被元素(金属栅栏)仍未被掩膜。深度线索有效估计前景遮挡物深度,可用于掩膜。PPD提供最优结果,但计算时间最长。 五、讨论:应用前景与局限5.1 应用前景探索性野外机器人已大幅扩展了我们调查危险、偏远或人类无法进入环境的能力。在植被环境中,这些机器人可以穿越林下、绕过障碍物、在树冠下收集信息,用于生物多样性监测、野火风险评估、保护规划、野生动物追踪、监视以及研究森林健康指标。 潜在应用包括:
5.2 技术优势
5.3 统计规律合成孔径传感用于遮挡移除的三个关键发现:
5.4 局限性
5.5 未来方向
六、总结这项研究建立了一个连接动物视觉感知与光学合成孔径传感的桥梁。通过将昆虫的侧向摆动行为与合成孔径传感原理结合,研究团队展示了机器人如何在部分遮挡下显著提升视觉推理能力。 核心贡献:
一句话总结:让机器人像昆虫一样“侧向摆动”,就能看穿遮挡,看到原本看不见的东西。 论文信息 标题:How robot dogs see the unseeable: Improving visual interpretability via peering for exploratory robots 作者:Oliver Bimber, Karl Dietrich von Ellenrieder, Michael Haller, Rakesh John Amala Arokia Nathan, Gianni Lunardi, Mohamed Youssef, Marco Camurri, Santos Miguel Orozco Soto, Jeremy E. Niven 机构:林茨大学、博尔扎诺自由大学、剑桥大学等 期刊:Science Robotics, Vol. 11, Issue 118, 2026年9月16日 DOI:10.1126/scirobotics.aed8577 数据与代码:https://doi.org/10.5281/zenodo.18093179 |


