点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
作者供稿直发 | 来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
给机器人一张 360° 全景图 ,它就能更可靠地听懂指令、找到路吗?
我们的出发点很直接: 更完整的视觉上下文,应该让导航决策更有依据。 当目标通道位于侧面时,全景能提前呈现入口和后续路线,机器人有机会在额外转身探索之前,就判断该往哪里走。
但实验发现: 沿用以往的VLN训练与执行方式,只把透视图换成全景,收益仍然有限。 问题随之变得清楚——周围的信息已经看见了,导航策略却还没有学会充分利用它。
围绕这个问题,我们来自浙江大学与香港大学的团队提出了 PanoVLN :让动作规划、训练数据和空间表示一起适应全景。采用 4B 视觉语言主干、RGB-only 视觉输入 ,模型在两大导航基准上取得领先结果,并在真实机器狗上实现更连贯的导航。
PanoVLN:更完整的视觉上下文,为导航提供更充分的决策依据
论文:PanoVLN: Towards Effective Panoramic Vision\-and\-Language Navigation
作者:Zhen Wang、Changpeng Wang、Zhe Liu、Zhangyang Qi、Yuxiang Lu、Zimo Zeng、Donglian Qi、Xi Chen
单位: 浙江大学、香港大学
HomePage: https://wangzhen-w.github.io/PanoVLN/
Code: https://github.com/wangzhen-w/PanoVLN
arXiv: https://arxiv.org/abs/2609.34759
Model: https://huggingface.co/wangzhen-w/PanoVLN
Dataset:https://huggingface.co/datasets/wangzhen-w/PanoVLN
01|三个关键改动,让全景真正参与决策
看得更全,也要规划得更远
一张全景可以呈现多个方向的路线,为更长时域的动作规划提供依据。例如,路线朝侧面转向时,全景已经能提供下一段移动所需的线索。
短动作目标却可能让这些信息派不上用场。 通往不同方向的路线,开头都可能是“先往前走”。只预测眼前几步,模型主要看正前方,也可能给出正确动作。
我们因此延长训练时的目标动作序列,让预测覆盖后续的路线选择。模型要判断接下来沿哪条路走,就需要结合指令,利用不同方向的路线信息。
注意力对比直观地呈现了这种变化: 短序列模型接收的是全景,使用方式却仍像透视策略,主要关注正前方;PanoVLN 则能根据指令,关注前方视野之外的目标通道。
同一全景、同一指令:短序列模型主要关注前方,PanoVLN 关注到与指令相关的侧面通道
动作长度消融中,透视策略在预测 4 个动作 时表现最佳,全景策略则更适合 18 个动作 。执行时,我们再用 置信度引导执行(CGE) ,根据预测的可靠程度决定走多少步后重新观察,让较长的规划与灵活的执行配合起来。
岔路看得更多,就专门训练选路
全景在分岔处尤其有用:多个方向的通道同时可见,模型需要结合指令选中正确的一条。
为此,我们在 800 个 HM3D 场景中构建约 9.8 万条轨迹 ,增加分岔决策,配上明确指定目标入口的指令,并加强转弯与停止附近的监督。训练任务由此反复教会模型:从眼前的多个选项中,选出指令要求的路线。
看懂地标,更要看懂空间关系
导航既需要认出门、桌子和通道,也需要理解它们如何组成一条可走的路线。
PanoVLN 融合来自 同一张 RGB 全景 的两类信息:视觉语言模型提供场景语义,冻结的 PanoVGGT 编码器提供几何特征。两者按对应区域对齐, 无需额外深度输入,也不增加视觉 token 数量 。
PanoVLN 整体架构:语义与几何融合,预测较长动作序列,由 CGE 决定本轮执行长度
02|双基准 SOTA:4B 模型,成功率达 77.3% / 78.0%
采用 Qwen3.5-4B 主干,完整 PanoVLN 在 R2R-CE / RxR-CE Val-Unseen 上的成功率分别达到 77.3% / 78.0% ,较论文比较表中的此前最好结果提高 11.9 / 8.7 个百分点 。
这些测试场景没有出现在训练中。即使只使用 R2R-CE 与 RxR-CE 导航数据,PanoVLN† 的成功率也达到 73.9% / 74.1% ;加入我们构建的数据后,性能进一步提升。
未见场景导航结果:SR 为成功率,SPL 同时衡量成功与路径效率;† 表示未使用 R2R-CE / RxR-CE 之外的导航数据
03|走出仿真:机器狗更会选路,也更少停顿
我们将 PanoVLN 部署到 Unitree Go2 ,搭配 Insta360 X5 全景相机与远程 RTX 3090,在办公室、走廊和校园中测试, 无需针对测试场景专门微调 。
下面这组连续帧展示了一个校园案例:机器人根据指令直行,找到左侧的棕色躺椅,并到目标旁停止。上排是行进过程,下排是对应的全景观察。
真机导航连续帧:根据指令直行,前往左侧目标并停止
收益也体现在移动过程中。在同步执行测试中,PanoVLN 的平均导航耗时为 86.4 秒 ,平均策略调用 7.4 次 ;StreamVLN 的对应值为 117.8 秒、34.3 次 。等待时间占比也从 27.1% 降到 13.6% 。
有把握时连续走一段,再根据预测可靠程度决定何时重新观察。 这减少了反复请求模型带来的等待,让机器人的行进更连贯。
真机执行效率:导航耗时、策略调用次数与等待时间对比;单次推理延迟不含网络通信
代码、模型与数据已开源
PanoVLN 的核心发现是: 更完整的视觉输入,需要与之匹配的学习和决策方式。 当模型学会利用不同方向的路线、入口和空间关系,全景才能转化为更准确、更连贯的导航。
训练与数据生成代码、评测和真机部署流程、模型权重及训练数据均已公开。
本文仅做学术分享,如有侵权,请联系删文。
。




扫码添加微信,备注:姓名+方向+单位,邀请入群。
点森科技 - 科技资讯_数码产品_互联网观察_智能硬件


