
文章主要内容和创新点主要内容本文提出了一种名为osmAG-LLM的框架,用于零样本开放词汇目标导航(即让机器人根据自然语言查询找到指定物体,即使物体未被预先映射或已移动)。该框架的核心是结合语义地图(semantic-osmAG)和大语言模型(LLMs)的推理能力,解决传统高细节物体地图易过时(因物体移动)的问题。具体而言,框架通过以下步骤实现导航:构建语义地图:基于osmAG(一种基于OpenStreetMap格式的层级拓扑地图)扩展,加入物体节点(通过LabelMaker从RGB-D数据提取)和视角节点(通过视觉语言模型VLM生成),形成LLM可直接解析的文本格式语义地图。物体检索:给定人类查询后,LLM结合语义地图的环境上下文和自身语义先验(如“剪刀通常在厨房或工作室”),生成可能包含目标物体的地图节点。导航与在线检测:机器人按LLM生成的节点顺序导航,到达后通过开放词汇目标检测器(如YOLO-World)和VLM验证物体是否存在,若未找到则转向其他视角或节点。实验表明,该方法在静态物体导航中路径更短、成功率更高,在动态(已移动)或未映射物体的导航中显著优于现有方法。创新点扩展osmAG至物体级语义映射