实验室新闻
【学术资讯】IEEE-TASE文章发表:Learning to Tune Like an Expert: Interpretable and Scene-Aware Navigation via MLLM Reasoning and CVAE-Based Adaptation
日期:2026-03-17   阅读:1552  

上海交通大学陈卫东教授团队提出“学会像专家一样调参:基于多模态大模型推理与 CVAE 自适应的可解释、场景感知导航”,该成果发表在IEEE Transactions on Automation Science and Engineering杂志上。本文提出可解释、场景感知型导航框架LE-Nav,融合多模态大模型推理与条件变分自编码器,实现规划器超参数的自适应调校。为实现零样本场景理解,采用单样本示例结合思维链提示策略;依托条件变分自编码器搭建自然语言与导航超参数的映射关系,达成专家级参数调优。实验证实,LE-Nav生成的超参数在多类规划器与场景下均达到人类专家调优水准。基于智能轮椅平台的实机导航测试与用户研究表明,该框架在成功率、效率、安全性、舒适性等量化指标上优于现有主流方法,感知安全性、社会接受度等主观评分也更具优势。论文的第一作者是博士生王彦博,陈卫东教授为通讯作者。

Y. Wang, Z. Fang, L. Zhao and W. Chen, "Learning to Tune Like an Expert: Interpretable and Scene-Aware Navigation via MLLM Reasoning and CVAE-Based Adaptation," in IEEE Transactions on Automation Science and Engineering, doi: 10.1109/TASE.2026.3673004.

关键词: 可解释导航,自适应学习,大语言模型,决策透明性,服务机器人

原文链接:https://ieeexplore.ieee.org/document/11430584

开源代码地址:https://github.com/Cavendish518/LE-Nav

 


服务机器人的应用场景正日趋多样且动态多变,各类场景的物理布局与社交环境均会随时间、空间发生变化。在这类非结构化环境中,依赖固定参数的传统导航系统往往难以实现跨场景泛化,进而导致性能下降、社会接受度降低。尽管近年来已有相关方法借助强化学习对传统规划器进行改进,但此类方法因泛化能力不足、仿真场景多样性有限,在实际落地部署中效果欠佳,也阻碍了从仿真到现实的有效迁移。

针对上述问题,本文提出一种可解释、具备场景感知能力的导航框架 LE-Nav,该框架融合多模态大模型(MLLM)推理与条件变分自编码器(CVAE),实现对规划器超参数的自适应调优。LE-Nav导航架构图如图一所示。为达成零样本场景理解,本文采用单样本示例与思维链提示策略利用MLLM同时对前景和背景信息进行评估;同时,通过条件变分自编码器构建评估得到的自然语言结果与导航超参数间的映射关系,最终实现专家级的参数调优。

1773748815335699.jpg

图1:LE-Nav导航架构图

本文使用实验室开发的“交龙”智能轮椅在真实世界展开实验。实验结果表明,LE-Nav 生成的超参数可在多种规划器与场景中达到人类专家的调优水平。在智能轮椅平台开展的实际环境导航测试与用户研究显示,该框架在成功率、运行效率、安全性、舒适性等量化指标上均优于当前主流方法,且在感知安全性、社会接受度等主观评价维度也获得了更高评分。

1773748908978658.jpg

表1:与其他方法的对比性能测试结果

1773748943444284.jpg

图2:与其他方法的对比用户评分结果

陈卫东教授研究团队长期致力于机器人系统基础理论和应用研究,在移动机器人建图、定位、感知、人机交互、路径规划与导航等方向有着长期的技术积累,多次承担国家项目,并在机器人物流、巡检等领域与国内外知名企业开展合作。


自主机器人实验室

地址:上海交通大学闵行校区电院楼群2号楼216室

电话:021-34204303

医疗机器人研究院

地址:上海市闵行区东川路800号上海交通大学转化医学大楼二楼