实验室新闻
【学术资讯】计算机视觉领域国际顶级期刊IJCV文章发表:ProSGNeRF——面向大规模动态城市场景的渐进式神经场景图
日期:2026-08-01   阅读:512  

上海交通大学陈卫东教授团队提出面向大规模动态城市场景重建与新视角合成的渐进式动态神经场景图方法 ProSGNeRF。相关成果以“ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes”为题,发表于计算机视觉领域国际期刊 International Journal of Computer Vision(IJCV)。IJCV期刊影响因子 10.3 (2025),5年期刊影响因子20.0 (2025),并入选CCF A类期刊。该研究针对城市道路中大范围相机运动、多个独立运动目标以及动态目标观测稀疏等问题,构建可随车辆轨迹持续扩展的局部神经场景图,并利用视觉基础模型先验和渐进式频率调制提升快速运动目标的重建质量。论文由上海交通大学、南洋理工大学和台湾大学合作完成,邓天宸、王彦博为共同第一作者,陈卫东教授为通讯作者。

论文信息: Deng, T., Wang, Y., Liu, Y. et al. “ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes.” International Journal of Computer Vision, 134, Article 365 (2026). DOI: 10.1007/s11263-026-02962-5.

关键词: 三维场景重建,视觉基础模型,神经场景图,大规模城市场景,动态新视角合成

原文链接: https://link.springer.com/article/10.1007/s11263-026-02962-5  

代码仓库: https://github.com/dtc111111/prosgnerf

城市道路三维重建是自动驾驶仿真、机器人导航、数字孪生和虚拟现实等应用的重要基础。与静态或物体中心场景不同,真实城市道路同时包含长距离相机运动、复杂背景和多个高速运动目标。传统方法通常采用固定容量的全局表示,随着车辆行驶范围扩大,容易出现模型容量不足、显存开销增加或局部误差扩散等问题;另一方面,车辆、行人等动态目标往往只在少量帧中出现,稀疏观测会导致目标边界模糊、重影和几何结构不完整。

1785596584789329.png

图1:ProSGNeRF在动态城市场景中的重建、动态目标细节恢复与场景分解结果。与已有方法相比,ProSGNeRF能够在大范围相机运动下更清晰地恢复运动目标和道路背景。

针对上述问题,论文提出 ProSGNeRF渐进式动态神经场景图框架。方法沿相机轨迹动态创建多个相互重叠的局部神经场景图,将每个局部场景分解为静态背景、动态目标和远场区域,并通过重叠帧和加权融合保持相邻场景图之间的一致性。当相机离开当前局部范围后,系统冻结已有场景图并继续建立新的局部表示,使模型容量能够随场景规模扩展,避免使用单一全局网络处理超长序列。

1785596094569607.png

图2:ProSGNeRF总体框架。输入图像首先通过可提示分割模型获得实例掩码,随后被组织为渐进式局部神经场景图;背景分支采用多分辨率哈希编码,动态目标分支利用视觉基础模型提取形状与外观先验。

在动态目标建模方面,研究团队将目标转换到归一化的物体中心坐标系,并利用 DINOv2 提取目标的高层形状特征和局部外观特征,分别用于约束密度与颜色解码。针对快速运动目标观测数量少、容易对少量训练图像过拟合的问题,论文进一步提出渐进式频率调制策略:训练初期优先学习低频的整体几何和外观,随后逐步引入位置、视角和目标位姿中的高频信息,从而兼顾优化稳定性与细节恢复能力。此外,方法利用可提示分割模型生成动态目标及远场区域掩码,并引入激光雷达投影监督以增强几何一致性。

论文在 KITTI、VKITTI2、Waymo和nuScenes 等仿真与真实城市道路数据集上进行了系统评估。在KITTI完整序列上,ProSGNeRF的图像重建指标达到 30.31 dB PSNR、0.931 SSIM和0.057 LPIPS;当训练视角仅保留25%时,新视角合成PSNR仍达到 25.69 dB。在Waymo数据集上,图像重建和新视角合成PSNR分别达到 32.55 dB29.89 dB;在nuScenes数据集上,图像重建PSNR达到 29.24 dB。结果表明,该方法在大范围相机运动和稀疏动态目标观测条件下均保持了较高的重建精度,并在主要评价指标上优于多种NeRF与3D Gaussian Splatting类方法。

1785596179999287.png

图3:场景分解与编辑结果。ProSGNeRF能够分离动态前景与静态背景,并通过调整场景图节点和变换关系,实现目标旋转、重新布局和高密度交通场景合成。

由于场景中的背景、动态目标和相机运动被显式解耦,ProSGNeRF不仅能够完成高质量三维重建和新视角合成,还支持目标移除、旋转、重新布局以及场景漫游等编辑操作。该研究为大规模动态城市场景的可控数字化建模提供了新的技术路径,可服务于自动驾驶闭环仿真、极端场景生成、系统安全验证以及移动机器人环境感知等任务。

陈卫东教授研究团队长期致力于机器人环境感知、三维场景重建、视觉定位、自主导航与智能机器人系统研究,在面向复杂动态环境的场景表示、建图定位和机器人自主决策等方向形成了持续的技术积累。

自主机器人实验室

地址:上海交通大学闵行校区电院楼群2号楼216室

电话:021-34204303

医疗机器人研究院

地址:上海市闵行区东川路800号上海交通大学转化医学大楼二楼