近日,实验室窦知阳同学的论文《Towards Interactive Global Geolocation Assistant》被国际顶尖学术会议ECCV 2026录用。该研究针对当前街景图像全球地理定位任务中固有的视觉模糊性问题,以及现有静态模型和通用多模态大模型缺乏交互能力与地理知识的不足,提出了一种基于多轮演绎推理的交互式地理定位新范式。为了实现这一范式,研究团队构建了首个专为空间推理设计的大规模多模态地理定位数据集MG-Geo,包含近500万条对话样本。在此基础上,团队开发了全球地理定位助手GaGA。GaGA通过分层交互协议动态整合用户提供的地理锚点,有效应对了由广泛分布的视觉特征误导静态模型而产生的“相似性陷阱”。实验表明,GaGA在多个基准测试中取得了最优效果。 Vision Group@UCAS成立于2019年,是一支专注于机器学习、图像和视频处理及计算机视觉等领域的研究团队,尤其专注于基于点标注与多源信息融合的弱小目标感知。实验室承担了多个重要项目,包括国家自然科学基金项目、航天科工及华为公司等单位课题,致力于推动计算机视觉技术的创新与发展。
@
2021 .