Vision Group一篇论文被IJCV录用

        近日,实验室魏兆洋同学的论文《Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes》被国际顶级期刊International Journal of Computer Vision(IJCV)录用。该研究针对多模态大模型在复杂城市场景和恶劣环境下容易产生视觉幻觉、推理过程不稳定及结果难以解释等问题,构建了大规模多模态评测基准AD2-Bench。该基准包含约1万张图像和7万条问答样本,通过分层视觉诊断和证据链对模型的事实准确性、逻辑可靠性、自洽性与可解释性进行系统评估。在此基础上,研究团队提出了证据驱动的视觉推理方法EGVOR,通过构建由空间锚点、视觉关注和语义描述组成的证据单元,减少复杂场景中的空间歧义与语义不确定性,并结合分层课程学习和强化学习,引导模型生成更加可靠、可验证的推理过程。实验结果表明,EGVOR在多个基准测试中显著提升了多模态大模型的视觉推理准确性与可信度。

        Vision Group@UCAS成立于2019年,是一支专注于机器学习、图像和视频处理及计算机视觉等领域的研究团队,尤其专注于基于点标注与多源信息融合的弱小目标感知。实验室承担了多个重要项目,包括国家自然科学基金项目、航天科工及华为公司等单位课题,致力于推动计算机视觉技术的创新与发展。