English
朱塞佩·卡雷尼尼教授做客清华 分享“大型视觉语言模型中的注视引导注意力与自生成可视化”
分享到
发布于 2026-08-25

8月20日,清华软件论坛第三十七期邀请不列颠哥伦比亚大学教授、数据科学硕士项目主任朱塞佩·卡雷尼尼(Giuseppe Carenini)作题为“大型视觉语言模型中的注视引导注意力与自生成可视化”的学术报告。论坛采用线上线下相结合的形式举行,软件学院师生及来自其他高校人工智能与信息可视化领域的研究者线下或线上参会。

卡雷尼尼作报告

卡雷尼尼首先梳理了自然语言与信息可视化相结合的研究图景,介绍了大型视觉语言模型在图表问答等“从可视化到语言”任务,以及可视化生成等“从语言到可视化”任务中的进展。在此基础上,卡雷尼尼重点介绍了两个近期研究方向:一、探索如何利用人类眼动信息引导模型注意力。研究团队构建了ChartGaze眼动追踪数据集,并提出注视引导的注意力优化方法,使模型更加关注与图表问题相关的区域,从而提升图表问答的准确率和可解释性。后续研究进一步将该方法应用于误导性图表,考察人类注视监督能否增强模型对不同视觉设计的鲁棒性。二、关注大型视觉语言模型能否通过自主生成可视化辅助推理。卡雷尼尼介绍了视觉辅助数学问题求解基准VAMPS。实验发现,即使对于适合通过绘图求解的问题,多数模型的直接解析推理仍优于借助自生成可视化进行求解,反映出当前模型在生成、理解和利用可视化信息方面仍存在局限。最后,卡雷尼尼总结指出,可视化并不会天然提升大型视觉语言模型的推理能力。模型只有学会关注正确的视觉信息,并可靠地生成和解读可视化,才能真正发挥自然语言与信息可视化协同的优势。

会议现场

在随后的交流与提问环节中,与会师生围绕眼动信息对模型训练的作用、模型注意力的可解释性以及可视化工具辅助推理的能力边界等主题提出问题,卡雷尼尼一一进行了解答。


编辑:董超 审核: