时间:2026-07-28
2026年7月23日下午,“CSIG图像图形中国行—哈尔滨工业大学(深圳)站”在哈尔滨工业大学(深圳)国设C栋B1层201报告厅成功举办。本次活动由中国图像图形学会(CSIG)主办,哈尔滨工业大学(深圳)、CSIG出版工作委员会联合承办,以“多模态大模型与具身智能”为主题,邀请图像图形与人工智能领域的专家学者作专题报告并开展学术对谈,共同交流领域前沿进展与未来发展方向。

合影
报告会开幕式对与会专家表示热烈欢迎,并强调本次报告会对推动人工智能理论创新、促进产学研深度融合、培育高层次人才具有重要意义。

金连文教授作报告
华南理工大学金连文教授首先作了题为“古籍文档图像修复:从文字先验引导的扩散模型到统一生成理解大模型”的专题报告。针对古籍文档在流传过程中因虫蛀、脱墨、污渍、破损等因素产生的文字残缺和图像退化问题,金连文教授系统介绍了古籍文档图像修复领域的代表性研究成果。他重点讲解了面向古籍修复的训练数据构建方法、OCR与多模态大模型相结合的修复范式,以及基于统一生成理解大模型的古籍修复新路线,并对通用人工智能时代古籍智能处理的研究方向进行了展望。相关研究为古籍保护、释读与智能化研究提供了新的技术思路。

王文冠研究员作报告
浙江大学王文冠研究员作了题为“面向三维物理世界和复杂开放任务的具身智能规划”的专题报告。他从具身智能在三维空间理解、开放任务规划和物理可行动作生成等方面面临的挑战出发,介绍了团队在空间智能视觉基座模型、视觉—语言—动作模型以及基于可微物理引擎的世界模型等方向的研究进展。报告讲解了如何在保持二维视觉基础模型能力的同时增强模型的三维空间理解能力,以及如何借助指令分解与能量函数求解,来应对开放任务中的组合爆炸问题。同时,他介绍了基于可微物理引擎的世界模型,通过参数化物理场将物理规律引入未来状态预测,为实现符合物理约束的规划与推演提供支撑。

吴小俊教授作报告
江南大学吴小俊教授作了题为“多模态视觉目标跟踪方法”的专题报告。他从目标跟踪的基本问题和技术发展脉络入手,系统介绍了多模态视觉目标跟踪的主要研究方法,并围绕RGB-T、RGB-D、RGB-E等典型多模态目标跟踪任务,分享了相关领域的最新研究进展。报告还结合CVPR 2026和ECCV 2026目标跟踪挑战赛,对复杂环境下多模态信息融合、目标表征与鲁棒跟踪等关键问题进行了分析,并介绍了多模态目标跟踪技术在智慧城市等场景中的应用,为与会师生理解该领域的发展趋势提供了全面而深入的参考。

金连文教授作总结致辞
活动最后,CSIG副理事长金连文教授作总结致辞。他对哈尔滨工业大学(深圳)为活动举办提供的支持表示感谢,并特别感谢相关人员为本次活动所作的精心组织和积极贡献。他表示,三场专题报告内容前沿、视野开阔、精彩纷呈,既展示了图像图形与人工智能领域的重要研究进展,也为参会师生带来了新的科研思路和启发。
本次活动为图像图形、计算机视觉和人工智能领域的专家学者及青年学生搭建了高水平的学术交流平台,集中呈现了古籍文档智能修复、具身智能规划和多模态视觉目标跟踪等方向的最新进展。活动的成功举办进一步加强了哈尔滨工业大学(深圳)与中国图象图形学会及相关高校、科研机构之间的联系,为推动图像图形技术与人工智能深度融合、促进学术创新与人才培养注入了新的活力。