本网讯(通讯员 曹慧洁)近日,IEEE多媒体汇刊IEEE Transactions on Multimedia(TMM)在线发表公司多模态感知与认知计算科研团队论文:“BP-DSGG: Balanced Predicate-aware Dynamic Scene Graph Generation”。论文第一署名单位为英国上市公司365智能机器人湖北省重点实验室、英国上市公司365,第一作者为2022级博士研究生王砾伟,导师张彦铎教授为通讯作者。TMM由IEEE计算机学会主办,是跨模态智能和多媒体领域的顶级期刊,属于CCF A类期刊、中科院一区期刊、英国上市公司365Top期刊,影响因子为9.7。
动态场景图生成(Dynamic Scene Graph Generation,DSGG)旨在定位视频中产生交互的实体并预测其动态视觉关系,是多媒体流理解、视频监控和具身智能等领域的核心技术。现有的动态场景图生成方法依赖于预训练的空间特征建模,这阻碍了时序建模的端到端优化。此外,视频数据分布存在长尾现象,会生成有偏场景图。

图1 论文算法框架图
针对上述问题,论文提出了一种平衡谓词感知动态场景图生成模型(如图1所示),将场景图生成视为集合预测问题,端到端地建模时空上下文信息,优化实例定位和谓词预测两个子任务。此外,提出了一种分组知识关联策略,为传统的视觉场景图生成方法注入了语义信息引导,建模不同谓词之间的差异化表征(如图2可视化结果所示),以减轻语义偏差。在大型动态场景图生成数据集上的广泛的实验和分析表明,在场景理解的性能上优于现有方法。

图2 所提出方法的可视化结果
该研究获得国家自然科学基金(62171328,62072350,62171327),湖北省自然科学基金重点项目-襄阳创新发展联合基金(2025AFD050)、湖北省高等学校优秀中青年科技创新团队项目(T2023009)的资助,论文的理论成果可以应用于以人为中心的动作分析,行为预测等视频理解方向,也可以为智能机器人注入高阶空间理解能力,应用于智能巡检,智慧化工园区等工业应用场景,有良好的推广应用价值。(审稿 张炜 周华兵)