数学与信息学院、软件学院黄栋教授团队在人工智能无监督学习领域取得系列进展

发布者:林慷祺发布时间:2026-09-22浏览次数:10

近期,数学与信息学院、软件学院黄栋教授团队聚焦人工智能无监督学习,在图像语义表征、多源信息融合与复杂数据结构建模等方面取得系列进展,相关成果发表在IEEE Transactions on Circuits and Systems for Video Technology等国际重要期刊。

挖掘语义邻域信息 提升无监督图像分析能力

从无标注图像中学习具有区分能力的语义特征,是人工智能有效利用海量视觉数据的重要基础。现有深度聚类方法对样本周围的语义联系挖掘不足,样本表征与类别结构学习缺乏充分协同,制约了对复杂图像内在结构的刻画。

针对上述问题,团队提出一种互邻域增强的原型对比聚类方法,挖掘不同增强视图中的邻域关系,将样本层面的特征一致性学习与类别层面的原型对比学习相结合,促进同类样本聚合与不同类别分离。该方法将样本特征对齐拓展至语义邻域之间的关联建模,推动图像表征与类别结构的协同优化,为从无标注图像中发现潜在语义结构提供了新方法,有助于减少图像分析对人工类别标注的依赖,提升复杂视觉数据的组织与分析能力。

相关成果以“Mutual Neighborhood-Enhanced Protypical Contrastive Learning for Clustering”为题发表于IEEE Transactions on Circuits and Systems for Video Technology(中科院一区期刊,影响因子10.8)。

图1 互邻域增强的深度聚类框架

融合多层次关联 提升多源数据分析能力

在人工智能应用中,同一对象常具有来自不同来源或不同类型的特征描述。如何整合这些信息中的共性与互补关系,是提升数据分析能力的重要问题。针对现有多视图聚类方法对不同层次关联利用不足的问题,团队提出一种基于混合阶相似性学习的多视图聚类方法,将样本之间的直接相似关系与共享邻居所反映的拓扑关联相结合,兼顾数据的局部邻域与整体结构。

该方法在统一框架中联合学习各视图的关系图、视图权重及融合后的共识图,并通过连通性约束直接获得聚类结果。研究将多层次关系建模与多源信息融合相结合,有助于减少数据融合过程中的结构信息损失,更充分地挖掘不同来源信息的互补价值,为人工智能处理多源异构数据提供了新的算法支持。

相关成果以“Multi-View Clustering With Hybrid-Order Similarity Learning”为题发表于IEEE Transactions on Neural Networks and Learning Systems(中科院一区期刊,影响因子9.7)。

图2 混合阶相似性学习的多视图聚类框架

融合图神经网络与集成聚类 增强数据分析稳定性

不同算法或参数设置可能对同一数据集产生不同划分,如何整合这些结果、形成稳定可靠的数据分组,是复杂数据分析面临的挑战。针对已有集成聚类方法难以充分融合原始特征与聚类结果中高阶关联的问题,团队提出一种基于图卷积网络的鲁棒集成聚类方法,将图神经网络的结构学习能力引入集成聚类。

该方法依据样本在多个初始聚类结果中被归入同一组的频率构建关系图,通过图卷积网络挖掘深层关联,并与自编码器学习的原始数据特征协同融合,促进特征表示与聚类结构的一致性。研究将多个聚类结果的融合拓展至数据特征与关系结构的联合学习,增强了模型在不同集成规模下的稳定性,为人工智能从复杂数据中提取可靠的结构信息提供了新思路。

相关成果以“REC-GCN: Robust ensemble clustering with graph convolutional networks”为题发表于Pattern Recognition(中科院一区期刊,影响因子9.1)。

图3 图卷积网络与集成聚类协同学习框架REC-GCN

结合视觉Transformer 拓展无标注图像分析方法

视觉Transformer能够捕捉图像中跨区域的关联,为人工智能理解复杂视觉场景提供了有力工具。针对其在无监督图像聚类中面临的训练稳定性和特征学习与聚类目标衔接不足等问题,团队提出一种视觉Transformer对比聚类方法,将视觉Transformer与样本级、簇级对比学习统一到端到端框架中,协同学习图像特征与数据整体的类别结构。

该方法通过引入卷积前端改善图像块表示与训练稳定性,结合对比学习促进图像表征与聚类结果的联合优化。研究在包括农作物害虫、遥感场景和医学图像在内的多个真实图像数据集上进行了验证,展现了方法对不同视觉场景的适用性,为挖掘无标注图像中的潜在类别结构提供了技术路径,也为农业图像资源的智能组织与分析提供了参考。

相关成果以“Vision transformer for contrastive clustering”为题发表于Knowledge-Based Systems(中科院一区期刊,影响因子8.0)。

图4 视觉Transformer对比聚类框架VTCC

上述研究得到国家自然科学基金(62476102、62572201、62202176)、广东省自然科学基金(2025A1515010245、2023A1515012885)及广州市基础与应用基础研究项目(2025A04J3924)的资助。

相关论文链接:

https://doi.org/10.1109/TCSVT.2026.3672480

https://doi.org/10.1109/TNNLS.2026.3696938

https://doi.org/10.1016/j.patcog.2025.112717

https://arxiv.org/pdf/2206.12925


文图/数学与信息学院、软件学院