中文引用格式: 张磊. 基于双分支迁移学习与特征融合的目标实例计数方法研究[J]. 电子技术应用,2026,52(9):19-27.
英文引用格式: Zhang Lei. Research on target instance counting method based on dual-branch transfer learning and feature fusion[J]. Application of Electronic Technique,2026,52(9):19-27.
引言
在智慧仓储与工业4.0的浪潮下,实现仓库物资的自动化、高精度盘点是提升物流效率与管理精益化水平的关键[1]。传统人工盘点效率低下、易出错,而RFID方案存在部署成本高、易受金属遮挡等问题。因此,基于计算机视觉的非接触、低成本自动计数技术成为研究热点,其核心挑战在于如何让机器在复杂、动态的仓库环境中,稳定且精确地识别并统计数量繁多、形态各异的物资实例[2]。
当前,主流的目标计数方法可归结为“检测后计数”范式。该方法利用目标检测模型定位图像中的每个实例,再对检测框进行累计以得到总数。得益于YOLO(You Only Look Once)、Faster R-CNN(Faster Region-based Convolutional Neural Network)等高效检测器的快速发展,该范式在众多领域得到了成功应用。例如,在农业领域,鲍文霞等人[3]通过为YOLOv5引入坐标注意力与Transformer预测头,提升了无人机图像中密集麦穗的计数精度;伍德林等人[4]则通过改进YOLOv11n的主干网络与梯度传播机制,增强了在复杂果园环境下对油茶果的检测与计数能力。在交通监控[5-6]、生物医学[7-9]乃至工业生产[10]等领域,基于YOLO系列及其改进模型的检测计数方案也已被广泛验证为一种有效手段。
然而,“检测后计数”方法在应对高度密集、严重遮挡的仓库盘点场景时,存在固有局限。其计数精度严重依赖于检测框的生成质量,而重叠、遮挡的物资本身就会导致检测模型产生漏检或重复框选[11]。为缓解此问题,一些研究尝试引入跟踪算法(如StrongSORT[10]、Median Flow[11])进行跨帧关联,但这增加了算法复杂度,且在单张静态图像盘点场景下不适用。更重要的是,最终计数结果需要通过累计检测框并执行非极大值抑制等后处理得到,这一过程会进一步引入误差,使得该类方法在物资堆叠紧密的货架场景下,计数误差可能被放大。
为从根本上规避检测框生成与后处理带来的误差累积,直接回归计数的思想应运而生。该方法将计数视为密度图回归问题,通过端到端网络直接从图像预测出表示目标空间分布的密度图,对其积分即可得到总数,在处理密集目标时具有天然优势[12]。不过,现有回归计数模型的特征提取网络通常较为简单,在面对仓库环境中光照不均、背景杂乱、目标尺度多变等多重挑战时,其特征表征能力与鲁棒性仍有不足[13]。因此,研究如何设计一个能够深度融合多源、多尺度判别性特征,并对密集遮挡目标保持强鲁棒性的回归计数网络,具有重要理论与应用价值。
针对上述问题,本文提出一种基于双分支迁移学习与特征融合的目标实例计数方法。该方法构建了一个包含注意力增强分支与定制检测骨干分支的双分支编码器,以同时利用注意力机制的空间-通道特征校准能力和检测骨干强大的多尺度特征提取能力。模型的核心创新在于引入了分支级迁移学习与多层特征融合机制:前者通过在多层级强制两条分支进行特征交互与知识蒸馏,实现了异构特征的优势互补;后者则通过聚合与精炼来自不同深度的多层次特征,构建了信息更丰富的特征表示。最终,通过一个端到端的回归计数框架,实现对仓库物资实例的精确、鲁棒计数。
本文详细内容请下载:
http://www.chinaaet.com/resource/share/2000007231
作者信息:
张磊
(中国能源建设集团广东省电力设计研究院有限公司,广东 广州 510663)

