《电子技术应用》
您所在的位置:首页 > 人工智能 > 设计应用 > 基于PointMeta和上下文感知的点云场景理解
基于PointMeta和上下文感知的点云场景理解
电子技术应用
樊泽,李鹏辉,赵皓阳,赵文彬
石家庄铁道大学 信息科学与技术学院
摘要: 针对点云场景理解中局部特征表达受限与语义对齐不精确的双重挑战,提出融合层次化元架构与双流上下文感知的三维理解框架。该框架以 PointMeta 为视觉主干,通过元函数分解构建多尺度自适应特征提取网络,实现多尺度特征高效融合;同时引入上下文感知的空间-语义对齐策略,从语义与上下文维度对齐三维物体特征与语言特征,完成跨模态信息融合,并将额外空间信息融入文本标签以减少语义歧义。在ScanRefer、Nr3D公开数据集上的实验表明,所提模型较PointNet++性能显著提升,且优于数据集上其他现有模型,具备更强泛化性能与良好应用价值。
中图分类号:TP391.41 文献标志码:A DOI: 10.16157/j.issn.0258-7998.267775
中文引用格式: 樊泽,李鹏辉,赵皓阳,等. 基于PointMeta和上下文感知的点云场景理解[J]. 电子技术应用,2026,52(9):149-158.
英文引用格式: Fan Ze,Li Penghui,Zhao Haoyang,et al. Point cloud scene understanding based on PointMeta and context-awareness[J]. Application of Electronic Technique,2026,52(9):149-158.
Point cloud scene understanding based on PointMeta and context-awareness
Fan Ze,Li Penghui,Zhao Haoyang,Zhao Wenbin ​
School of Information Science and Technology, Shijiazhuang Tiedao University
Abstract: Aiming at the dual challenges of limited local feature representation and inaccurate semantic alignment in point cloud scene understanding, this paper proposes a 3D understanding framework integrating a hierarchical meta-architecture and dual-stream context-awareness. Firstly, PointMeta is adopted as the visual backbone, and a multi-scale adaptive feature extraction network is constructed through meta-function decomposition to achieve adaptive fusion of multi-scale features. Then, a context-aware spatial-semantic alignment strategy is introduced to align 3D object features and linguistic features from the perspectives of semantics and context, thereby realizing cross-modal information fusion. Additionally, extra spatial information is incorporated into text labels to reduce ambiguities caused by the relationships between contextual features and language. Experiments on scene understanding using public datasets ScanRefer and Nr3D show that the proposed network model achieves significant improvements compared to PointNet++. Compared with the results of other network models on public datasets, the proposed model exhibits varying degrees of performance enhancement, demonstrating stronger generalization ability and favorable practical application value.
Key words : point cloud scene understanding;PointMeta;context-awareness;spatial-semantic alignment

引言

三维点云场景理解与自然语言处理的融合研究正推动新一代智能系统的发展。作为该领域的核心任务,三维视觉定位(3DVG)[1-2]需在点云中识别文本指定的目标物体(如“棕色木桌左侧的椅子”),而三维密集描述生成(3DDC)[3-4]则需为场景内每个物体生成精确的文本描述。这类任务在服务机器人AR/VR导航等场景中展现巨大潜力。

近年来,随着三维传感技术的快速发展,三维点云数据在自动驾驶、机器人导航、增强现实(AR)等领域得到了广泛应用。与二维图像相比,点云能够提供精确的几何结构和深度信息,从而更准确地描述物体的三维形状、姿态及空间分布。

然而,点云数据的稀疏性、非结构化特性以及复杂场景下的噪声干扰,使得点云场景理解仍然面临巨大挑战:首先,局部几何特征表达能力受限。主流方法如PointNet++依赖固定半径邻域聚合,难以捕捉薄壁结构等复杂拓扑。尽管Transformer架构(如X-Trans2Cap)通过自注意力机制提升全局建模能力,但其置换不变性缺失导致处理噪声点云时召回率降低。其次,跨模态语义对齐存在鸿沟。现有方法多采用简单特征拼接或浅层注意力融合,忽略语义与空间特征的协同优化。最后,上下文歧义导致描述偏差。语言中的方位描述与点云空间分布呈非线性映射关系,而现有方法缺乏可解释的关联建模。例如,“靠近窗户的沙发”可能对应多个候选区域,现有基线模型因此产生的误匹配率较高。

针对这些问题,本文提出了一种基于PointMeta上下文感知的点云场景理解方法,旨在增强模型对局部结构、空间关系以及跨模态语义对齐的能力。具体而言,本文采用PointMeta作为视觉主干网络,利用其模块化设计和层次化特征提取机制,提升模型对点云局部结构和物体间空间关系的建模能力。同时,提出一种双流上下文感知的三维理解框架,从语义和空间两个维度优化点云与语言特征的跨模态融合。为了减少上下文特征与语言描述之间的歧义,进一步引入空间增强的文本标签,以提供更精确的监督信号。

本文的主要贡献可概括为:

(1) 提出一种层次化元架构,基于PointMeta进行点云特征提取,构建多尺度自适应特征提取网络实现多尺度特征自适应融合。

(2) 设计双流上下文感知的三维理解框架,从语义和上下文的角度对齐三维物体特征和语言特征,实现跨模态信息融合。

(3) 引入空间增强的文本标签,减少语义歧义,提高模型的鲁棒性。


本文详细内容请下载:

https://www.chinaaet.com/resource/share/2000007253


作者信息:

樊泽,李鹏辉,赵皓阳,赵文彬

(石家庄铁道大学 信息科学与技术学院,河北 石家庄 050043)

2.jpg

此内容为AET网站原创,未经授权禁止转载。