11.2.4.2 Multi-Modal Object Detection, Multimodal Detection

Chapter Contents (Back)
Object Detection. Multimodal Detection. Multi-Modal Detection.
See also Semi-Supervised Object Detection.

Liu, H.J.[Huai-Jin], Du, J.X.[Ji-Xiang], Zhang, Y.[Yong], Zhang, H.B.[Hong-Bo], Zeng, J.[Jiandian],
PVConvNet: Pixel-Voxel Sparse Convolution for multimodal 3D object detection,
PR(149), 2024, pp. 110284.
Elsevier DOI 2403
3D object detection, LiDAR points, Virtual points, Image pixels, Multi-modal fusion BibRef

Liu, Z.[Zhe], Ye, X.Q.[Xiao-Qing], Zou, Z.K.[Zhi-Kang], He, X.W.[Xin-Wei], Tan, X.[Xiao], Ding, E.[Errui], Wang, J.D.[Jing-Dong], Bai, X.[Xiang],
Multi-Modal 3D Object Detection by Box Matching,
ITS(25), No. 12, December 2024, pp. 19917-19928.
IEEE DOI 2412
Laser radar, Feature extraction, Cameras, Sensors, Proposals, Object detection, Multi-modal, 3D object detection, box matching BibRef

Yang, Z.Y.[Zhi-Yuan], Wang, X.K.[Xue-Kuan], Zhang, W.[Wei], Tan, X.[Xiao], Lu, J.C.[Jin-Cheng], Wang, J.D.[Jing-Dong], Ding, E.[Errui], Zhao, C.R.[Cai-Rong],
Fusion4DAL: Offline Multi-modal 3D Object Detection for 4D Auto-labeling,
IJCV(133), No. 7, July 2025, pp. 3951-3969.
Springer DOI 2506
BibRef

Li, Z.L.[Zhuo-Ling], Xu, X.G.[Xiao-Gang], Lim, S.N.[Ser-Nam], Zhao, H.S.[Heng-Shuang],
Toward Unified 3D Object Detection via Algorithm and Data Unification,
PAMI(47), No. 9, September 2025, pp. 7960-7975.
IEEE DOI 2508
Detectors, Object detection, Feature extraction, Cameras, Training, Point cloud compression, Convergence, Benchmark testing, multi-modal detection benchmark BibRef

Wang, Z.Y.[Zhen-Yu], Li, Y.[Yali], Liu, T.[Taichi], Zhao, H.S.[Heng-Shuang], Wang, S.J.[Sheng-Jin],
OV-UNI3DETR: Towards Unified Open-vocabulary 3d Object Detection via Cycle-modality Propagation,
ECCV24(XLVII: 73-89).
Springer DOI 2412
BibRef

Wang, H.S.[Hui-Shan], Ma, J.[Jie], Zhang, J.L.[Jian-Lei], Chen, F.W.[Fang-Wei],
GraphFusion: Robust 3D Detection via Cross-Modal Graph and Uncertainty-Aware Bayesian Fusion,
SPLetters(32), 2025, pp. 3645-3649.
IEEE DOI 2510
Semantics, Laser radar, Feature extraction, Uncertainty, Bayes methods, Entropy, Accuracy, Robustness, Object detection, uncertainty modeling BibRef

Cao, Y.[Yang], Zeng, Y.H.[Yi-Han], Xu, H.[Hang], Xu, D.[Dan],
Collaborative Novel Object Discovery and Box-Guided Cross-Modal Alignment for Open-Vocabulary 3D Object Detection,
PAMI(47), No. 11, November 2025, pp. 10475-10489.
IEEE DOI 2510
Training, Object detection, Solid modeling, Vocabulary, Point cloud compression, 3D perception BibRef

Fan, B.[Baojie], Li, X.T.[Xiao-Tian], Zhou, Y.H.[Yu-Han], Xia, C.X.[Cai-Xia], Fan, H.J.[Hui-Jie], Xu, F.Y.[Feng-Yu], Tian, J.D.[Jian-Dong],
MGAF: LiDAR-Camera 3D Object Detection With Multiple Guidance and Adaptive Fusion,
PAMI(48), No. 1, January 2026, pp. 824-839.
IEEE DOI 2512
BibRef
Earlier: A2, A1, A7, A5, Only:
GAFusion: Adaptive Fusing LiDAR and Camera with Multiple Guidance for 3D Object Detection,
CVPR24(21209-21218)
IEEE DOI 2410
Point cloud compression, Laser radar, Cameras, Object detection, Transformers, Semantics, Accuracy, Adaptation models, Solid modeling, autonomous driving. Adaptive systems, Navigation, Transforms, 3D object detection, multi-modality, LiDAR guidance BibRef

Zhong, J.P.[Jian-Ping], Qi, Z.B.[Zhao-Bo], Duan, K.W.[Kai-Wen], Xu, Y.R.[Yuan-Rong], Zhang, W.G.[Wei-Gang], Huang, Q.M.[Qing-Ming],
VPA: Multi-Modal Virtual Point Augmentation for 3D Object Detection,
CirSysVideo(35), No. 12, December 2025, pp. 12410-12425.
IEEE DOI Code:
WWW Link. 2512
Point cloud compression, Object detection, Semantics, Laser radar, Feature extraction, Detectors, Accuracy, Bicycles, Solids, virtual point augmenting BibRef

Shi, Y.C.[Yi-Chen], Yang, W.M.[Wen-Ming], Su, N.[Nan], Wang, G.J.[Gui-Jin],
LVMF3D: Large Vision Model Boosting Multimodal Fusion for Indoor 3D Object Detection,
SPLetters(33), 2026, pp. 356-360.
IEEE DOI 2601
Object detection, Point cloud compression, Octrees, Feature extraction, Head, Training, large vision model (LVM) BibRef

Yang, P.F.[Peng-Fei], Wu, F.[Feng], Liu, M.Y.[Min-Yang], Zhong, T.[Ting], Zhou, F.[Fan],
Beyond pillars: Advancing 3D object detection with salient voxel enhancement of liDAR-4D radar fusion,
PR(173), 2026, pp. 112841.
Elsevier DOI Code:
WWW Link. 2601
Object detection, Lidar, 4D Radar, Multi-modal fusion, Autonomous driving BibRef

Jia, F.Y.[Fei-Yang], Jia, C.Y.[Cai-Yan], Liu, A.[Ailin], Xu, S.Q.[Shao-Qing], Xia, Q.M.[Qi-Ming], Liu, L.[Lin], Yang, L.[Lei], Gong, Y.[Yan], Song, Z.[Ziying],
DGFusion: Dual-Guided Fusion for Robust Multi-Modal 3D Object Detection,
CirSysVideo(36), No. 4, April 2026, pp. 4956-4970.
IEEE DOI 2604
Laser radar, Point cloud compression, Object detection, Cameras, Feature extraction, Autonomous vehicles, Training, Detectors, robustness BibRef

Wang, K.[Ke], Gao, W.L.[Wei-Lin], Chen, K.[Kai], Shao, T.Y.[Tian-Yi], Li, L.Y.[Li-Yang], Zhou, T.Q.[Tian-Qiang], Lu, J.B.[Jian-Bo],
PVF-DectNet++: Adaptive Multi-Modal Fusion With Perspective Voxels for 3D Object Detection,
CirSysVideo(36), No. 5, May 2026, pp. 5776-5787.
IEEE DOI Code:
WWW Link. 2605
Feature extraction, Semantics, Object detection, Point cloud compression, Laser radar, Accuracy, Videos, Robustness, perspective voxel projection BibRef

Ding, R.[Rui], Kuang, Z.[Zhaonian], Ji, Y.Z.[Yu-Zhe], Yang, M.[Meng], Zheng, X.[Xinhu], Hua, G.[Gang],
Multi-Modal Decouple and Recouple Network for Robust 3D Object Detection,
CirSysVideo(36), No. 5, May 2026, pp. 5815-5827.
IEEE DOI 2605
Laser radar, Cameras, Feature extraction, Data models, Object detection, Robustness, Benchmark testing, Accuracy, data corruption BibRef

Hou, J.[Jingfu], Song, H.[Hong], Li, J.[Jinfu], Lin, Y.C.[Yu-Cong], Huang, T.Y.[Tian-Yu], He, J.[Jugang], He, X.W.[Xiu-Wei], Yang, J.[Jian],
PLPFusion: Plane-Line-Pixel Fully Sparse Fusion for Robust Multi-Modal 3D Object Detection,
CirSysVideo(36), No. 5, May 2026, pp. 5759-5775.
IEEE DOI Code:
WWW Link. 2605
Feature extraction, Object detection, Semantics, Laser radar, Robustness, Accuracy, Cameras, Benchmark testing, Pipelines, hierarchical representation modeling BibRef

Tian, C.Z.[Chong-Zhen], Li, Z.X.[Zheng-Xin], Yuan, H.[Hui], Hamzaoui, R.[Raouf], Shen, L.Q.[Li-Quan], Kwong, S.[Sam],
Feature Compression for Cloud-Edge Multimodal 3D Object Detection,
PAMI(48), No. 7, July 2026, pp. 8411-8428.
IEEE DOI 2606
Feature extraction, Object detection, Cloud computing, Point cloud compression, Machine vision, Accuracy, Laser radar, diffusion model BibRef

Wang, W.H.[Wei-Hua], Zhang, P.[Peng], Ding, H.N.[Hao-Nan], Pi, D.W.[Da-Wei], Yin, G.D.[Guo-Dong],
Occlusion-Aware Multi-Modal 3D Object Detection via Multi-Stage Cross-Modal Fusion,
IVC(173), 2026, pp. 106048.
Elsevier DOI 2607
3D object detection, Multi-modal data fusion, Autonomous vehicles, Lidar-camera fusion, Deep learning BibRef

Gao, P.[Pan], Fan, Y.L.[Yu-Ling], Ren, S.[Shuai], Ren, X.[Xiwen], Zhang, P.[Ping],
MPCF: Multi-Phase Consolidated Fusion for Multi-Modal 3D Object Detection with Pseudo Point Cloud,
CirSysVideo(36), No. 7, July 2026, pp. 9701-9716.
IEEE DOI Code:
WWW Link. 2607
Feature extraction, Point cloud compression, Laser radar, Image color analysis, Proposals, Object detection, cross attention BibRef


Hegde, D.[Deepti], Lohit, S.[Suhas], Peng, K.C.[Kuan-Chuan], Jones, M.J.[Michael J.], Patel, V.M.[Vishal M.],
Multimodal 3D Object Detection on Unseen Domains,
WAD25(2490-2500)
IEEE DOI 2512
Training, Point cloud compression, Laser radar, Object detection, Detectors, Contrastive learning, Feature extraction, Robustness, autonomous driving BibRef

Cai, H.J.[Hao-Jie], Yin, D.F.[Dong-Fu], Yu, F.R.[Fei Richard], Xiong, S.T.[Si-Ting],
DSTR: Dual Scenes Transformer for Cross-Modal Fusion in 3D Object Detection,
WACV25(3064-3073)
IEEE DOI 2505
Point cloud compression, Laser radar, Aggregates, Redundancy, Pipelines, Object detection, Transformers, Feature extraction, global-fusion BibRef

Kim, S.[Sanmin], Kim, Y.[Youngseok], Hwang, S.[Sihwan], Jeong, H.[Hyeonjun], Kum, D.[Dongsuk],
Labeldistill: Label-guided Cross-modal Knowledge Distillation for Camera-based 3d Object Detection,
ECCV24(LVI: 19-37).
Springer DOI 2412
BibRef

Palladin, E.[Edoardo], Dietze, R.[Roland], Narayanan, P.[Praveen], Bijelic, M.[Mario], Heide, F.[Felix],
Samfusion: Sensor-adaptive Multimodal Fusion for 3d Object Detection in Adverse Weather,
ECCV24(LXI: 484-503).
Springer DOI 2412
BibRef

Lin, Z.X.[Zhen-Xiang], Peng, X.[Xidong], Cong, P.[Peishan], Zheng, G.[Ge], Sun, Y.J.[Yu-Jin], Hou, Y.N.[Yue-Nan], Zhu, X.G.[Xin-Ge], Yang, S.[Sibei], Ma, Y.X.[Yue-Xin],
Wildrefer: 3d Object Localization in Large-scale Dynamic Scenes with Multi-modal Visual Data and Natural Language,
ECCV24(XLVI: 456-473).
Springer DOI 2412
BibRef

Yan, J.J.[Jun-Jie], Liu, Y.F.[Ying-Fei], Sun, J.J.[Jian-Jian], Jia, F.[Fan], Li, S.L.[Shuai-Lin], Wang, T.[Tiancai], Zhang, X.Y.[Xiang-Yu],
Cross Modal Transformer: Towards Fast and Robust 3D Object Detection,
ICCV23(18222-18232)
IEEE DOI Code:
WWW Link. 2401
BibRef

Xie, Y.C.[Yi-Chen], Xu, C.F.[Chen-Feng], Rakotosaona, M.J.[Marie-Julie], Rim, P.[Patrick], Tombari, F.[Federico], Keutzer, K.[Kurt], Tomizuka, M.[Masayoshi], Zhan, W.[Wei],
SparseFusion: Fusing Multi-Modal Sparse Representations for Multi-Sensor 3D Object Detection,
ICCV23(17545-17556)
IEEE DOI Code:
WWW Link. 2401
BibRef

Cai, Q.[Qi], Pan, Y.W.[Ying-Wei], Yao, T.[Ting], Ngo, C.W.[Chong-Wah], Mei, T.[Tao],
ObjectFusion: Multi-modal 3D Object Detection with Object-Centric Fusion,
ICCV23(18021-18030)
IEEE DOI 2401
BibRef

Wang, Z.Y.[Ze-Yu], Li, D.W.[Ding-Wen], Luo, C.X.[Chen-Xu], Xie, C.[Cihang], Yang, X.D.[Xiao-Dong],
DistillBEV: Boosting Multi-Camera 3D Object Detection with Cross-Modal Knowledge Distillation,
ICCV23(8603-8612)
IEEE DOI 2401
BibRef

Zhou, S.C.[Sheng-Chao], Liu, W.Z.[Wei-Zhou], Hu, C.[Chen], Zhou, S.C.[Shu-Chang], Ma, C.[Chao],
UniDistill: A Universal Cross-Modality Knowledge Distillation Framework for 3D Object Detection in Bird's-Eye View,
CVPR23(5116-5125)
IEEE DOI 2309
BibRef

Klingner, M.[Marvin], Borse, S.[Shubhankar], Kumar, V.R.[Varun Ravi], Rezaei, B.[Behnaz], Narayanan, V.[Venkatraman], Yogamani, S.[Senthil], Porikli, F.M.[Fatih M.],
X3KD: Knowledge Distillation Across Modalities, Tasks and Stages for Multi-Camera 3D Object Detection,
CVPR23(13343-13353)
IEEE DOI 2309
BibRef

Chen, Y.T.[Yi-Ting], Shi, J.H.[Jing-Hao], Ye, Z.L.[Ze-Lin], Mertz, C.[Christoph], Ramanan, D.[Deva], Kong, S.[Shu],
Multimodal Object Detection via Probabilistic Ensembling,
ECCV22(IX:139-158).
Springer DOI 2211
BibRef

Chen, Z.[Zehui], Li, Z.Y.[Zhen-Yu], Zhang, S.Q.[Shi-Quan], Fang, L.J.[Liang-Ji], Jiang, Q.H.[Qin-Hong], Zhao, F.[Feng],
Deformable Feature Aggregation for Dynamic Multi-modal 3D Object Detection,
ECCV22(VIII:628-644).
Springer DOI 2211
BibRef

Li, H.[Hao], Zhang, Z.[Zehan], Zhao, X.[Xian], Wang, Y.L.[Yu-Long], Shen, Y.X.[Yu-Xi], Pu, S.L.[Shi-Liang], Mao, H.[Hui],
Enhancing Multi-modal Features Using Local Self-attention for 3D Object Detection,
ECCV22(X:532-549).
Springer DOI 2211
BibRef

Li, X.[Xin], Shi, B.[Botian], Hou, Y.N.[Yue-Nan], Wu, X.J.[Xing-Jiao], Ma, T.L.[Tian-Long], Li, Y.K.[Yi-Kang], He, L.[Liang],
Homogeneous Multi-modal Feature Fusion and Interaction for 3D Object Detection,
ECCV22(XXXVIII:691-707).
Springer DOI 2211
BibRef

Park, W.[Won], Liu, N.[Nan], Chen, Q.A.[Qi Alfred], Mao, Z.M.[Z. Morley],
Sensor Adversarial Traits: Analyzing Robustness of 3D Object Detection Sensor Fusion Models,
ICIP21(484-488)
IEEE DOI 2201
Training, Solid modeling, Analytical models, Laser radar, Object detection, Sensor fusion, Adversarial examples, multimodal, sensor fusion BibRef

Wang, C.W.[Chun-Wei], Ma, C.[Chao], Zhu, M.[Ming], Yang, X.K.[Xiao-Kang],
PointAugmenting: Cross-Modal Augmentation for 3D Object Detection,
CVPR21(11789-11798)
IEEE DOI 2111
Training, Adaptation models, Solid modeling, Laser radar, Object detection, Detectors BibRef

Hu, N.[Nan], Ma, H.M.[Hui-Min], Le, C.[Chao], Shao, X.H.[Xue-Hui],
Multi-Modal Feature Fusion Network for Ghost Imaging Object Detection,
ICIP18(351-355)
IEEE DOI 1809
Only low resolution, depth data. Imaging, Feature extraction, Streaming media, Object detection, BibRef

Chapter on 3-D Object Description and Computation Techniques, Surfaces, Deformable, View Generation, Video Conferencing continues in
Semi-Supervised Object Detection, 3D Object Detection .


Last update:Sep 21, 2026 at 18:29:27