Ming, Y.F.[Yi-Fei],
Li, Y.X.[Yi-Xuan],
How Does Fine-Tuning Impact Out-of-Distribution Detection for
Vision-Language Models?,
IJCV(132), No. 2, February 2024, pp. 596-609.
Springer DOI
2402
BibRef
Zhao, C.R.[Cai-Rong],
Wang, Y.[Yubin],
Jiang, X.Y.[Xin-Yang],
Shen, Y.F.[Yi-Fei],
Song, K.[Kaitao],
Li, D.S.[Dong-Sheng],
Miao, D.Q.[Duo-Qian],
Learning Domain Invariant Prompt for Vision-Language Models,
IP(33), 2024, pp. 1348-1360.
IEEE DOI
2402
Task analysis, Tuning, Training, Adaptation models, Visualization,
Image color analysis, Self-supervised learning, Prompt learning,
domain generalization
BibRef
Zhan, C.L.[Chen-Lu],
Zhang, Y.F.[Yu-Fei],
Lin, Y.[Yu],
Wang, G.A.[Gao-Ang],
Wang, H.W.[Hong-Wei],
UniDCP: Unifying Multiple Medical Vision-Language Tasks via Dynamic
Cross-Modal Learnable Prompts,
MultMed(26), 2024, pp. 9736-9748.
IEEE DOI
2410
Task analysis, Adaptation models, Visualization,
Medical diagnostic imaging, Tuning, Multitasking, Plastics,
cross-modal shareable space
BibRef
Dong, M.P.[Meng-Ping],
Li, F.[Fei],
Li, Z.B.[Zhen-Bo],
Liu, X.[Xue],
Cluster prototype earth mover's distance adapters and
alignment-guided prompt learning for vision-language models,
PR(156), 2024, pp. 110861.
Elsevier DOI
2408
Cluster prototype, Earth mover's distance, Adapter,
Prompt learning, Vision-language models
BibRef
Xuan, S.Y.[Shi-Yu],
Yang, M.[Ming],
Zhang, S.L.[Shi-Liang],
Adapting Vision-Language Models via Learning to Inject Knowledge,
IP(33), 2024, pp. 5798-5809.
IEEE DOI
2410
Feature extraction, Visualization, Adaptation models, Tuning,
Training, Transformers, Dogs, Accuracy, Robustness, Few shot learning,
knowledge injection
BibRef
Zhou, W.[Wenlve],
Zhou, Z.H.[Zhi-Heng],
Unsupervised Domain Adaption Harnessing Vision-Language Pre-Training,
CirSysVideo(34), No. 9, September 2024, pp. 8201-8214.
IEEE DOI Code:
WWW Link.
2410
Adaptation models, Task analysis, Training, Computational modeling, Tuning,
Data models, Visualization, Unsupervised domain adaptation, model deployment
BibRef
Guo, M.H.[Meng-Hao],
Zhang, Y.[Yi],
Mu, T.J.[Tai-Jiang],
Huang, S.X.[Sharon X.],
Hu, S.M.[Shi-Min],
Tuning Vision-Language Models With Multiple Prototypes Clustering,
PAMI(46), No. 12, December 2024, pp. 11186-11199.
IEEE DOI
2411
Prototypes, Adaptation models, Tuning, Visualization,
Benchmark testing, Computational modeling, Data models, clustering
BibRef
Jiang, H.J.[Hao-Jun],
Zhang, J.K.[Jian-Ke],
Huang, R.[Rui],
Ge, C.J.[Chun-Jiang],
Ni, Z.[Zanlin],
Song, S.[Shiji],
Huang, G.[Gao],
Cross-modal adapter for vision-language retrieval,
PR(159), 2025, pp. 111144.
Elsevier DOI
2412
Adapter, Cross-modal interaction, Cross-modal retrieval,
Parameter-efficient training, Multi-modal learning
BibRef
Yang, L.F.[Ling-Feng],
Li, X.[Xiang],
Wang, Y.Z.[Yue-Ze],
Wang, X.L.[Xin-Long],
Yang, J.[Jian],
Fine-Grained Visual Text Prompting,
PAMI(47), No. 3, March 2025, pp. 1594-1609.
IEEE DOI
2502
What kind of visual prompts to add.
Visualization, Semantics, Image segmentation, Crops, Tuning, Detectors,
Proposals, Location awareness, Grounding, Gray-scale, zero-shot
BibRef
Wang, F.[Fan],
Han, Z.Y.[Zhong-Yi],
Liu, X.[Xingbo],
Yin, Y.L.[Yi-Long],
Gao, X.[Xin],
CTPT: Continual Test-time Prompt Tuning for vision-language models,
PR(161), 2025, pp. 111300.
Elsevier DOI
2502
Test-time adaptation,
Contrastive Language-Image Pretraining (CLIP),
Stable self-learning
BibRef
Liang, N.[Nanhao],
Liu, Y.[Yong],
DPO: Discrete Prompt Optimization for Vision-Language Models,
SPLetters(32), 2025, pp. 671-675.
IEEE DOI
2502
Training, Optimization, Adaptation models, Visualization,
Overfitting, Vectors, Vocabulary, Signal processing algorithms,
vision-language model
BibRef
Xu, C.[Chen],
Zhu, Y.H.[Yu-Han],
Shen, H.C.[Hao-Cheng],
Chen, B.H.[Bo-Heng],
Liao, Y.X.[Yi-Xuan],
Chen, X.X.[Xiao-Xin],
Wang, L.M.[Li-Min],
Progressive Visual Prompt Learning with Contrastive Feature
Re-formation,
IJCV(133), No. 2, February 2025, pp. 511-526.
Springer DOI
2502
Adapting the pre-trained Vision-Language Models.
BibRef
Yin, J.H.[Jun-Hui],
Zhang, X.Y.[Xin-Yu],
Wu, L.[Lin],
Wang, X.J.[Xiao-Jie],
Context-aware prompt learning for test-time vision recognition with
frozen vision-language model,
PR(162), 2025, pp. 111359.
Elsevier DOI Code:
WWW Link.
2503
In-context learning, Prompt learning, Vision-language model,
Vision recognition, Test-time adaptation
BibRef
Lu, Z.[Zhihe],
Bai, J.[Jiawang],
Li, X.[Xin],
Xiao, Z.[Zeyu],
Wang, X.C.[Xin-Chao],
Task-to-Instance Prompt Learning for Vision-Language Models at Test
Time,
IP(34), 2025, pp. 1908-1920.
IEEE DOI Code:
WWW Link.
2504
Training, Training data, Visualization, Adaptation models, Learning systems,
Image recognition, Dogs, Vectors, Entropy, task-to-instance
BibRef
Yao, H.T.[Han-Tao],
Zhang, R.[Rui],
Lyu, H.H.[Huai-Hai],
Zhang, Y.D.[Yong-Dong],
Xu, C.S.[Chang-Sheng],
Bi-Modality Individual-Aware Prompt Tuning for Visual-Language Model,
PAMI(47), No. 8, August 2025, pp. 6352-6368.
IEEE DOI
2507
BibRef
Earlier: A1, A2, A5, Only:
TCP: Textual-Based Class-Aware Prompt Tuning for Visual-Language
Model,
CVPR24(23438-23448)
IEEE DOI Code:
WWW Link.
2410
Tuning, Visualization, Training, Adaptation models, Hands,
Feature extraction, Data models, Artificial intelligence,
visual-language model.
Benchmark testing.
BibRef
Hao, Z.W.[Zhi-Wei],
Guo, J.Y.[Jian-Yuan],
Shen, L.[Li],
Luo, Y.[Yong],
Hu, H.[Han],
Wen, Y.G.[Yong-Gang],
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language
Tuning,
IJCV(133), No. 8, August 2025, pp. 5527-5543.
Springer DOI
2508
BibRef
Gao, Y.S.[Yan-Sheng],
Zhu, Z.X.[Zi-Xi],
Wang, S.S.[Sheng-Sheng],
Mixture of coarse and fine-grained prompt tuning for vision-language
model,
PR(170), 2026, pp. 112074.
Elsevier DOI
2509
Prompt learning, Vision-language models,
Coarse domain-shared information,
BibRef
Hao, F.S.[Fu-Sheng],
Liu, L.[Liu],
Wu, F.X.[Fu-Xiang],
Zhang, Q.S.[Qie-Shi],
Cheng, J.[Jun],
Textual Embeddings are Good Class-Aware Visual Prompts for Adapting
Vision-Language Models,
SPLetters(32), 2025, pp. 2992-2996.
IEEE DOI
2509
Visualization, Tuning, Semantics, Harmonic analysis, Accuracy,
Optimization, Artificial intelligence, Vectors, Training, TV,
class-aware visual prompts
BibRef
Liu, J.[Jun],
Lu, Z.Q.[Zi-Qian],
Luo, H.[Hao],
Lu, Z.M.[Zhe-Ming],
Zheng, Y.M.[Yang-Ming],
Progressive Multi-Prompt Learning for Vision-Language Models,
CirSysVideo(35), No. 10, October 2025, pp. 9562-9574.
IEEE DOI Code:
WWW Link.
2510
Visualization, Overfitting, Optimization, Training, Semantics,
Feature extraction, Dogs, Accuracy, Tuning, Transfer learning, few-shot
BibRef
Zhang, E.[Enming],
Zhu, B.[Bingke],
Chen, Y.Y.[Ying-Ying],
Miao, Q.H.[Qing-Hai],
Tang, M.[Ming],
Wang, J.Q.[Jin-Qiao],
Optimization of Prompt Learning via Multi-Knowledge Representation
for Vision-Language Models,
MultMed(27), 2025, pp. 7557-7569.
IEEE DOI
2510
Visualization, Tuning, Training, Birds, Semantics, Image recognition,
Artificial intelligence, Airplanes, Marine vehicles, multi-knowledge
BibRef
Li, J.C.[Jun-Cheng],
Gao, M.[Minghe],
Tang, S.L.[Si-Liang],
Wei, L.H.[Long-Hui],
Xiao, J.[Jun],
Wu, F.[Fei],
Hong, R.C.[Ri-Chang],
Wang, M.[Meng],
Tian, Q.[Qi],
Structure-Induced Gradient Regulation for Generalizable
Vision-Language Models,
PAMI(48), No. 1, January 2026, pp. 219-235.
IEEE DOI
2512
Tuning, Metalearning, Adaptation models, Training, Semantics, Testing,
Visualization, Prototypes, Vectors, Overfitting,
vision-language pre-training models
BibRef
Li, J.C.[Jun-Cheng],
Gao, M.[Minghe],
Wei, L.H.[Long-Hui],
Tang, S.L.[Si-Liang],
Zhang, W.Q.[Wen-Qiao],
Li, M.Z.[Meng-Ze],
Ji, W.[Wei],
Tian, Q.[Qi],
Chua, T.S.[Tat-Seng],
Zhuang, Y.T.[Yue-Ting],
Gradient-Regulated Meta-Prompt Learning for Generalizable
Vision-Language Models,
ICCV23(2551-2562)
IEEE DOI
2401
BibRef
Su, Y.L.[Yu-Ling],
Liu, X.L.[Xue-Liang],
Huang, Z.[Zhen],
Zhao, Y.W.[Yun-Wei],
Hong, R.C.[Ri-Chang],
Wang, M.[Meng],
AttriPrompt: Class Attribute-Aware Prompt Tuning for Vision-Language
Model,
IP(35), 2026, pp. 1395-1407.
IEEE DOI
2602
Tuning, Semantics, Visualization, Adaptation models, Head,
Legged locomotion, Data models, Training, Standards, Prompt tuning,
vision-language models
BibRef
Chen, Y.[Yang],
Fu, S.[Shuai],
Zhang, Y.[Yu],
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models,
MultMed(28), 2026, pp. 1943-1954.
IEEE DOI
2603
Visualization, Vectors, Learning systems, Training data,
Adaptation models, Noise measurement, Knowledge engineering,
vision-language models
BibRef
Liu, X.[Xiukun],
Lan, N.[Ning],
Wei, M.J.[Ming-Jie],
Xie, X.M.[Xue-Mei],
Shi, G.M.[Guang-Ming],
SceneReasoner: Sufficient Embodied Scene Understanding From Limited
Perception by Explicit Functional Association,
CirSysVideo(36), No. 5, May 2026, pp. 6456-6471.
IEEE DOI
2605
Visualization, Cognition, Artificial intelligence, Controllability,
Adaptation models, Videos, Object recognition, Monitoring,
functional attributes
BibRef
Zhao, X.Y.[Xiang-Yu],
Li, X.T.[Xiang-Tai],
Duan, H.D.[Hao-Dong],
Huang, H.[Haian],
Li, Y.[Yining],
Chen, K.[Kai],
Yang, H.[Hua],
MG-LLaVA: Toward Multi-Granularity Visual Instruction Tuning,
CirSysVideo(36), No. 4, April 2026, pp. 4464-4478.
IEEE DOI
2604
Visualization, Large language models, Videos, Benchmark testing,
Feature extraction, Image resolution, Tuning, Object recognition,
visual understanding
BibRef
Zhang, J.M.[Jia-Ming],
Wang, X.[Xin],
Ma, X.J.[Xing-Jun],
Qiu, L.Y.[Ling-Yu],
Jiang, Y.G.[Yu-Gang],
Sang, J.[Jitao],
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust
Vision-Language Models,
PAMI(48), No. 6, June 2026, pp. 6615-6627.
IEEE DOI
2605
Tuning, Transformers, Robustness, Visualization, Purification,
Adaptation models, Vectors, Standards, Distortion,
neural augmentation
BibRef
Wang, X.[Xin],
Chen, K.[Kai],
Zhang, J.M.[Jia-Ming],
Chen, J.J.[Jing-Jing],
Ma, X.J.[Xing-Jun],
TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in
Vision-Language Models,
CVPR25(19910-19920)
IEEE DOI Code:
WWW Link.
2508
Visualization, Accuracy, Scalability, Perturbation methods,
Benchmark testing, Robustness, Entropy, Safety, Tuning,
test-time adversarial prompt tuning
BibRef
Wang, G.Q.[Gui-Qin],
Zhao, P.[Peng],
Wang, X.[Xiang],
Guo, H.R.[Hao-Ran],
Qi, N.[Nan],
Yang, S.[Shusen],
Guo, Q.H.[Qing-Hai],
DHPT: Dual-Modality Heterogeneous Prompt Tuning for Online Test-Time
Adaption in Vision-Language Models,
CirSysVideo(36), No. 6, June 2026, pp. 8590-8601.
IEEE DOI
2606
Visualization, Tuning, Semantics, Noise, Adaptation models, Optimization,
Data models, Calibration, Large language models, large language models
BibRef
Wang, X.X.[Xi-Xi],
Liu, M.[Meilin],
Jiang, B.[Bo],
Tang, J.[Jin],
Luo, B.[Bin],
BHGraphAdapter: Parameter-Efficient VLMs Tuning Meets Hyper-Graph
Learning,
CirSysVideo(36), No. 6, June 2026, pp. 9057-9071.
IEEE DOI Code:
WWW Link.
2606
Adaptation models, Visualization, Tuning, Data models,
Image classification, Computational modeling, Training, Semantics,
hypergraph learning
BibRef
Chung, S.Y.[Sang-Yun],
Yu, Y.J.[Young-Joon],
Kim, S.[Seyeon],
Chee, Y.[Youngchae],
Ro, Y.M.[Yong Man],
Enhanced Vision-Language Models for Diverse Sensor Understanding:
Cost-Efficient Optimization and Benchmarking,
IP(35), 2026, pp. 7444-7459.
IEEE DOI
2607
Modeling, Image sensors, Optimization, Vision sensors, X-rays,
Cognition, Cognitive systems, DNA, Training, Tuning,
vision sensor understanding
BibRef
Zhao, R.F.[Rong-Feng],
Zhou, L.[Li],
Shang, Z.[Zonghan],
Liu, Y.W.[Yi-Wen],
Zhang, Y.[Yugui],
Li, S.[Shuang],
Ning, J.[Jin],
Ning, X.[Xin],
ProMML for robust few-shot adaptation of vision-language models,
PR(180), 2026, pp. 114160.
Elsevier DOI
2608
Vision-language models, Few-shot learning, Prompt learning,
Cross-modal fusion, Domain generalization
BibRef
Dong, C.[Chunru],
Zhang, T.[Tao],
Zhang, F.[Feng],
Hua, Q.[Qiang],
Zhu, J.[Jie],
Zhang, Y.[Yong],
Hierarchical intra-inter modal adaptation for vision-language models,
PR(180), 2026, pp. 114200.
Elsevier DOI Code:
WWW Link.
2608
Vision-language model, Adapter tuning, Few-shot learning, Cross-attention
BibRef
Dong, H.[Hao],
Sheng, L.J.[Li-Jun],
Liang, J.[Jian],
He, R.[Ran],
Chatzi, E.[Eleni],
Fink, O.[Olga],
Adapting Vision-Language Models Without Labels: A Comprehensive Survey,
IJCV(134), No. 8, August 2026, pp. 389.
Springer DOI Code:
WWW Link.
2608
BibRef
Chen, Z.[Zhe],
Wang, W.Y.[Wei-Yun],
Zhu, J.G.[Jin-Guo],
Wang, W.H.[Wen-Hai],
Liu, Y.Z.[Yang-Zhou],
Liu, Z.Y.[Zhao-Yang],
Luo, G.[Gen],
Sun, P.[Peng],
Su, W.J.[Wei-Jie],
Tian, H.[Hao],
Lu, L.W.[Le-Wei],
Zhu, X.[Xizhou],
Lu, T.[Tong],
Lin, D.[Dahua],
Qiao, Y.[Yu],
Dai, J.F.[Ji-Feng],
Revisiting InternVL: A Systematic Technical Framework for Building
Powerful Open-Source Vision-Language Models,
PAMI(48), No. 10, October 2026, pp. 12582-12600.
IEEE DOI
2609
Modeling, Training, Visualization, Large language models, Visual systems,
Videos, Tiles, Cognition, Vision-language model, continual pre-training
BibRef
Mishra, U.[Ujjwal],
Shukla, V.[Vinita],
Hambarde, P.[Praful],
Shukla, A.[Amit],
Improvise, Adapt, Overcome: Telescopic Adapters for Efficient
Fine-tuning of Vision Language Models in Medical Imaging,
WACV26(7605-7615)
IEEE DOI
2609
LoRa, Visible light communication,
Storage area networks, Modulation, Protocols,
medicial image segmentation
BibRef
Lin, X.[Xiang],
Li, W.X.[Wei-Xin],
Guo, S.[Shu],
Wang, L.H.[Li-Hong],
Huang, D.[Di],
GIP: Gated Interaction Prompt for Parameter Efficient Vision-Language
Fine-Tuning,
ICIP25(617-622)
IEEE DOI
2601
Bridges, Visualization, Adaptation models, Computational modeling,
Logic gates, Performance gain, Gating Mechanism
BibRef
Valois, P.H.V.[Pedro H. V.],
Satav, D.[Dipesh],
de Campos, R.A.P.[Rodrigo A. P.],
Pratamasunu, G.Q.O.[Gulpi Q. O.],
Fukui, K.[Kazuhiro],
Vision Language Model Interpretability with Concept Guided Decoding,
ICIP25(397-402)
IEEE DOI
2601
Deep learning, Training, Visualization, Adaptation models,
Analytical models, Toxicology, Systematics, Decoding, Security,
Jailbreak
BibRef
Hao, F.S.[Fu-Sheng],
He, F.X.[Feng-Xiang],
Wu, F.[Fuxiang],
Wang, T.[Tichao],
Song, C.Q.[Cheng-Qun],
Cheng, J.[Jun],
Task-Aware Clustering for Prompting Vision-Language Models,
CVPR25(14745-14755)
IEEE DOI Code:
WWW Link.
2508
Adaptation models, Visualization, Attention mechanisms, Codes,
Interference, Benchmark testing, Optimization, Overfitting
BibRef
Koleilat, T.[Taha],
Asgariandehkordi, H.[Hojat],
Rivaz, H.[Hassan],
Xiao, Y.M.[Yi-Ming],
BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models,
CVPR25(14766-14776)
IEEE DOI Code:
WWW Link.
2508
Representation learning, Adaptation models, Visualization,
Accuracy, Biological system modeling, Semantics,
vision-language models
BibRef
Yang, C.Y.[Chen-Yu],
Dong, X.[Xuan],
Zhu, X.Z.[Xi-Zhou],
Su, W.J.[Wei-Jie],
Wang, J.H.[Jia-Hao],
Tian, H.[Hao],
Chen, Z.[Zhe],
Wang, W.H.[Wen-Hai],
Lu, L.W.[Le-Wei],
Dai, J.F.[Ji-Feng],
PVC: Progressive Visual Token Compression for Unified Image and Video
Processing in Large Vision-Language Models,
CVPR25(24939-24949)
IEEE DOI Code:
WWW Link.
2508
Visualization, Adaptation models, Image coding, Limiting, Redundancy,
Benchmark testing, Encoding, Data mining, Videos
BibRef
Bhattacharjee, S.S.[Subhransu S.],
Campbell, D.[Dylan],
Shome, R.[Rahul],
Believing is Seeing: Unobserved Object Detection using Generative
Models,
CVPR25(19366-19377)
IEEE DOI
2508
Measurement, Training, Solid modeling, Adaptation models,
Visualization, Pipelines, Object detection, Diffusion models,
vision-language models
BibRef
Zhou, W.J.[Wei-Jie],
Tao, M.[Manli],
Zhao, C.Y.[Chao-Yang],
Guo, H.Y.[Hai-Yun],
Dong, H.H.[Hong-Hui],
Tang, M.[Ming],
Wang, J.Q.[Jin-Qiao],
PhysVLM: Enabling Visual Language Models to Understand Robotic
Physical Reachability,
CVPR25(6940-6949)
IEEE DOI
2508
Visualization, Adaptation models, Service robots, Decision making,
Benchmark testing, Cognition, Reliability, Robots, embodied ai, ,
embodied visual reasoning
BibRef
Chen, T.Y.[Tian-Yu],
Fu, X.C.[Xing-Cheng],
Gao, Y.[Yisen],
Qian, H.D.[Hao-Dong],
Wei, Y.[Yuecen],
Yan, K.[Kun],
Zhou, H.Y.[Hao-Yi],
Li, J.X.[Jian-Xin],
Galaxy Walker: Geometry-aware VLMs For Galaxy-scale Understanding,
CVPR25(4112-4121)
IEEE DOI
2508
Space vehicles, Geometry, Training, Adaptation models,
Extraterrestrial phenomena, Estimation, Stars, Vectors,
multi-modal learning
BibRef
Poppi, T.[Tobia],
Kasarla, T.[Tejaswi],
Mettes, P.[Pascal],
Baraldi, L.[Lorenzo],
Cucchiara, R.[Rita],
Hyperbolic Safety-Aware Vision-Language Models,
CVPR25(4222-4232)
IEEE DOI Code:
WWW Link.
2508
Adaptation models, Ethics, Law, Source coding, Robustness, Data models,
Safety, Standards, trustworthy, safety, nsfw, hyperbolic, vision-and-language
BibRef
Yu, C.[Chong],
Chen, T.[Tao],
Gan, Z.X.[Zhong-Xue],
Once-Tuning-Multiple-Variants: Tuning Once and Expanded as Multiple
Vision-Language Model Variants,
CVPR25(14712-14722)
IEEE DOI
2508
Training, Adaptation models, Accuracy, Tensors, Memory management,
Hardware, Model compression, Tuning, Optimization, dynamic expansion capability
BibRef
Chen, J.H.[Jiu-Hai],
Yang, J.W.[Jian-Wei],
Wu, H.P.[Hai-Ping],
Li, D.Q.[Dian-Qi],
Gao, J.F.[Jian-Feng],
Zhou, T.Y.[Tian-Yi],
Xiao, B.[Bin],
Florence-VL: Enhancing Vision-Language Models with Generative Vision
Encoder and Depth-Breadth Fusion,
CVPR25(24928-24938)
IEEE DOI Code:
WWW Link.
2508
Training, Visualization, Statistical analysis,
Computational modeling, Optical character recognition, Tuning
BibRef
Zhu, B.[Beier],
Cui, J.[Jiequan],
Zhang, H.W.[Han-Wang],
Zhang, C.[Chi],
Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness,
CVPR25(25487-25496)
IEEE DOI
2508
Training, Correlation, Foundation models, Null space, Robustness,
Probes, Faces, group robustness, vision-language models
BibRef
Li, H.Y.[Hao-Yang],
Wang, L.[Liang],
Wang, C.[Chao],
Jiang, J.[Jing],
Peng, Y.[Yan],
Long, G.D.[Guo-Dong],
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models,
CVPR25(25623-25632)
IEEE DOI Code:
WWW Link.
2508
Codes, Semantic segmentation, Collaboration, Cloning,
Object detection, Vectors, Optimization, Tuning, prompt tuning,
multi-modal learning
BibRef
Zhang, Y.[Yi],
Deng, Y.X.[Yi-Xuan],
Guo, M.H.[Meng-Hao],
Hu, S.M.[Shi-Min],
Adaptive Parameter Selection for Tuning Vision-Language Models,
CVPR25(4280-4290)
IEEE DOI
2508
Adaptation models, Adaptive learning, Manuals, Benchmark testing,
Performance gain, Flowering plants, Tuning, Overfitting
BibRef
Deitke, M.[Matt],
Clark, C.[Christopher],
Lee, S.H.[Sang-Ho],
Tripathi, R.[Rohun],
Yang, Y.[Yue],
Park, J.S.[Jae Sung],
Salehi, M.[Mohammadreza],
Muennighoff, N.[Niklas],
Lo, K.[Kyle],
Soldaini, L.[Luca],
Lu, J.[Jiasen],
Anderson, T.[Taira],
Bransom, E.[Erin],
Ehsani, K.[Kiana],
Ngo, H.[Huong],
Chen, Y.[YenSung],
Patel, A.[Ajay],
Yatskar, M.[Mark],
Callison-Burch, C.[Chris],
Head, A.[Andrew],
Hendrix, R.[Rose],
Bastani, F.[Favyen],
VanderBilt, E.[Eli],
Lambert, N.[Nathan],
Chou, Y.[Yvonne],
Chheda, A.[Arnavi],
Sparks, J.[Jenna],
Skjonsberg, S.[Sam],
Schmitz, M.[Michael],
Sarnat, A.[Aaron],
Bischoff, B.[Byron],
Walsh, P.[Pete],
Newell, C.[Chris],
Wolters, P.[Piper],
Gupta, T.[Tanmay],
Zeng, K.H.[Kuo-Hao],
Borchardt, J.[Jon],
Groeneveld, D.[Dirk],
Nam, C.[Crystal],
Lebrecht, S.[Sophie],
Wittlif, C.[Caitlin],
Schoenick, C.[Carissa],
Michel, O.[Oscar],
Krishna, R.[Ranjay],
Weihs, L.[Luca],
Smith, N.A.[Noah A.],
Hajishirzi, H.[Hannaneh],
Girshick, R.[Ross],
Farhadi, A.[Ali],
Kembhavi, A.[Aniruddha],
Molmo and PixMo: Open Weights and Open Data for State-of-the-Art
Vision-Language Models,
CVPR25(91-104)
IEEE DOI Code:
WWW Link.
2508
Award, CVPR, Paper HM. Training, Source coding, Computational modeling, Pipelines,
Training data, Data models, Open data, Synthetic data,
visual instruction tuning
BibRef
Lee, B.K.[Byung-Kwan],
Hachiuma, R.[Ryo],
Wang, Y.C.A.F.[Yu-Chi-Ang Frank],
Ro, Y.M.[Yong Man],
Wu, Y.H.[Yueh-Hua],
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision
Language Models,
CVPR25(29545-29557)
IEEE DOI
2508
Training, Performance evaluation, Visualization,
Computational modeling, Natural languages, Merging, Tuning
BibRef
Sun, J.C.[Jing-Chen],
Sharma, R.[Rohan],
Lokhande, V.S.[Vishnu Suresh],
Chen, C.Y.[Chang-You],
Cross-Modal Feature Alignment and MMD Improve Robustness of Prompt
Tuning,
WACV25(4714-4724)
IEEE DOI
2505
Training, Adaptation models, Visualization, Codes, Computational modeling,
Stochastic processes, Robustness, Tuning, vision-language model
BibRef
Imam, R.[Raza],
Gani, H.[Hanan],
Huzaifa, M.[Muhammad],
Nandakumar, K.[Karthik],
Test-Time Low Rank Adaptation via Confidence Maximization for
Zero-Shot Generalization of Vision-Language Models,
WACV25(5449-5459)
IEEE DOI Code:
WWW Link.
2505
Adaptation models, Visualization, Codes, Large language models,
Transformers, Entropy, Tuning, Optimization
BibRef
Talemi, N.A.[Niloufar Alipour],
Kashiani, H.[Hossein],
Afghah, F.[Fatemeh],
Style-Pro: Style-Guided Prompt Learning for Generalizable
Vision-Language Models,
WACV25(6207-6216)
IEEE DOI
2505
Adaptation models, Image recognition, Computational modeling,
Benchmark testing, Data models, Robustness, Overfitting,
style shift learning
BibRef
Westfechtel, T.[Thomas],
Zhang, D.[Dexuan],
Harada, T.[Tatsuya],
Combining Inherent Knowledge of Vision-Language Models with
Unsupervised Domain Adaptation Through Strong-Weak Guidance,
WACV25(6528-6537)
IEEE DOI
2505
Adaptation models, Accuracy, Predictive models, Benchmark testing,
Prediction algorithms, Labeling
BibRef
Ali, E.[Eman],
Silva, S.[Sathira],
Khan, M.H.[Muhammad Haris],
DPA: Dual Prototypes Alignment for Unsupervised Adaptation of
Vision-Language Models,
WACV25(6083-6093)
IEEE DOI
2505
Training, Adaptation models, Visualization, Accuracy, Prototypes,
Data models, Noise measurement, Image classification
BibRef
Zhang, C.[Ce],
Stepputtis, S.[Simon],
Sycara, K.[Katia],
Xie, Y.Q.[Ya-Qi],
Enhancing Vision-Language Few-Shot Adaptation with Negative Learning,
WACV25(5905-5915)
IEEE DOI Code:
WWW Link.
2505
Adaptation models, Codes, Accuracy, Computational modeling, Noise,
Transforms, Computational efficiency, Noise measurement, Few shot learning
BibRef
Yang, Y.T.[Yan-Ting],
Chen, M.H.[Ming-Hao],
Qiu, Q.[Qibo],
Wu, J.H.[Jia-Hao],
Wang, W.X.[Wen-Xiao],
Lin, B.B.[Bin-Bin],
Guan, Z.Y.[Zi-Yu],
He, X.F.[Xiao-Fei],
Adapt2reward: Adapting Video-language Models to Generalizable Robotic
Rewards via Failure Prompts,
ECCV24(LVII: 163-180).
Springer DOI
2412
BibRef
Adhikari, R.[Rabin],
Thapaliya, S.[Safal],
Dhakal, M.[Manish],
Khanal, B.[Bishesh],
Tunevlseg: Prompt Tuning Benchmark for Vision-language Segmentation
Models,
ACCV24(III: 44-62).
Springer DOI
2412
BibRef
Zhang, J.M.[Jia-Ming],
Ma, X.J.[Xing-Jun],
Wang, X.[Xin],
Qiu, L.Y.[Ling-Yu],
Wang, J.Q.[Jia-Qi],
Jiang, Y.G.[Yu-Gang],
Sang, J.[Jitao],
Adversarial Prompt Tuning for Vision-language Models,
ECCV24(XLV: 56-72).
Springer DOI
2412
BibRef
Wu, G.[Ge],
Zhang, X.[Xin],
Li, Z.[Zheng],
Chen, Z.W.[Zhao-Wei],
Liang, J.J.[Jia-Jun],
Yang, J.[Jian],
Li, X.[Xiang],
Cascade Prompt Learning for Vision-language Model Adaptation,
ECCV24(L: 304-321).
Springer DOI
2412
BibRef
Han, J.[Jinwei],
Lin, Z.W.[Zhi-Wen],
Sun, Z.Y.[Zhong-Yisun],
Gao, Y.G.[Ying-Guo],
Yan, K.[Ke],
Ding, S.H.[Shou-Hong],
Gao, Y.[Yuan],
Xia, G.S.[Gui-Song],
Anchor-based Robust Finetuning of Vision-Language Models,
CVPR24(26909-26918)
IEEE DOI
2410
Image recognition, Zero-shot learning, Semantics,
Benchmark testing, Anchor, Robust Finetuning
BibRef
Wu, T.Y.[Tz-Ying],
Ho, C.H.[Chih-Hui],
Vasconcelos, N.M.[Nuno M.],
ProTeCt: Prompt Tuning for Taxonomic Open Set Classification,
CVPR24(16531-16540)
IEEE DOI Code:
WWW Link.
2410
Measurement, Training, Frequency modulation, Accuracy, Taxonomy,
Semantics, Hierarchical Classification, Visual-language foundation model
BibRef
Zhang, Y.B.[Ya-Bin],
Zhu, W.J.[Wen-Jie],
Tang, H.[Hui],
Ma, Z.Y.[Zhi-Yuan],
Zhou, K.Y.[Kai-Yang],
Zhang, L.[Lei],
Dual Memory Networks: A Versatile Adaptation Approach for
Vision-Language Models,
CVPR24(28718-28728)
IEEE DOI Code:
WWW Link.
2410
Training, Knowledge engineering, Adaptation models, Codes,
Training data, Data models, Vision-language models,
versatile adaptation
BibRef
Guo, Y.C.[Yun-Cheng],
Gu, X.D.[Xiao-Dong],
JoAPR: Cleaning the Lens of Prompt Learning for Vision-Language
Models,
CVPR24(28695-28705)
IEEE DOI
2410
Adaptation models, Adaptive systems, Noise, Manuals, Robustness,
Noise measurement,
prompt learning
BibRef
Cao, Q.L.[Qing-Long],
Zheng-Qin, X.,
Chen, Y.T.[Yun-Tian],
Chao, M.,
Yang, X.K.[Xiao-Kang],
Domain Prompt Learning with Quaternion Networks,
CVPR24(26627-26636)
IEEE DOI Code:
WWW Link.
2410
Knowledge engineering, Adaptation models, Codes, Quaternions,
Face recognition, Contrastive learning, vision-language models,
quaternion networks
BibRef
Zanella, M.[Maxime],
Fuchs, C.[Clément],
de Vleeschouwer, C.[Christophe],
Ayed, I.B.[Ismail Ben],
Realistic Test-Time Adaptation of Vision-Language Models,
CVPR25(25103-25112)
IEEE DOI Code:
WWW Link.
2508
BibRef
And: A2, A1, A3, Only:
Online Gaussian Test-Time Adaptation of Vision-Language Models,
MULA25(128-137)
IEEE DOI Code:
WWW Link.
2512
Adaptation models, Codes, Predictive models, Performance gain,
Robustness, vision-language, test-time adaptation,
regularized maximum likelihood estimation.
Measurement, Visualization, Accuracy, Protocols,
Limiting, Predictive models, Data models, Mathematical models, CLIP
BibRef
Zanella, M.[Maxime],
Ayed, I.B.[Ismail Ben],
On the Test-Time Zero-Shot Generalization of Vision-Language Models:
Do we Really need Prompt Learning?,
CVPR24(23783-23793)
IEEE DOI
2410
Training, Systematics, Computational modeling, Quality assessment,
Computational efficiency, vision-language,
training-free
BibRef
Yang, S.Q.[Sen-Qiao],
Tian, Z.T.[Zhuo-Tao],
Jiang, L.[Li],
Jia, J.Y.[Jia-Ya],
Unified Language-Driven Zero-Shot Domain Adaptation,
CVPR24(23407-23415)
IEEE DOI
2410
Representation learning, Adaptation models, Visualization,
Correlation, Scalability, Computational modeling,
Vision-Language Model
BibRef
Chen, Y.F.[Yi-Fei],
Chen, D.P.[Da-Peng],
Liu, R.J.[Rui-Jin],
Zhou, S.[Sai],
Xue, W.Y.[Wen-Yuan],
Peng, W.[Wei],
Align Before Adapt: Leveraging Entity-to-Region Alignments for
Generalizable Video Action Recognition,
CVPR24(18688-18698)
IEEE DOI
2410
Representation learning, Adaptation models, Visualization, Semantics,
Transformers, Vectors, Video action recognition, visual-language model
BibRef
Kahatapitiya, K.[Kumara],
Arnab, A.[Anurag],
Nagran, A.[Arsha],
Ryoo, M.S.[Michael S.],
VicTR: Video-conditioned Text Representations for Activity
Recognition,
CVPR24(18547-18558)
IEEE DOI
2410
Training, Visualization, Adaptation models, Semantics, Focusing,
Benchmark testing, Vision-language models, Activity Recognition,
Video-conditioned Text
BibRef
Huang, C.Q.[Chao-Qin],
Jiang, A.[Aofan],
Feng, J.H.[Jing-Hao],
Zhang, Y.[Ya],
Wang, X.C.[Xin-Chao],
Wang, Y.F.[Yan-Feng],
Adapting Visual-Language Models for Generalizable Anomaly Detection
in Medical Images,
CVPR24(11375-11385)
IEEE DOI Code:
WWW Link.
2410
Training, Adaptation models, Image segmentation, Visualization,
Source coding, Semantics, Anomaly Detection, Medical Images
BibRef
Bang, J.[Jihwan],
Ahn, S.[Sumyeong],
Lee, J.G.[Jae-Gil],
Active Prompt Learning in Vision Language Models,
CVPR24(26994-27004)
IEEE DOI Code:
WWW Link.
2410
Learning systems, Adaptation models, Codes, Sampling methods, Labeling
BibRef
Khandelwal, A.[Anant],
PromptSync: Bridging Domain Gaps in Vision-Language Models through
Class-Aware Prototype Alignment and Discrimination,
ZeroShot24(7819-7828)
IEEE DOI
2410
Adaptation models, Computational modeling, Prototypes,
Contrastive learning, Benchmark testing, Robustness
BibRef
Hirohashi, Y.[Yuki],
Hirakawa, T.[Tsubasa],
Yamashita, T.[Takayoshi],
Fujiyoshi, H.[Hironobu],
Prompt Learning with One-Shot Setting based Feature Space Analysis in
Vision-and-Language Models,
ZeroShot24(7761-7770)
IEEE DOI
2410
Learning systems, Analytical models, Adaptation models,
Image resolution, Accuracy, Vision-and-Language Model, Prompt Learning
BibRef
Karmanov, A.[Adilbek],
Guan, D.[Dayan],
Lu, S.J.[Shi-Jian],
El Saddik, A.[Abdulmotaleb],
Xing, E.[Eric],
Efficient Test-Time Adaptation of Vision-Language Models,
CVPR24(14162-14171)
IEEE DOI Code:
WWW Link.
2410
Adaptation models, Codes, Computational modeling, Noise,
Predictive models, Benchmark testing
BibRef
Zhao, Y.[Yue],
Zhao, L.[Long],
Zhou, X.Y.[Xing-Yi],
Wu, J.L.[Jia-Lin],
Chu, C.T.[Chun-Te],
Miao, H.[Hui],
Schroff, F.[Florian],
Adam, H.[Hartwig],
Liu, T.[Ting],
Gong, B.Q.[Bo-Qing],
Krähenbühl, P.[Philipp],
Yuan, L.Z.[Liang-Zhe],
Distilling Vision-Language Models on Millions of Videos,
CVPR24(13106-13116)
IEEE DOI
2410
Adaptation models, Computational modeling, Benchmark testing,
Data models, Text to video
BibRef
Hu, Y.S.[Yu-Shi],
Stretcu, O.[Otilia],
Lu, C.T.[Chun-Ta],
Viswanathan, K.[Krishnamurthy],
Hata, K.[Kenji],
Luo, E.[Enming],
Krishna, R.[Ranjay],
Fuxman, A.[Ariel],
Visual Program Distillation: Distilling Tools and Programmatic
Reasoning into Vision-Language Models,
CVPR24(9590-9601)
IEEE DOI
2410
Visualization, Adaptation models, Computational modeling,
Instruments, Loading, Music, Cognition, vision-language model,
tools
BibRef
Zanella, M.[Maxime],
Fuchs, C.[Clément],
Ben Ayed, I.[Ismail],
de Vleeschouwer, C.[Christophe],
Vocabulary-Free Few-Shot Learning for Vision-Language Models,
MULA25(149-158)
IEEE DOI Code:
WWW Link.
2512
Adaptation models, Visualization, Computational modeling,
Semantics, Computational efficiency, Few shot learning, prompts
BibRef
Silva-Rodríguez, J.[Julio],
Hajimiri, S.[Sina],
Ben Ayed, I.[Ismail],
Dolz, J.[Jose],
A Closer Look at the Few-Shot Adaptation of Large Vision-Language
Models,
CVPR24(23681-23690)
IEEE DOI Code:
WWW Link.
2410
Adaptation models, Codes, Computational modeling,
Transfer learning, Probes
BibRef
Zanella, M.[Maxime],
Ben Ayed, I.[Ismail],
Low-Rank Few-Shot Adaptation of Vision-Language Models,
Prompting24(1593-1603)
IEEE DOI
2410
Training, Adaptation models, Design methodology,
Few shot learning, Vision-Language, few-shot,
adapter
BibRef
Shen, S.[Sheng],
Yang, S.[Shijia],
Zhang, T.J.[Tian-Jun],
Zhai, B.[Bohan],
Gonzalez, J.E.[Joseph E.],
Keutzer, K.[Kurt],
Darrell, T.J.[Trevor J.],
Multitask Vision-Language Prompt Tuning,
WACV24(5644-5655)
IEEE DOI
2404
Learning systems, Visualization, Adaptation models,
Benchmark testing, Vectors, Task analysis, Algorithms,
Vision + language and/or other modalities
BibRef
Lin, W.[Wei],
Mirza, M.J.[Muhammad Jehanzeb],
Doveh, S.[Sivan],
Feris, R.[Rogerio],
Giryes, R.[Raja],
Hochreiter, S.[Sepp],
Karlinsky, L.[Leonid],
Comparison Visual Instruction Tuning,
Reasoning25(2964-2974)
IEEE DOI
2512
Visualization, Solid modeling, Large language models,
Benchmark testing, Cognition, Tuning, Anomaly detection,
visual instruction tuning
BibRef
Hu, Z.Y.[Zi-Yuan],
Li, Y.Y.[Yan-Yang],
Lyu, M.R.[Michael R.],
Wang, L.W.[Li-Wei],
VL-PET: Vision-and-Language Parameter-Efficient Tuning via
Granularity Control,
ICCV23(2998-3008)
IEEE DOI Code:
WWW Link.
2401
BibRef
Wu, C.E.[Cheng-En],
Tian, Y.[Yu],
Yu, H.C.[Hai-Chao],
Wang, H.[Heng],
Morgado, P.[Pedro],
Hu, Y.H.[Yu Hen],
Yang, L.J.[Lin-Jie],
Why Is Prompt Tuning for Vision-Language Models Robust to Noisy
Labels?,
ICCV23(15442-15451)
IEEE DOI Code:
WWW Link.
2401
BibRef
Ouali, Y.[Yassine],
Bulat, A.[Adrian],
Matinez, B.[Brais],
Tzimiropoulos, G.[Georgios],
Black Box Few-Shot Adaptation for Vision-Language models,
ICCV23(15488-15500)
IEEE DOI Code:
WWW Link.
2401
BibRef
Kan, B.[Baoshuo],
Wang, T.[Teng],
Lu, W.P.[Wen-Peng],
Zhen, X.T.[Xian-Tong],
Guan, W.[Weili],
Zheng, F.[Feng],
Knowledge-Aware Prompt Tuning for Generalizable Vision-Language
Models,
ICCV23(15624-15634)
IEEE DOI
2401
BibRef
Cho, E.[Eulrang],
Kim, J.[Jooyeon],
Kim, H.W.J.[Hyun-Woo J.],
Distribution-Aware Prompt Tuning for Vision-Language Models,
ICCV23(21947-21956)
IEEE DOI Code:
WWW Link.
2401
BibRef
Varma, M.[Maya],
Delbrouck, J.B.[Jean-Benoit],
Hooper, S.[Sarah],
Chaudhari, A.[Akshay],
Langlotz, C.[Curtis],
ViLLA: Fine-Grained Vision-Language Representation Learning from
Real-World Data,
ICCV23(22168-22178)
IEEE DOI
2401
BibRef
Upadhyay, U.[Uddeshya],
Karthik, S.[Shyamgopal],
Mancini, M.[Massimiliano],
Akata, Z.[Zeynep],
ProbVLM: Probabilistic Adapter for Frozen Vison-Language Models,
ICCV23(1899-1910)
IEEE DOI Code:
WWW Link.
2401
BibRef
Chapter on Implementations and Applications, Databases, QBIC, Video Analysis, Hardware and Software, Inspection continues in
Attacks on Vision-Language Models .