20.4.3.4.1 Tuning Vision-Language Models, Adapting Models

Chapter Contents (Back)
Vision Language Model. Vision-Language Model. Refining Models. Adapting Models.

Ming, Y.F.[Yi-Fei], Li, Y.X.[Yi-Xuan],
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?,
IJCV(132), No. 2, February 2024, pp. 596-609.
Springer DOI 2402
BibRef

Zhao, C.R.[Cai-Rong], Wang, Y.[Yubin], Jiang, X.Y.[Xin-Yang], Shen, Y.F.[Yi-Fei], Song, K.[Kaitao], Li, D.S.[Dong-Sheng], Miao, D.Q.[Duo-Qian],
Learning Domain Invariant Prompt for Vision-Language Models,
IP(33), 2024, pp. 1348-1360.
IEEE DOI 2402
Task analysis, Tuning, Training, Adaptation models, Visualization, Image color analysis, Self-supervised learning, Prompt learning, domain generalization BibRef

Zhan, C.L.[Chen-Lu], Zhang, Y.F.[Yu-Fei], Lin, Y.[Yu], Wang, G.A.[Gao-Ang], Wang, H.W.[Hong-Wei],
UniDCP: Unifying Multiple Medical Vision-Language Tasks via Dynamic Cross-Modal Learnable Prompts,
MultMed(26), 2024, pp. 9736-9748.
IEEE DOI 2410
Task analysis, Adaptation models, Visualization, Medical diagnostic imaging, Tuning, Multitasking, Plastics, cross-modal shareable space BibRef

Dong, M.P.[Meng-Ping], Li, F.[Fei], Li, Z.B.[Zhen-Bo], Liu, X.[Xue],
Cluster prototype earth mover's distance adapters and alignment-guided prompt learning for vision-language models,
PR(156), 2024, pp. 110861.
Elsevier DOI 2408
Cluster prototype, Earth mover's distance, Adapter, Prompt learning, Vision-language models BibRef

Xuan, S.Y.[Shi-Yu], Yang, M.[Ming], Zhang, S.L.[Shi-Liang],
Adapting Vision-Language Models via Learning to Inject Knowledge,
IP(33), 2024, pp. 5798-5809.
IEEE DOI 2410
Feature extraction, Visualization, Adaptation models, Tuning, Training, Transformers, Dogs, Accuracy, Robustness, Few shot learning, knowledge injection BibRef

Zhou, W.[Wenlve], Zhou, Z.H.[Zhi-Heng],
Unsupervised Domain Adaption Harnessing Vision-Language Pre-Training,
CirSysVideo(34), No. 9, September 2024, pp. 8201-8214.
IEEE DOI Code:
WWW Link. 2410
Adaptation models, Task analysis, Training, Computational modeling, Tuning, Data models, Visualization, Unsupervised domain adaptation, model deployment BibRef

Guo, M.H.[Meng-Hao], Zhang, Y.[Yi], Mu, T.J.[Tai-Jiang], Huang, S.X.[Sharon X.], Hu, S.M.[Shi-Min],
Tuning Vision-Language Models With Multiple Prototypes Clustering,
PAMI(46), No. 12, December 2024, pp. 11186-11199.
IEEE DOI 2411
Prototypes, Adaptation models, Tuning, Visualization, Benchmark testing, Computational modeling, Data models, clustering BibRef

Jiang, H.J.[Hao-Jun], Zhang, J.K.[Jian-Ke], Huang, R.[Rui], Ge, C.J.[Chun-Jiang], Ni, Z.[Zanlin], Song, S.[Shiji], Huang, G.[Gao],
Cross-modal adapter for vision-language retrieval,
PR(159), 2025, pp. 111144.
Elsevier DOI 2412
Adapter, Cross-modal interaction, Cross-modal retrieval, Parameter-efficient training, Multi-modal learning BibRef

Yang, L.F.[Ling-Feng], Li, X.[Xiang], Wang, Y.Z.[Yue-Ze], Wang, X.L.[Xin-Long], Yang, J.[Jian],
Fine-Grained Visual Text Prompting,
PAMI(47), No. 3, March 2025, pp. 1594-1609.
IEEE DOI 2502
What kind of visual prompts to add. Visualization, Semantics, Image segmentation, Crops, Tuning, Detectors, Proposals, Location awareness, Grounding, Gray-scale, zero-shot BibRef

Wang, F.[Fan], Han, Z.Y.[Zhong-Yi], Liu, X.[Xingbo], Yin, Y.L.[Yi-Long], Gao, X.[Xin],
CTPT: Continual Test-time Prompt Tuning for vision-language models,
PR(161), 2025, pp. 111300.
Elsevier DOI 2502
Test-time adaptation, Contrastive Language-Image Pretraining (CLIP), Stable self-learning BibRef

Liang, N.[Nanhao], Liu, Y.[Yong],
DPO: Discrete Prompt Optimization for Vision-Language Models,
SPLetters(32), 2025, pp. 671-675.
IEEE DOI 2502
Training, Optimization, Adaptation models, Visualization, Overfitting, Vectors, Vocabulary, Signal processing algorithms, vision-language model BibRef

Xu, C.[Chen], Zhu, Y.H.[Yu-Han], Shen, H.C.[Hao-Cheng], Chen, B.H.[Bo-Heng], Liao, Y.X.[Yi-Xuan], Chen, X.X.[Xiao-Xin], Wang, L.M.[Li-Min],
Progressive Visual Prompt Learning with Contrastive Feature Re-formation,
IJCV(133), No. 2, February 2025, pp. 511-526.
Springer DOI 2502
Adapting the pre-trained Vision-Language Models. BibRef

Yin, J.H.[Jun-Hui], Zhang, X.Y.[Xin-Yu], Wu, L.[Lin], Wang, X.J.[Xiao-Jie],
Context-aware prompt learning for test-time vision recognition with frozen vision-language model,
PR(162), 2025, pp. 111359.
Elsevier DOI Code:
WWW Link. 2503
In-context learning, Prompt learning, Vision-language model, Vision recognition, Test-time adaptation BibRef

Lu, Z.[Zhihe], Bai, J.[Jiawang], Li, X.[Xin], Xiao, Z.[Zeyu], Wang, X.C.[Xin-Chao],
Task-to-Instance Prompt Learning for Vision-Language Models at Test Time,
IP(34), 2025, pp. 1908-1920.
IEEE DOI Code:
WWW Link. 2504
Training, Training data, Visualization, Adaptation models, Learning systems, Image recognition, Dogs, Vectors, Entropy, task-to-instance BibRef

Yao, H.T.[Han-Tao], Zhang, R.[Rui], Lyu, H.H.[Huai-Hai], Zhang, Y.D.[Yong-Dong], Xu, C.S.[Chang-Sheng],
Bi-Modality Individual-Aware Prompt Tuning for Visual-Language Model,
PAMI(47), No. 8, August 2025, pp. 6352-6368.
IEEE DOI 2507
BibRef
Earlier: A1, A2, A5, Only:
TCP: Textual-Based Class-Aware Prompt Tuning for Visual-Language Model,
CVPR24(23438-23448)
IEEE DOI Code:
WWW Link. 2410
Tuning, Visualization, Training, Adaptation models, Hands, Feature extraction, Data models, Artificial intelligence, visual-language model. Benchmark testing. BibRef

Hao, Z.W.[Zhi-Wei], Guo, J.Y.[Jian-Yuan], Shen, L.[Li], Luo, Y.[Yong], Hu, H.[Han], Wen, Y.G.[Yong-Gang],
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning,
IJCV(133), No. 8, August 2025, pp. 5527-5543.
Springer DOI 2508
BibRef

Gao, Y.S.[Yan-Sheng], Zhu, Z.X.[Zi-Xi], Wang, S.S.[Sheng-Sheng],
Mixture of coarse and fine-grained prompt tuning for vision-language model,
PR(170), 2026, pp. 112074.
Elsevier DOI 2509
Prompt learning, Vision-language models, Coarse domain-shared information, BibRef

Hao, F.S.[Fu-Sheng], Liu, L.[Liu], Wu, F.X.[Fu-Xiang], Zhang, Q.S.[Qie-Shi], Cheng, J.[Jun],
Textual Embeddings are Good Class-Aware Visual Prompts for Adapting Vision-Language Models,
SPLetters(32), 2025, pp. 2992-2996.
IEEE DOI 2509
Visualization, Tuning, Semantics, Harmonic analysis, Accuracy, Optimization, Artificial intelligence, Vectors, Training, TV, class-aware visual prompts BibRef

Liu, J.[Jun], Lu, Z.Q.[Zi-Qian], Luo, H.[Hao], Lu, Z.M.[Zhe-Ming], Zheng, Y.M.[Yang-Ming],
Progressive Multi-Prompt Learning for Vision-Language Models,
CirSysVideo(35), No. 10, October 2025, pp. 9562-9574.
IEEE DOI Code:
WWW Link. 2510
Visualization, Overfitting, Optimization, Training, Semantics, Feature extraction, Dogs, Accuracy, Tuning, Transfer learning, few-shot BibRef

Zhang, E.[Enming], Zhu, B.[Bingke], Chen, Y.Y.[Ying-Ying], Miao, Q.H.[Qing-Hai], Tang, M.[Ming], Wang, J.Q.[Jin-Qiao],
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models,
MultMed(27), 2025, pp. 7557-7569.
IEEE DOI 2510
Visualization, Tuning, Training, Birds, Semantics, Image recognition, Artificial intelligence, Airplanes, Marine vehicles, multi-knowledge BibRef

Li, J.C.[Jun-Cheng], Gao, M.[Minghe], Tang, S.L.[Si-Liang], Wei, L.H.[Long-Hui], Xiao, J.[Jun], Wu, F.[Fei], Hong, R.C.[Ri-Chang], Wang, M.[Meng], Tian, Q.[Qi],
Structure-Induced Gradient Regulation for Generalizable Vision-Language Models,
PAMI(48), No. 1, January 2026, pp. 219-235.
IEEE DOI 2512
Tuning, Metalearning, Adaptation models, Training, Semantics, Testing, Visualization, Prototypes, Vectors, Overfitting, vision-language pre-training models BibRef

Li, J.C.[Jun-Cheng], Gao, M.[Minghe], Wei, L.H.[Long-Hui], Tang, S.L.[Si-Liang], Zhang, W.Q.[Wen-Qiao], Li, M.Z.[Meng-Ze], Ji, W.[Wei], Tian, Q.[Qi], Chua, T.S.[Tat-Seng], Zhuang, Y.T.[Yue-Ting],
Gradient-Regulated Meta-Prompt Learning for Generalizable Vision-Language Models,
ICCV23(2551-2562)
IEEE DOI 2401
BibRef

Su, Y.L.[Yu-Ling], Liu, X.L.[Xue-Liang], Huang, Z.[Zhen], Zhao, Y.W.[Yun-Wei], Hong, R.C.[Ri-Chang], Wang, M.[Meng],
AttriPrompt: Class Attribute-Aware Prompt Tuning for Vision-Language Model,
IP(35), 2026, pp. 1395-1407.
IEEE DOI 2602
Tuning, Semantics, Visualization, Adaptation models, Head, Legged locomotion, Data models, Training, Standards, Prompt tuning, vision-language models BibRef

Chen, Y.[Yang], Fu, S.[Shuai], Zhang, Y.[Yu],
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models,
MultMed(28), 2026, pp. 1943-1954.
IEEE DOI 2603
Visualization, Vectors, Learning systems, Training data, Adaptation models, Noise measurement, Knowledge engineering, vision-language models BibRef

Liu, X.[Xiukun], Lan, N.[Ning], Wei, M.J.[Ming-Jie], Xie, X.M.[Xue-Mei], Shi, G.M.[Guang-Ming],
SceneReasoner: Sufficient Embodied Scene Understanding From Limited Perception by Explicit Functional Association,
CirSysVideo(36), No. 5, May 2026, pp. 6456-6471.
IEEE DOI 2605
Visualization, Cognition, Artificial intelligence, Controllability, Adaptation models, Videos, Object recognition, Monitoring, functional attributes BibRef

Zhao, X.Y.[Xiang-Yu], Li, X.T.[Xiang-Tai], Duan, H.D.[Hao-Dong], Huang, H.[Haian], Li, Y.[Yining], Chen, K.[Kai], Yang, H.[Hua],
MG-LLaVA: Toward Multi-Granularity Visual Instruction Tuning,
CirSysVideo(36), No. 4, April 2026, pp. 4464-4478.
IEEE DOI 2604
Visualization, Large language models, Videos, Benchmark testing, Feature extraction, Image resolution, Tuning, Object recognition, visual understanding BibRef

Zhang, J.M.[Jia-Ming], Wang, X.[Xin], Ma, X.J.[Xing-Jun], Qiu, L.Y.[Ling-Yu], Jiang, Y.G.[Yu-Gang], Sang, J.[Jitao],
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models,
PAMI(48), No. 6, June 2026, pp. 6615-6627.
IEEE DOI 2605
Tuning, Transformers, Robustness, Visualization, Purification, Adaptation models, Vectors, Standards, Distortion, neural augmentation BibRef

Wang, X.[Xin], Chen, K.[Kai], Zhang, J.M.[Jia-Ming], Chen, J.J.[Jing-Jing], Ma, X.J.[Xing-Jun],
TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in Vision-Language Models,
CVPR25(19910-19920)
IEEE DOI Code:
WWW Link. 2508
Visualization, Accuracy, Scalability, Perturbation methods, Benchmark testing, Robustness, Entropy, Safety, Tuning, test-time adversarial prompt tuning BibRef

Wang, G.Q.[Gui-Qin], Zhao, P.[Peng], Wang, X.[Xiang], Guo, H.R.[Hao-Ran], Qi, N.[Nan], Yang, S.[Shusen], Guo, Q.H.[Qing-Hai],
DHPT: Dual-Modality Heterogeneous Prompt Tuning for Online Test-Time Adaption in Vision-Language Models,
CirSysVideo(36), No. 6, June 2026, pp. 8590-8601.
IEEE DOI 2606
Visualization, Tuning, Semantics, Noise, Adaptation models, Optimization, Data models, Calibration, Large language models, large language models BibRef

Wang, X.X.[Xi-Xi], Liu, M.[Meilin], Jiang, B.[Bo], Tang, J.[Jin], Luo, B.[Bin],
BHGraphAdapter: Parameter-Efficient VLMs Tuning Meets Hyper-Graph Learning,
CirSysVideo(36), No. 6, June 2026, pp. 9057-9071.
IEEE DOI Code:
WWW Link. 2606
Adaptation models, Visualization, Tuning, Data models, Image classification, Computational modeling, Training, Semantics, hypergraph learning BibRef

Chung, S.Y.[Sang-Yun], Yu, Y.J.[Young-Joon], Kim, S.[Seyeon], Chee, Y.[Youngchae], Ro, Y.M.[Yong Man],
Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking,
IP(35), 2026, pp. 7444-7459.
IEEE DOI 2607
Modeling, Image sensors, Optimization, Vision sensors, X-rays, Cognition, Cognitive systems, DNA, Training, Tuning, vision sensor understanding BibRef

Zhao, R.F.[Rong-Feng], Zhou, L.[Li], Shang, Z.[Zonghan], Liu, Y.W.[Yi-Wen], Zhang, Y.[Yugui], Li, S.[Shuang], Ning, J.[Jin], Ning, X.[Xin],
ProMML for robust few-shot adaptation of vision-language models,
PR(180), 2026, pp. 114160.
Elsevier DOI 2608
Vision-language models, Few-shot learning, Prompt learning, Cross-modal fusion, Domain generalization BibRef

Dong, C.[Chunru], Zhang, T.[Tao], Zhang, F.[Feng], Hua, Q.[Qiang], Zhu, J.[Jie], Zhang, Y.[Yong],
Hierarchical intra-inter modal adaptation for vision-language models,
PR(180), 2026, pp. 114200.
Elsevier DOI Code:
WWW Link. 2608
Vision-language model, Adapter tuning, Few-shot learning, Cross-attention BibRef

Dong, H.[Hao], Sheng, L.J.[Li-Jun], Liang, J.[Jian], He, R.[Ran], Chatzi, E.[Eleni], Fink, O.[Olga],
Adapting Vision-Language Models Without Labels: A Comprehensive Survey,
IJCV(134), No. 8, August 2026, pp. 389.
Springer DOI Code:
WWW Link. 2608
BibRef

Chen, Z.[Zhe], Wang, W.Y.[Wei-Yun], Zhu, J.G.[Jin-Guo], Wang, W.H.[Wen-Hai], Liu, Y.Z.[Yang-Zhou], Liu, Z.Y.[Zhao-Yang], Luo, G.[Gen], Sun, P.[Peng], Su, W.J.[Wei-Jie], Tian, H.[Hao], Lu, L.W.[Le-Wei], Zhu, X.[Xizhou], Lu, T.[Tong], Lin, D.[Dahua], Qiao, Y.[Yu], Dai, J.F.[Ji-Feng],
Revisiting InternVL: A Systematic Technical Framework for Building Powerful Open-Source Vision-Language Models,
PAMI(48), No. 10, October 2026, pp. 12582-12600.
IEEE DOI 2609
Modeling, Training, Visualization, Large language models, Visual systems, Videos, Tiles, Cognition, Vision-language model, continual pre-training BibRef


Ali, E.[Eman], Silva, S.[Sathira], Arora, C.[Chetan], Khan, M.H.[Muhammad Haris],
Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score,
WACV26(5875-5885)
IEEE DOI 2609
Filtering, Filters, Protocols, Product development, LoRa, Graphical user interfaces, Videos, vision-language models BibRef

Mishra, U.[Ujjwal], Shukla, V.[Vinita], Hambarde, P.[Praful], Shukla, A.[Amit],
Improvise, Adapt, Overcome: Telescopic Adapters for Efficient Fine-tuning of Vision Language Models in Medical Imaging,
WACV26(7605-7615)
IEEE DOI 2609
LoRa, Visible light communication, Storage area networks, Modulation, Protocols, medicial image segmentation BibRef

Lin, X.[Xiang], Li, W.X.[Wei-Xin], Guo, S.[Shu], Wang, L.H.[Li-Hong], Huang, D.[Di],
GIP: Gated Interaction Prompt for Parameter Efficient Vision-Language Fine-Tuning,
ICIP25(617-622)
IEEE DOI 2601
Bridges, Visualization, Adaptation models, Computational modeling, Logic gates, Performance gain, Gating Mechanism BibRef

Valois, P.H.V.[Pedro H. V.], Satav, D.[Dipesh], de Campos, R.A.P.[Rodrigo A. P.], Pratamasunu, G.Q.O.[Gulpi Q. O.], Fukui, K.[Kazuhiro],
Vision Language Model Interpretability with Concept Guided Decoding,
ICIP25(397-402)
IEEE DOI 2601
Deep learning, Training, Visualization, Adaptation models, Analytical models, Toxicology, Systematics, Decoding, Security, Jailbreak BibRef

Hao, F.S.[Fu-Sheng], He, F.X.[Feng-Xiang], Wu, F.[Fuxiang], Wang, T.[Tichao], Song, C.Q.[Cheng-Qun], Cheng, J.[Jun],
Task-Aware Clustering for Prompting Vision-Language Models,
CVPR25(14745-14755)
IEEE DOI Code:
WWW Link. 2508
Adaptation models, Visualization, Attention mechanisms, Codes, Interference, Benchmark testing, Optimization, Overfitting BibRef

Koleilat, T.[Taha], Asgariandehkordi, H.[Hojat], Rivaz, H.[Hassan], Xiao, Y.M.[Yi-Ming],
BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models,
CVPR25(14766-14776)
IEEE DOI Code:
WWW Link. 2508
Representation learning, Adaptation models, Visualization, Accuracy, Biological system modeling, Semantics, vision-language models BibRef

Yang, C.Y.[Chen-Yu], Dong, X.[Xuan], Zhu, X.Z.[Xi-Zhou], Su, W.J.[Wei-Jie], Wang, J.H.[Jia-Hao], Tian, H.[Hao], Chen, Z.[Zhe], Wang, W.H.[Wen-Hai], Lu, L.W.[Le-Wei], Dai, J.F.[Ji-Feng],
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models,
CVPR25(24939-24949)
IEEE DOI Code:
WWW Link. 2508
Visualization, Adaptation models, Image coding, Limiting, Redundancy, Benchmark testing, Encoding, Data mining, Videos BibRef

Bhattacharjee, S.S.[Subhransu S.], Campbell, D.[Dylan], Shome, R.[Rahul],
Believing is Seeing: Unobserved Object Detection using Generative Models,
CVPR25(19366-19377)
IEEE DOI 2508
Measurement, Training, Solid modeling, Adaptation models, Visualization, Pipelines, Object detection, Diffusion models, vision-language models BibRef

Zhou, W.J.[Wei-Jie], Tao, M.[Manli], Zhao, C.Y.[Chao-Yang], Guo, H.Y.[Hai-Yun], Dong, H.H.[Hong-Hui], Tang, M.[Ming], Wang, J.Q.[Jin-Qiao],
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability,
CVPR25(6940-6949)
IEEE DOI 2508
Visualization, Adaptation models, Service robots, Decision making, Benchmark testing, Cognition, Reliability, Robots, embodied ai, , embodied visual reasoning BibRef

Chen, T.Y.[Tian-Yu], Fu, X.C.[Xing-Cheng], Gao, Y.[Yisen], Qian, H.D.[Hao-Dong], Wei, Y.[Yuecen], Yan, K.[Kun], Zhou, H.Y.[Hao-Yi], Li, J.X.[Jian-Xin],
Galaxy Walker: Geometry-aware VLMs For Galaxy-scale Understanding,
CVPR25(4112-4121)
IEEE DOI 2508
Space vehicles, Geometry, Training, Adaptation models, Extraterrestrial phenomena, Estimation, Stars, Vectors, multi-modal learning BibRef

Poppi, T.[Tobia], Kasarla, T.[Tejaswi], Mettes, P.[Pascal], Baraldi, L.[Lorenzo], Cucchiara, R.[Rita],
Hyperbolic Safety-Aware Vision-Language Models,
CVPR25(4222-4232)
IEEE DOI Code:
WWW Link. 2508
Adaptation models, Ethics, Law, Source coding, Robustness, Data models, Safety, Standards, trustworthy, safety, nsfw, hyperbolic, vision-and-language BibRef

Yu, C.[Chong], Chen, T.[Tao], Gan, Z.X.[Zhong-Xue],
Once-Tuning-Multiple-Variants: Tuning Once and Expanded as Multiple Vision-Language Model Variants,
CVPR25(14712-14722)
IEEE DOI 2508
Training, Adaptation models, Accuracy, Tensors, Memory management, Hardware, Model compression, Tuning, Optimization, dynamic expansion capability BibRef

Chen, J.H.[Jiu-Hai], Yang, J.W.[Jian-Wei], Wu, H.P.[Hai-Ping], Li, D.Q.[Dian-Qi], Gao, J.F.[Jian-Feng], Zhou, T.Y.[Tian-Yi], Xiao, B.[Bin],
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion,
CVPR25(24928-24938)
IEEE DOI Code:
WWW Link. 2508
Training, Visualization, Statistical analysis, Computational modeling, Optical character recognition, Tuning BibRef

Zhu, B.[Beier], Cui, J.[Jiequan], Zhang, H.W.[Han-Wang], Zhang, C.[Chi],
Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness,
CVPR25(25487-25496)
IEEE DOI 2508
Training, Correlation, Foundation models, Null space, Robustness, Probes, Faces, group robustness, vision-language models BibRef

Li, H.Y.[Hao-Yang], Wang, L.[Liang], Wang, C.[Chao], Jiang, J.[Jing], Peng, Y.[Yan], Long, G.D.[Guo-Dong],
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models,
CVPR25(25623-25632)
IEEE DOI Code:
WWW Link. 2508
Codes, Semantic segmentation, Collaboration, Cloning, Object detection, Vectors, Optimization, Tuning, prompt tuning, multi-modal learning BibRef

Zhang, Y.[Yi], Deng, Y.X.[Yi-Xuan], Guo, M.H.[Meng-Hao], Hu, S.M.[Shi-Min],
Adaptive Parameter Selection for Tuning Vision-Language Models,
CVPR25(4280-4290)
IEEE DOI 2508
Adaptation models, Adaptive learning, Manuals, Benchmark testing, Performance gain, Flowering plants, Tuning, Overfitting BibRef

Deitke, M.[Matt], Clark, C.[Christopher], Lee, S.H.[Sang-Ho], Tripathi, R.[Rohun], Yang, Y.[Yue], Park, J.S.[Jae Sung], Salehi, M.[Mohammadreza], Muennighoff, N.[Niklas], Lo, K.[Kyle], Soldaini, L.[Luca], Lu, J.[Jiasen], Anderson, T.[Taira], Bransom, E.[Erin], Ehsani, K.[Kiana], Ngo, H.[Huong], Chen, Y.[YenSung], Patel, A.[Ajay], Yatskar, M.[Mark], Callison-Burch, C.[Chris], Head, A.[Andrew], Hendrix, R.[Rose], Bastani, F.[Favyen], VanderBilt, E.[Eli], Lambert, N.[Nathan], Chou, Y.[Yvonne], Chheda, A.[Arnavi], Sparks, J.[Jenna], Skjonsberg, S.[Sam], Schmitz, M.[Michael], Sarnat, A.[Aaron], Bischoff, B.[Byron], Walsh, P.[Pete], Newell, C.[Chris], Wolters, P.[Piper], Gupta, T.[Tanmay], Zeng, K.H.[Kuo-Hao], Borchardt, J.[Jon], Groeneveld, D.[Dirk], Nam, C.[Crystal], Lebrecht, S.[Sophie], Wittlif, C.[Caitlin], Schoenick, C.[Carissa], Michel, O.[Oscar], Krishna, R.[Ranjay], Weihs, L.[Luca], Smith, N.A.[Noah A.], Hajishirzi, H.[Hannaneh], Girshick, R.[Ross], Farhadi, A.[Ali], Kembhavi, A.[Aniruddha],
Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models,
CVPR25(91-104)
IEEE DOI Code:
WWW Link. 2508
Award, CVPR, Paper HM. Training, Source coding, Computational modeling, Pipelines, Training data, Data models, Open data, Synthetic data, visual instruction tuning BibRef

Lee, B.K.[Byung-Kwan], Hachiuma, R.[Ryo], Wang, Y.C.A.F.[Yu-Chi-Ang Frank], Ro, Y.M.[Yong Man], Wu, Y.H.[Yueh-Hua],
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models,
CVPR25(29545-29557)
IEEE DOI 2508
Training, Performance evaluation, Visualization, Computational modeling, Natural languages, Merging, Tuning BibRef

Sun, J.C.[Jing-Chen], Sharma, R.[Rohan], Lokhande, V.S.[Vishnu Suresh], Chen, C.Y.[Chang-You],
Cross-Modal Feature Alignment and MMD Improve Robustness of Prompt Tuning,
WACV25(4714-4724)
IEEE DOI 2505
Training, Adaptation models, Visualization, Codes, Computational modeling, Stochastic processes, Robustness, Tuning, vision-language model BibRef

Imam, R.[Raza], Gani, H.[Hanan], Huzaifa, M.[Muhammad], Nandakumar, K.[Karthik],
Test-Time Low Rank Adaptation via Confidence Maximization for Zero-Shot Generalization of Vision-Language Models,
WACV25(5449-5459)
IEEE DOI Code:
WWW Link. 2505
Adaptation models, Visualization, Codes, Large language models, Transformers, Entropy, Tuning, Optimization BibRef

Talemi, N.A.[Niloufar Alipour], Kashiani, H.[Hossein], Afghah, F.[Fatemeh],
Style-Pro: Style-Guided Prompt Learning for Generalizable Vision-Language Models,
WACV25(6207-6216)
IEEE DOI 2505
Adaptation models, Image recognition, Computational modeling, Benchmark testing, Data models, Robustness, Overfitting, style shift learning BibRef

Westfechtel, T.[Thomas], Zhang, D.[Dexuan], Harada, T.[Tatsuya],
Combining Inherent Knowledge of Vision-Language Models with Unsupervised Domain Adaptation Through Strong-Weak Guidance,
WACV25(6528-6537)
IEEE DOI 2505
Adaptation models, Accuracy, Predictive models, Benchmark testing, Prediction algorithms, Labeling BibRef

Ali, E.[Eman], Silva, S.[Sathira], Khan, M.H.[Muhammad Haris],
DPA: Dual Prototypes Alignment for Unsupervised Adaptation of Vision-Language Models,
WACV25(6083-6093)
IEEE DOI 2505
Training, Adaptation models, Visualization, Accuracy, Prototypes, Data models, Noise measurement, Image classification BibRef

Zhang, C.[Ce], Stepputtis, S.[Simon], Sycara, K.[Katia], Xie, Y.Q.[Ya-Qi],
Enhancing Vision-Language Few-Shot Adaptation with Negative Learning,
WACV25(5905-5915)
IEEE DOI Code:
WWW Link. 2505
Adaptation models, Codes, Accuracy, Computational modeling, Noise, Transforms, Computational efficiency, Noise measurement, Few shot learning BibRef

Yang, Y.T.[Yan-Ting], Chen, M.H.[Ming-Hao], Qiu, Q.[Qibo], Wu, J.H.[Jia-Hao], Wang, W.X.[Wen-Xiao], Lin, B.B.[Bin-Bin], Guan, Z.Y.[Zi-Yu], He, X.F.[Xiao-Fei],
Adapt2reward: Adapting Video-language Models to Generalizable Robotic Rewards via Failure Prompts,
ECCV24(LVII: 163-180).
Springer DOI 2412
BibRef

Adhikari, R.[Rabin], Thapaliya, S.[Safal], Dhakal, M.[Manish], Khanal, B.[Bishesh],
Tunevlseg: Prompt Tuning Benchmark for Vision-language Segmentation Models,
ACCV24(III: 44-62).
Springer DOI 2412
BibRef

Zhang, J.M.[Jia-Ming], Ma, X.J.[Xing-Jun], Wang, X.[Xin], Qiu, L.Y.[Ling-Yu], Wang, J.Q.[Jia-Qi], Jiang, Y.G.[Yu-Gang], Sang, J.[Jitao],
Adversarial Prompt Tuning for Vision-language Models,
ECCV24(XLV: 56-72).
Springer DOI 2412
BibRef

Wu, G.[Ge], Zhang, X.[Xin], Li, Z.[Zheng], Chen, Z.W.[Zhao-Wei], Liang, J.J.[Jia-Jun], Yang, J.[Jian], Li, X.[Xiang],
Cascade Prompt Learning for Vision-language Model Adaptation,
ECCV24(L: 304-321).
Springer DOI 2412
BibRef

Han, J.[Jinwei], Lin, Z.W.[Zhi-Wen], Sun, Z.Y.[Zhong-Yisun], Gao, Y.G.[Ying-Guo], Yan, K.[Ke], Ding, S.H.[Shou-Hong], Gao, Y.[Yuan], Xia, G.S.[Gui-Song],
Anchor-based Robust Finetuning of Vision-Language Models,
CVPR24(26909-26918)
IEEE DOI 2410
Image recognition, Zero-shot learning, Semantics, Benchmark testing, Anchor, Robust Finetuning BibRef

Wu, T.Y.[Tz-Ying], Ho, C.H.[Chih-Hui], Vasconcelos, N.M.[Nuno M.],
ProTeCt: Prompt Tuning for Taxonomic Open Set Classification,
CVPR24(16531-16540)
IEEE DOI Code:
WWW Link. 2410
Measurement, Training, Frequency modulation, Accuracy, Taxonomy, Semantics, Hierarchical Classification, Visual-language foundation model BibRef

Zhang, Y.B.[Ya-Bin], Zhu, W.J.[Wen-Jie], Tang, H.[Hui], Ma, Z.Y.[Zhi-Yuan], Zhou, K.Y.[Kai-Yang], Zhang, L.[Lei],
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models,
CVPR24(28718-28728)
IEEE DOI Code:
WWW Link. 2410
Training, Knowledge engineering, Adaptation models, Codes, Training data, Data models, Vision-language models, versatile adaptation BibRef

Guo, Y.C.[Yun-Cheng], Gu, X.D.[Xiao-Dong],
JoAPR: Cleaning the Lens of Prompt Learning for Vision-Language Models,
CVPR24(28695-28705)
IEEE DOI 2410
Adaptation models, Adaptive systems, Noise, Manuals, Robustness, Noise measurement, prompt learning BibRef

Cao, Q.L.[Qing-Long], Zheng-Qin, X., Chen, Y.T.[Yun-Tian], Chao, M., Yang, X.K.[Xiao-Kang],
Domain Prompt Learning with Quaternion Networks,
CVPR24(26627-26636)
IEEE DOI Code:
WWW Link. 2410
Knowledge engineering, Adaptation models, Codes, Quaternions, Face recognition, Contrastive learning, vision-language models, quaternion networks BibRef

Zanella, M.[Maxime], Fuchs, C.[Clément], de Vleeschouwer, C.[Christophe], Ayed, I.B.[Ismail Ben],
Realistic Test-Time Adaptation of Vision-Language Models,
CVPR25(25103-25112)
IEEE DOI Code:
WWW Link. 2508
BibRef
And: A2, A1, A3, Only:
Online Gaussian Test-Time Adaptation of Vision-Language Models,
MULA25(128-137)
IEEE DOI Code:
WWW Link. 2512
Adaptation models, Codes, Predictive models, Performance gain, Robustness, vision-language, test-time adaptation, regularized maximum likelihood estimation. Measurement, Visualization, Accuracy, Protocols, Limiting, Predictive models, Data models, Mathematical models, CLIP BibRef

Zanella, M.[Maxime], Ayed, I.B.[Ismail Ben],
On the Test-Time Zero-Shot Generalization of Vision-Language Models: Do we Really need Prompt Learning?,
CVPR24(23783-23793)
IEEE DOI 2410
Training, Systematics, Computational modeling, Quality assessment, Computational efficiency, vision-language, training-free BibRef

Yang, S.Q.[Sen-Qiao], Tian, Z.T.[Zhuo-Tao], Jiang, L.[Li], Jia, J.Y.[Jia-Ya],
Unified Language-Driven Zero-Shot Domain Adaptation,
CVPR24(23407-23415)
IEEE DOI 2410
Representation learning, Adaptation models, Visualization, Correlation, Scalability, Computational modeling, Vision-Language Model BibRef

Chen, Y.F.[Yi-Fei], Chen, D.P.[Da-Peng], Liu, R.J.[Rui-Jin], Zhou, S.[Sai], Xue, W.Y.[Wen-Yuan], Peng, W.[Wei],
Align Before Adapt: Leveraging Entity-to-Region Alignments for Generalizable Video Action Recognition,
CVPR24(18688-18698)
IEEE DOI 2410
Representation learning, Adaptation models, Visualization, Semantics, Transformers, Vectors, Video action recognition, visual-language model BibRef

Kahatapitiya, K.[Kumara], Arnab, A.[Anurag], Nagran, A.[Arsha], Ryoo, M.S.[Michael S.],
VicTR: Video-conditioned Text Representations for Activity Recognition,
CVPR24(18547-18558)
IEEE DOI 2410
Training, Visualization, Adaptation models, Semantics, Focusing, Benchmark testing, Vision-language models, Activity Recognition, Video-conditioned Text BibRef

Huang, C.Q.[Chao-Qin], Jiang, A.[Aofan], Feng, J.H.[Jing-Hao], Zhang, Y.[Ya], Wang, X.C.[Xin-Chao], Wang, Y.F.[Yan-Feng],
Adapting Visual-Language Models for Generalizable Anomaly Detection in Medical Images,
CVPR24(11375-11385)
IEEE DOI Code:
WWW Link. 2410
Training, Adaptation models, Image segmentation, Visualization, Source coding, Semantics, Anomaly Detection, Medical Images BibRef

Bang, J.[Jihwan], Ahn, S.[Sumyeong], Lee, J.G.[Jae-Gil],
Active Prompt Learning in Vision Language Models,
CVPR24(26994-27004)
IEEE DOI Code:
WWW Link. 2410
Learning systems, Adaptation models, Codes, Sampling methods, Labeling BibRef

Khandelwal, A.[Anant],
PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination,
ZeroShot24(7819-7828)
IEEE DOI 2410
Adaptation models, Computational modeling, Prototypes, Contrastive learning, Benchmark testing, Robustness BibRef

Hirohashi, Y.[Yuki], Hirakawa, T.[Tsubasa], Yamashita, T.[Takayoshi], Fujiyoshi, H.[Hironobu],
Prompt Learning with One-Shot Setting based Feature Space Analysis in Vision-and-Language Models,
ZeroShot24(7761-7770)
IEEE DOI 2410
Learning systems, Analytical models, Adaptation models, Image resolution, Accuracy, Vision-and-Language Model, Prompt Learning BibRef

Karmanov, A.[Adilbek], Guan, D.[Dayan], Lu, S.J.[Shi-Jian], El Saddik, A.[Abdulmotaleb], Xing, E.[Eric],
Efficient Test-Time Adaptation of Vision-Language Models,
CVPR24(14162-14171)
IEEE DOI Code:
WWW Link. 2410
Adaptation models, Codes, Computational modeling, Noise, Predictive models, Benchmark testing BibRef

Zhao, Y.[Yue], Zhao, L.[Long], Zhou, X.Y.[Xing-Yi], Wu, J.L.[Jia-Lin], Chu, C.T.[Chun-Te], Miao, H.[Hui], Schroff, F.[Florian], Adam, H.[Hartwig], Liu, T.[Ting], Gong, B.Q.[Bo-Qing], Krähenbühl, P.[Philipp], Yuan, L.Z.[Liang-Zhe],
Distilling Vision-Language Models on Millions of Videos,
CVPR24(13106-13116)
IEEE DOI 2410
Adaptation models, Computational modeling, Benchmark testing, Data models, Text to video BibRef

Hu, Y.S.[Yu-Shi], Stretcu, O.[Otilia], Lu, C.T.[Chun-Ta], Viswanathan, K.[Krishnamurthy], Hata, K.[Kenji], Luo, E.[Enming], Krishna, R.[Ranjay], Fuxman, A.[Ariel],
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models,
CVPR24(9590-9601)
IEEE DOI 2410
Visualization, Adaptation models, Computational modeling, Instruments, Loading, Music, Cognition, vision-language model, tools BibRef

Zanella, M.[Maxime], Fuchs, C.[Clément], Ben Ayed, I.[Ismail], de Vleeschouwer, C.[Christophe],
Vocabulary-Free Few-Shot Learning for Vision-Language Models,
MULA25(149-158)
IEEE DOI Code:
WWW Link. 2512
Adaptation models, Visualization, Computational modeling, Semantics, Computational efficiency, Few shot learning, prompts BibRef

Silva-Rodríguez, J.[Julio], Hajimiri, S.[Sina], Ben Ayed, I.[Ismail], Dolz, J.[Jose],
A Closer Look at the Few-Shot Adaptation of Large Vision-Language Models,
CVPR24(23681-23690)
IEEE DOI Code:
WWW Link. 2410
Adaptation models, Codes, Computational modeling, Transfer learning, Probes BibRef

Zanella, M.[Maxime], Ben Ayed, I.[Ismail],
Low-Rank Few-Shot Adaptation of Vision-Language Models,
Prompting24(1593-1603)
IEEE DOI 2410
Training, Adaptation models, Design methodology, Few shot learning, Vision-Language, few-shot, adapter BibRef

Shen, S.[Sheng], Yang, S.[Shijia], Zhang, T.J.[Tian-Jun], Zhai, B.[Bohan], Gonzalez, J.E.[Joseph E.], Keutzer, K.[Kurt], Darrell, T.J.[Trevor J.],
Multitask Vision-Language Prompt Tuning,
WACV24(5644-5655)
IEEE DOI 2404
Learning systems, Visualization, Adaptation models, Benchmark testing, Vectors, Task analysis, Algorithms, Vision + language and/or other modalities BibRef

Lin, W.[Wei], Mirza, M.J.[Muhammad Jehanzeb], Doveh, S.[Sivan], Feris, R.[Rogerio], Giryes, R.[Raja], Hochreiter, S.[Sepp], Karlinsky, L.[Leonid],
Comparison Visual Instruction Tuning,
Reasoning25(2964-2974)
IEEE DOI 2512
Visualization, Solid modeling, Large language models, Benchmark testing, Cognition, Tuning, Anomaly detection, visual instruction tuning BibRef

Hu, Z.Y.[Zi-Yuan], Li, Y.Y.[Yan-Yang], Lyu, M.R.[Michael R.], Wang, L.W.[Li-Wei],
VL-PET: Vision-and-Language Parameter-Efficient Tuning via Granularity Control,
ICCV23(2998-3008)
IEEE DOI Code:
WWW Link. 2401
BibRef

Wu, C.E.[Cheng-En], Tian, Y.[Yu], Yu, H.C.[Hai-Chao], Wang, H.[Heng], Morgado, P.[Pedro], Hu, Y.H.[Yu Hen], Yang, L.J.[Lin-Jie],
Why Is Prompt Tuning for Vision-Language Models Robust to Noisy Labels?,
ICCV23(15442-15451)
IEEE DOI Code:
WWW Link. 2401
BibRef

Ouali, Y.[Yassine], Bulat, A.[Adrian], Matinez, B.[Brais], Tzimiropoulos, G.[Georgios],
Black Box Few-Shot Adaptation for Vision-Language models,
ICCV23(15488-15500)
IEEE DOI Code:
WWW Link. 2401
BibRef

Kan, B.[Baoshuo], Wang, T.[Teng], Lu, W.P.[Wen-Peng], Zhen, X.T.[Xian-Tong], Guan, W.[Weili], Zheng, F.[Feng],
Knowledge-Aware Prompt Tuning for Generalizable Vision-Language Models,
ICCV23(15624-15634)
IEEE DOI 2401
BibRef

Cho, E.[Eulrang], Kim, J.[Jooyeon], Kim, H.W.J.[Hyun-Woo J.],
Distribution-Aware Prompt Tuning for Vision-Language Models,
ICCV23(21947-21956)
IEEE DOI Code:
WWW Link. 2401
BibRef

Varma, M.[Maya], Delbrouck, J.B.[Jean-Benoit], Hooper, S.[Sarah], Chaudhari, A.[Akshay], Langlotz, C.[Curtis],
ViLLA: Fine-Grained Vision-Language Representation Learning from Real-World Data,
ICCV23(22168-22178)
IEEE DOI 2401
BibRef

Upadhyay, U.[Uddeshya], Karthik, S.[Shyamgopal], Mancini, M.[Massimiliano], Akata, Z.[Zeynep],
ProbVLM: Probabilistic Adapter for Frozen Vison-Language Models,
ICCV23(1899-1910)
IEEE DOI Code:
WWW Link. 2401
BibRef

Chapter on Implementations and Applications, Databases, QBIC, Video Analysis, Hardware and Software, Inspection continues in
Attacks on Vision-Language Models .


Last update:Sep 21, 2026 at 18:29:27