Skip to content

Latest commit

 

History

History
353 lines (178 loc) · 33.8 KB

File metadata and controls

353 lines (178 loc) · 33.8 KB

2022

  • [1] Multimodal Token Fusion for Vision Transformers, CVPR 2022.

    Wang, Yikai and Chen, Xinghao and Cao, Lele and Huang, Wenbing and Sun, Fuchun and Wang, Yunhe.

    [Paper] [Code]

2023

  • [2] PuMer: Pruning and Merging Tokens for Efficient Vision Language Models, ACL 2023.

    Cao, Qingqing and Paranjape, Bhargavi and Hajishirzi, Hannaneh.

    [Paper] [Code]

2024

  • [3] LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models, ICCV 2025.

    Shang, Yuzhang and Cai, Mu and Xu, Bingxin and Lee, Yong Jae and Yan, Yan.

    [Paper] [Code]

  • [4] Accelerating Transformers with Spectrum-Preserving Token Merging, NeurIPS 2024.

    Tran, Hoai-Chau and Nguyen, Duy MH and Nguyen, Duy M and Nguyen, Trung-Tin and Le, Ngan and Xie, Pengtao and Sonntag, Daniel and Zou, James Y and Nguyen, Binh T and Niepert, Mathias.

    [Paper] [Code]

  • [5] MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer, CVPR 2024.

    Cao, Jianjian and Ye, Peng and Li, Shengze and Yu, Chong and Tang, Yansong and Lu, Jiwen and Chen, Tao.

    [Paper] [Code]

  • [6] DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models, arXiv 2024.

    Yao, Linli and Li, Lei and Ren, Shuhuai and Wang, Lean and Liu, Yuanxin and Sun, Xu and Hou, Lu.

    [Paper] [Code]

  • [7] Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding, arXiv 2024.

    Renshan Zhang, Yibo Lyu, Rui Shao, Gongwei Chen, Weili Guan and Liqiang Nie.

    [Paper] [Code]

  • [8] Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Large Models, ECCV 2024.

    Ju, Chen and Wang, Haicheng and Li, Zeqian and Chen, Xu and Zhai, Zhonghua and Huang, Weilin and Xiao, Shuai.

    [Paper] [Code]

  • [9] mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding, Findings of EMNLP 2024.

    Hu, Anwen and Xu, Haiyang and Ye, Jiabo and Yan, Ming and Zhang, Liang and Zhang, Bo and Li, Chen and Zhang, Ji and Jin, Qin and Huang, Fei and others.

    [Paper] [Code]

  • [10] LLaVA-VID: An Image is Worth 2 Tokens in Large Language Models, ECCV 2024.

    Li, Yanwei and Wang, Chengyao and Jia, Jiaya.

    [Paper] [Code]

  • [11] ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification, arXiv 2024.

    He, Yefei and Chen, Feng and Liu, Jing and Shao, Wenqi and Zhou, Hong and Zhang, Kaipeng and Zhuang, Bohan.

    [Paper] [Code]

  • [12] ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models, arXiv 2024.

    Ye, Xubing and Gan, Yukang and Ge, Yixiao and Zhang, Xiao-Ping and Tang, Yansong.

    [Paper] [Code]

  • [13] Efficient Multi-modal Large Language Models via Visual Token Grouping, arXiv 2024.

    Huang, Minbin and Huang, Runhui and Shi, Han and Chen, Yimeng and Zheng, Chuanyang and Sun, Xiangguo and Jiang, Xin and Li, Zhenguo and Cheng, Hong.

    [Paper] [Code]

  • [14] Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models, arXiv 2024.

    Ye, Weihao and Wu, Qiong and Lin, Wenhao and Zhou, Yiyi.

    [Paper] [Code]

  • [15] Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving, arXiv 2024.

    Ma, Yunsheng and Abdelraouf, Amr and Gupta, Rohit and Wang, Ziran and Han, Kyungtae.

    [Paper] [Code]

  • [16] iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models, arXiv 2024.

    Hu, Lianyu and Shang, Fanhua and Wan, Liang and Feng, Wei.

    [Paper] [Code]

  • [17] mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding, ACL 2025.

    Anwen Hu and Haiyang Xu and Liang Zhang and Jiabo Ye and Ming Yan and Ji Zhang and Qin Jin and Fei Huang and Jingren Zhou.

    [Paper] [Code]

  • [18] VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation, arXiv 2024.

    Chen, Hanning and Ni, Yang and Huang, Wenjun and Liu, Yezi and Jeong, SungHeon and Wen, Fei and Bastian, Nathaniel and Latapie, Hugo and Imani, Mohsen.

    [Paper] [Code]

  • [19] CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers, ICML 2024.

    Shi, Dachuan and Tao, Chaofan and Rao, Anyi and Yang, Zhendong and Yuan, Chun and Wang, Jiaqi.

    [Paper] [Code]

  • [20] Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs, arXiv 2024.

    Song, Dingjie and Wang, Wenjun and Chen, Shunian and Wang, Xidong and Guan, Michael and Wang, Benyou.

    [Paper] [Code]

  • [21] An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models, ECCV 2024.

    Chen, Liang and Zhao, Haozhe and Liu, Tianyu and Bai, Shuai and Lin, Junyang and Zhou, Chang and Chang, Baobao.

    [Paper] [Code]

  • [22] Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See, arXiv 2024.

    Zhang, Zeliang and Pham, Phu and Zhao, Wentian and Wan, Kun and Li, Yu-Jhe and Zhou, Jianing and Miranda, Daniel and Kale, Ajinkya and Xu, Chenliang.

    [Paper] [Code]

  • [23] PAR: Prompt-Aware Token Reduction Method for Efficient Large Multimodal Models, arXiv 2024.

    Wu, Tianxiang and Nie, Minxin and Cao, Ziqiang.

    [Paper] [Code]

  • [24] Is Less More? Exploring Token Condensation as Training-free Adaptation for CLIP, arXiv 2024.

    Wang, Zixin and Gong, Dong and Wang, Sen and Huang, Zi and Luo, Yadan.

    [Paper] [Code]

  • [25] Accelerating MLLMs by Searching Optimal Vision Token Reduction, CVPR 2025.

    Zhao, Shiyu and Wang, Zhenting and Juefei-Xu, Felix and Xia, Xide and Liu, Miao and Wang, Xiaofang and Liang, Mingfu and Zhang, Ning and Metaxas, Dimitris N and Yu, Licheng.

    [Paper] [Code]

  • [26] [CLS] Attention is All You Need for Training-Free Visual Token Pruning: Make VLM Inference Faster, arXiv 2024.

    Zhang, Qizhe and Cheng, Aosong and Lu, Ming and Zhuo, Zhiyong and Wang, Minqi and Cao, Jiajun and Guo, Shaobo and She, Qi and Zhang, Shanghang.

    [Paper] [Code]

  • [27] FoPru: Focal Pruning for Efficient Large Vision-Language Models, arXiv 2024.

    Lei Jiang and Weizhe Huang and Tongxuan Liu and Yuting Zeng and Jing Li and Lechao Cheng and Xiaohua Xu.

    [Paper] [Code]

  • [28] Inference Optimal VLMs Need Only One Visual Token but Larger Models, arXiv 2024.

    Li, Kevin Y and Goyal, Sachin and Semedo, Joao D and Kolter, J Zico.

    [Paper] [Code]

  • [29] VASparse: Towards Efficient Visual Hallucination Mitigation for Large Vision-Language Model via Visual-Aware Sparsification, arXiv 2024.

    Xianwei Zhuang and Zhihong Zhu and Yuxin Xie and Liming Liang and Yuexian Zou.

    [Paper] [Code]

  • [30] Rethinking Token Reduction in MLLMs: Towards a Unified Paradigm for Training-Free Acceleration, arXiv 2024.

    Han, Yuhang and Liu, Xuyang and Ding, Pengxiang and Wang, Donglin and Chen, Honggang and Yan, Qingsen and Huang, Siteng.

    [Paper] [Code]

  • [31] [CLS] Token Tells Everything Needed for Training-free Efficient MLLMs, arXiv 2024.

    Wang, Ao and Sun, Fengyuan and Chen, Hui and Lin, Zijia and Han, Jungong and Ding, Guiguang.

    [Paper] [Code]

  • [32] FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression, arXiv 2024.

    Zhu, Yuke and Xie, Chi and Liang, Shuang and Zheng, Bo and Guo, Sheng.

    [Paper] [Code]

  • [33] TURBO: Token Utilization Refactor and Boost in Transformers for Efficient Vision-Language Models, arXiv 2024.

    Liu, Xin and Li, Yue and Jiang, Hao and Xu, Mengmi.

    [Paper] [Code]

  • [34] FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression, arXiv 2024.

    Zhu, Yuke and Xie, Chi and Liang, Shuang and Zheng, Bo and Guo, Sheng.

    [Paper] [Code]

2025

  • [35] TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval, ICLR 2025.

    Shen, Leqi and Hao, Tianxiang and Zhao, Sicheng and Zhang, Yifeng and Liu, Pengzhang and Bao, Yongjun and Ding, Guiguang.

    [Paper] [Code]

  • [36] ST3: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming, AAAI 2025.

    Jiedong Zhuang and Lu Lu and Ming Dai and Rui Hu and Jian Chen and Qiang Liu and Haoji Hu.

    [Paper] [Code]

  • [37] HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models, AAAI 2025.

    Arif, Kazi Hasan Ibn and Yoon, JinYi and Nikolopoulos, Dimitrios S and Vandierendonck, Hans and John, Deepu and Ji, Bo.

    [Paper] [Code]

  • [38] Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference, AAAI 2025.

    Lin, Zhihang and Lin, Mingbao and Lin, Luxi and Ji, Rongrong.

    [Paper] [Code]

  • [39] LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token, ICLR 2025.

    Shaolei Zhang and Qingkai Fang and Zhe Yang and Yang Feng.

    [Paper] [Code]

  • [40] Recoverable Compression: A Multimodal Vision Token Recovery Mechanism Guided by Text Information, AAAI 2025.

    Chen, Yi and Xu, Jian and Zhang, Xu-Yao and Liu, Wen-Zhuo and Liu, Yang-Yang and Liu, Cheng-Lin.

    [Paper] [Code]

  • [41] What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph, AAAI 2025.

    Yutao Jiang and Qiong Wu and Wenhao Lin and Wei Yu and Yiyi Zhou.

    [Paper] [Code]

  • [42] FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance, ICCV 2025.

    Haicheng Wang and Zhemeng Yu and Gabriele Spadaro and Chen Ju and Victor Quétu and Enzo Tartaglione.

    [Paper] [Code]

  • [43] FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Visual Language Models, ICCV 2025.

    Fu, Tianyu and Liu, Tengxuan and Han, Qinghao and Dai, Guohao and Yan, Shengen and Yang, Huazhong and Ning, Xuefei and Wang, Yu.

    [Paper] [Code]

  • [44] Global Compression Commander: Plug-and-Play Inference Acceleration for High-resolution Large Vision-Language Models, arXiv 2025.

    Xuyang Liu and Ziming Wang and Yuhang Han and Yingyao Wang and Jiale Yuan and Jun Song and Bo Zheng and Linfeng Zhang and Siteng Huang and Honggang Chen.

    [Paper] [Code]

  • [45] AdaFV: Accelerating VLMs with Self-Adaptive Cross-Modality Attention Mixture, Fingdings of ACL 2025.

    Jiayi Han and Liang Du and Yiwen Wu and Xiangguo Zhou and Hongwei Du and Weibo Zheng.

    [Paper] [Code]

  • [46] Dynamic Token Reduction during Generation for Vision Language Models, arXiv 2025.

    Xiaoyu Liang and Chaofeng Guan and Jiaying Lu and Huiyao Chen and Huan Wang and Haoji Hu.

    [Paper] [Code]

  • [47] Stop Looking for “Important Tokens” in Multimodal Language Models: Duplication Matters More, arXiv 2025.

    Zichen Wen and Yifeng Gao and Shaobo Wang and Junyuan Zhang and Qintong Zhang and Weijia Li and Conghui He and Linfeng Zhang

    [Paper] [Code]

  • [48] AdaRETAKE: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding, arXiv 2025.

    Xiao Wang and Qingyi Si and Jianlong Wu and Shiyu Zhu and Li Cao and Liqiang Nie.

    [Paper] [Code]

  • [49] Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models, arXiv 2025.

    Liu, Xuyang and Wang, Yiyu and Ma, Junpeng and Zhang, Linfeng.

    [Paper] [Code]

  • [50] VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models, arXiv 2025.

    Zhang, Ce and Ma, Kaixin and Fang, Tianqing and Yu, Wenhao and Zhang, Hongming and Zhang, Zhisong and Xie, Yaqi and Sycara, Katia and Mi, Haitao and Yu, Dong.

    [Paper] [Code]

  • [51] Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization, arXiv 2025.

    Li, Kaiyuan and Chen, Xiaoyue and Gao, Chen and Li, Yong and Chen, Xinlei.

    [Paper] [Code]

  • [52] EffiVLM-Bench: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Visual-Languge Models, ACL 2025.

    Zekun Wang, MingHua Ma, Zexin Wang, Rongchuan Mu, liping shan, Ming Liu, Bing Qin.

    [Paper] [Code]

  • [53] LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs, arXiv 2025.

    Sun Boyuan and Zhao Jiaxing and Wei Xihan and Hou Qibin.

    [Paper] [Code]

  • [54] METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models, ICCV 2025.

    Liu, Yuchen and Wang, Yaoming and Shi, Bowen and Zhang, Xiaopeng and Dai, Wenrui and Li, Chenglin and Xiong, Hongkai and Tian, Qi.

    [Paper] [Code]

  • [55] TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model, arXiv 2025.

    Li, Ao and Duan, Yuxiang and Zhang, Jinghui and Ma, Congbo and Xie, Yutong and Carneiro, Gustavo and Yaqub, Mohammad and Wang, Hu.

    [Paper] [Code]

  • [56] HiPrune: Training-Free Visual Token Pruning via Hierarchical Attention in Vision-Language Models, arXiv 2025.

    Liu, Jizhihui and Du, Feiyi and Zhu, Guangdao and Lian, Niu and Li, Jun and Chen, Bin.

    [Paper] [Code]

  • [57] Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving, arXiv 2025.

    Xiong, Minhao and Wen, Zichen and Gu, Zhuangcheng and Liu, Xuyang and Zhang, Rui and Kang, Hengrui and Yang, Jiabing and Zhang, Junyuan and Li, Weijia and He, Conghui and Wang, Yafei and Zhang, Linfeng

    [Paper] [Code]

  • [58] A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models, arXiv 2025.

    Quan-Sheng, Zeng and Yunheng, Li and Qilong, Wang and Peng-Tao, Jiang and Zuxuan, Wu and Ming-Ming, Cheng and Qibin, Hou

    [Paper] [Code]