Awesome-Efficient-LLM
A curated list for Efficient Large Language Models
Full List
- Network Pruning / Sparsity
- Knowledge Distillation
- Quantization
- Inference Acceleration
- Efficient MOE
- Efficient Architecture of LLM
- KV Cache Compression
- Text Compression
- Low-Rank Decomposition
- Hardware / System / Serving
- Efficient Fine-tuning
- Efficient Training
- Survey or Benchmark
- Reasoning Model
Please check out all the papers by selecting the sub-area you're interested in. On this main page, only papers released in the past 90 days are shown.
🚀 Updates
- April 15, 2025: We have a new curated list for efficient reasoning model!
- May 29, 2024: We've had this awesome list for a year now :smiling_face_with_three_hearts:!
- Sep 6, 2023: Add a new subdirectory project/ to organize efficient LLM projects.
- July 11, 2023: A new subdirectory efficient_plm/ is created to house papers that are applicable to PLMs.
💮 Contributing
If you'd like to include your paper, or need to update any details such as conference information or code URLs, please feel free to submit a pull request. You can generate the required markdown format for each paper by filling in the information in generate_item.py and execute python generate_item.py. We warmly appreciate your contributions to this list. Alternatively, you can email me with the links to your paper and code, and I would add your paper to the list at my earliest convenience.
:star: Recommended Paper
For each topic, we have curated a list of recommended papers that have garnered a lot of GitHub stars or citations.
Paper from Sep 30, 2024 - Now (see Full List from May 22, 2023 here)
Quick Link
- Network Pruning / Sparsity
- Knowledge Distillation
- Quantization
- Inference Acceleration
- Efficient MOE
- Efficient Architecture of LLM
- KV Cache Compression
- Text Compression
- Low-Rank Decomposition
- Hardware / System / Serving
- Efficient Fine-tuning
- Efficient Training
- Survey
Network Pruning / Sparsity
| Title & Authors | Introduction | Links |
|---|---|---|
| :star: SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot | ||
| Elias Frantar, Dan Alistarh | ![]() |
Github paper |
| :star: LLM-Pruner: On the Structural Pruning of Large Language Models | ||
| Xinyin Ma, Gongfan Fang, Xinchao Wang | ![]() |
Github paper |
| :star: A Simple and Effective Pruning Approach for Large Language Models | ||
| Mingjie Sun, Zhuang Liu, Anna Bair, J. Zico Kolter | ![]() |
Github |
| Paper | [//]: #Recommend | |
| :star: Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning | ||
| Mengzhou Xia, Tianyu Gao, Zhiyuan Zeng, Danqi Chen | ![]() |
Github |
| Paper | [//]: #Recommend | |
| :star: MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models | ||
| Gongfan Fang, Hongxu Yin, Saurav Muralidharan, Greg Heinrich, Jeff Pool, Jan Kautz, Pavlo Molchanov, Xinchao Wang | ![]() |
Github |
| Paper | [//]: #Recommend | |
| Mamba-Shedder: Post-Transformer Compression for Efficient Selective Structured State Space Models | ||
| Juan Pablo Munoz, Jinjie Yuan, Nilesh Jain | ![]() |
Github |
| Paper | [//]: #01/28 | |
| MultiPruner: Balanced Structure Removal in Foundation Models | ||
| Juan Pablo Munoz, Jinjie Yuan, Nilesh Jain | ![]() |
Github |
| Paper | [//]: #01/17 | |
| HashAttention: Semantic Sparsity for Faster Inference | ||
| Aditya Desai, Shuo Yang, Alejandro Cuadron, Ana Klimovic, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica | ![]() |
Paper |
| Adaptive Pruning for Large Language Models with Structural Importance Awareness | ||
| Haotian Zheng, Jinke Ren, Yushan Sun, Ruichen Zhang, Wenbo Zhang, Zhen Li, Dusit Niyato, Shuguang Cui, Yatong Han | ![]() |
Paper |
| SlimGPT: Layer-wise Structured Pruning for Large Language Models | ||
| Gui Ling, Ziyang Wang, Yuliang Yan, Qingwen Liu | ![]() |
Paper |
| Less is More: Towards Green Code Large Language Models via Unified Structural Pruning | ||
| Guang Yang, Yu Zhou, Xiangyu Zhang, Wei Cheng, Ke Liu, Xiang Chen, Terry Yue Zhuo, Taolue Chen | ![]() |
Paper |
| Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking | ||
| Marco Federici, Davide Belli, Mart van Baalen, Amir Jalalirad, Andrii Skliar, Bence Major, Markus Nagel, Paul Whatmough | ![]() |
Paper |
| Puzzle: Distillation-Based NAS for Inference-Optimized LLMs | ||
| Akhiad Bercovich, Tomer Ronen, Talor Abramovich, Nir Ailon, Nave Assaf, Mohammad Dabbah et al | ![]() |
Paper |
| Reassessing Layer Pruning in LLMs: New Insights and Methods | ||
| Yao Lu, Hao Cheng, Yujie Fang, Zeyu Wang, Jiaheng Wei, Dongwei Xu, Qi Xuan, Xiaoniu Yang, Zhaowei Zhu | Github | |
| Paper | [//]: #12/03 | |
| Layer Importance and Hallucination Analysis in Large Language Models via Enhanced Activation Variance-Sparsity | ||
| Zichen Song, Sitan Huang, Yuxin Wu, Zhongfeng Kang | ![]() |
Paper |
| AmoebaLLM: Constructing Any-Shape Large Language Models for Efficient and Instant Deployment | ||
| Yonggan Fu, Zhongzhi Yu, Junwei Li, Jiayi Qian, Yongan Zhang, Xiangchi Yuan, Dachuan Shi, Roman Yakunin, Yingyan Celine Lin | ![]() |
Github |
| Paper | [//]: #11/24 | |
| Scaling Law for Post-training after Model Pruning | ||
| Xiaodong Chen, Yuxuan Hu, Jing Zhang, Xiaokang Zhang, Cuiping Li, Hong Chen | Paper | |
| DRPruning: Efficient Large Language Model Pruning through Distributionally Robust Optimization | ||
| Hexuan Deng, Wenxiang Jiao, Xuebo Liu, Min Zhang, Zhaopeng Tu | ![]() |
Github |
| Paper | [//]: #11/24 | |
| Sparsing Law: Towards Large Language Models with Greater Activation Sparsity | ||
| Yuqi Luo, Chenyang Song, Xu Han, Yingfa Chen, Chaojun Xiao, Zhiyuan Liu, Maosong Sun | ![]() |
Github |
| Paper | [//]: #11/18 | |
| AVSS: Layer Importance Evaluation in Large Language Models via Activation Variance-Sparsity Analysis | ||
| Zichen Song, Yuxin Wu, Sitan Huang, Zhongfeng Kang | ![]() |
Paper |
| Tailored-LLaMA: Optimizing Few-Shot Learning in Pruned LLaMA Models with Task-Specific Prompts | ||
| Danyal Aftab, Steven Davy | ![]() |
Paper |
| LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment | ||
| Ge Yang, Changyi He, Jinyang Guo, Jianyu Wu, Yifu Ding, Aishan Liu, Haotong Qin, Pengliang Ji, Xianglong Liu | ![]() |
Github |
| Paper | [//]: #11/17 | |
| Beyond 2:4: exploring V:N:M sparsity for efficient transformer inference on GPUs | ||
| Kang Zhao, Tao Yuan, Han Bao, Zhenfeng Su, Chang Gao, Zhaofeng Sun, Zichen Liang, Liping Jing, Jianfei Chen | ![]() |
Paper |
| EvoPress: Towards Optimal Dynamic Model Compression via Evolutionary Search | ||
| Oliver Sieberling, Denis Kuznedelev, Eldar Kurtic, Dan Alistarh | ![]() |
Github |
| Paper | [//]: #10/30 | |
| FedSpaLLM: Federated Pruning of Large Language Models | ||
| Guangji Bai, Yijiang Li, Zilinghan Li, Liang Zhao, Kibaek Kim | ![]() |
Paper |
| Pruning Foundation Models for High Accuracy without Retraining | ||
| Pu Zhao, Fei Sun, Xuan Shen, Pinrui Yu, Zhenglun Kong, Yanzhi Wang, Xue Lin | Github | |
| Paper | [//]: #10/30 | |
| Self-calibration for Language Model Quantization and Pruning | ||
| Miles Williams, George Chrysostomou, Nikolaos Aletras | ![]() |
Paper |
| Beware of Calibration Data for Pruning Large Language Models | ||
| Yixin Ji, Yang Xiang, Juntao Li, Qingrong Xia, Ping Li, Xinyu Duan, Zhefeng Wang, Min Zhang | Paper | |
| AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models | ||
| Haiquan Lu, Yefan Zhou, Shiwei Liu, Zhangyang Wang, Michael W. Mahoney, Yaoqing Yang | ![]() |
Github |
| Paper | [//]: #10/21 | |
| Beyond Linear Approximations: A Novel Pruning Approach for Attention Matrix | ||
| Yingyu Liang, Jiangxuan Long, Zhenmei Shi, Zhao Song, Yufa Zhou | ![]() |
Paper |
| DISP-LLM: Dimension-Independent Structural Pruning for Large Language Models | ||
| Shangqian Gao, Chi-Heng Lin, Ting Hua, Tang Zheng, Yilin Shen, Hongxia Jin, Yen-Chang Hsu | ![]() |
Github |
| Paper | [//]: #10/21 | |
| Self-Data Distillation for Recovering Quality in Pruned Large Language Models | ||
| Vithursan Thangarasa, Ganesh Venkatesh, Nish Sinnadurai, Sean Lie | ![]() |
Paper |
| LLM-Rank: A Graph Theoretical Approach to Pruning Large Language Models | ||
| David Hoffmann, Kailash Budhathoki, Matthaeus Kleindessner | ![]() |
Paper |
| Is C4 Dataset Optimal for Pruning? An Investigation of Calibration Data for LLM Pruning | ||
| Abhinav Bandari, Lu Yin, Cheng-Yu Hsieh, Ajay Kumar Jaiswal, Tianlong Chen, Li Shen, Ranjay Krishna, Shiwei Liu | ![]() |
Github |
| Paper | [//]: #10/13 | |
| Mitigating Copy Bias in In-Context Learning through Neuron Pruning | ||
| Ameen Ali, Lior Wolf, Ivan Titov | ![]() |
Paper |
| SQFT: Low-cost Model Adaptation in Low-precision Sparse Foundation Models | ||
| Juan Pablo Munoz, Jinjie Yuan, Nilesh Jain | ![]() |
Github |
| Paper | [//]: #10/01 | |
| The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs | ||
| Piotr Nawrot, Robert Li, Renjie Huang, Sebastian Ruder, Kelly Marchisio, Edoardo M. Ponti | ![]() |
Github |
| Paper | [//]: #05/05 | |
| Sparsified State-Space Models are Efficient Highway Networks | ||
| Woomin Song, Jihoon Tack, Sangwoo Mo, Seunghyuk Oh, Jinwoo Shin | ![]() |
Github |
| Paper | [//]: #06/03 |
Knowledge Distillation
| Title & Authors | Introduction | Links |
|---|---|---|
| :star: Knowledge Distillation of Large Language Models | ||
| Yuxian Gu, Li Dong, Furu Wei, Minlie Huang | ![]() |
Github |
| Paper | [//]: #Recommend | |
| Self-Evolution Knowledge Distillation for LLM-based Machine Translation | ||
| Yuncheng Song, Liang Ding, Changtong Zan, Shujian Huang | ![]() |
Paper |
| Large Language Models Compression via Low-Rank Feature Distillation | ||
| Yaya Sy, Christophe Cerisara, Irina Illina | ![]() |
Paper |
| Distilling Fine-grained Sentiment Understanding from Large Language Models | ||
| Yice Zhang, Guangyu Xie, Hongling Xu, Kaiheng Hou, Jianzhu Bao, Qianlong Wang, Shiwei Chen, Ruifeng Xu | ![]() |
Github |
| Paper | [//]: #12/30 | |
| Enhancing Knowledge Distillation for LLMs with Response-Priming Prompting | ||
| Vijay Goyal, Mustafa Khan, Aprameya Tirupati, Harveer Saini, Michael Lam, Kevin Zhu | ![]() |
Github |
| Paper | [//]: #12/30 | |
| Improving Mathematical Reasoning Capabilities of Small Language Models via Feedback-Driven Distillation | ||
| Xunyu Zhu, Jian Li, Can Ma, Weiping Wang | ![]() |
Paper |
| Generative Prompt Internalization | ||
| Haebin Shin, Lei Ji, Yeyun Gong, Sungdong Kim, Eunbi Choi, Minjoon Seo | ![]() |
Github |
| Paper | [//]: #12/02 | |
| SWITCH: Studying with Teacher for Knowledge Distillation of Large Language Models | ||
| Jahyun Koo, Yerin Hwang, Yongil Kim, Taegwan Kang, Hyunkyung Bae, Kyomin Jung | ![]() |
Paper |
| Beyond Autoregression: Fast LLMs via Self-Distillation Through Time | ||
| Justin Deschenaux, Caglar Gulcehre | ![]() |
Github |
| Paper | [//]: #11/17 | |
| Pre-training Distillation for Large Language Models: A Design Space Exploration | ||
| Hao Peng, Xin Lv, Yushi Bai, Zijun Yao, Jiajie Zhang, Lei Hou, Juanzi Li | Paper | |
| MiniPLM: Knowledge Distillation for Pre-Training Language Models | ||
| Yuxian Gu, Hao Zhou, Fandong Meng, Jie Zhou, Minlie Huang | ![]() |
Github |
| Paper | [//]: #10/29 | |
| Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling | ||
| Wenda Xu, Rujun Han, Zifeng Wang, Long T. Le, Dhruv Madeka, Lei Li, William Yang Wang, Rishabh Agarwal, Chen-Yu Lee, Tomas Pfister | ![]() |
Paper |
| Evolutionary Contrastive Distillation for Language Model Alignment | ||
| Julian Katz-Samuels, Zheng Li, Hyokun Yun, Priyanka Nigam, Yi Xu, Vaclav Petricek, Bing Yin, Trishul Chilimbi | ![]() |
Paper |
Quantization
Inference Acceleration
| Title & Authors | Introduction | Links |
|---|---|---|
| :star: Deja Vu: Contextual Sparsity for Efficient LLMs at Inference Time | ||
| Zichang Liu, Jue WANG, Tri Dao, Tianyi Zhou, Binhang Yuan, Zhao Song, Anshumali Shrivastava, Ce Zhang, Yuandong Tian, Christopher Re, Beidi Chen | ![]() |
Github |
| Paper | [//]: #Recommend | |
| :star: SpecInfer: Accelerating Generative LLM Serving with Speculative Inference and Token Tree Verification | ||
| Xupeng Miao, Gabriele Oliaro, Zhihao Zhang, Xinhao Cheng, Zeyu Wang, Rae Ying Yee Wong, Zhuoming Chen, Daiyaan Arfeen, Reyna Abhyankar, Zhihao Jia | ![]() |
Github |
| paper | [//]: #Recommend | |
| :star: Efficient Streaming Language Models with Attention Sinks | ||
| Guangxuan Xiao, Yuandong Tian, Beidi Chen, Song Han, Mike Lewis | ![]() |
Github |
| Paper | [//]: #Recommend | |
| :star: EAGLE: Lossless Acceleration of LLM Decoding by Feature Extrapolation | ||
| Yuhui Li, Chao Zhang, and Hongyang Zhang | ![]() |
Github |
| Blog | [//]: #Recommend | |
| :star: Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads | ||
| Tianle Cai, Yuhong Li, Zhengyang Geng, Hongwu Peng, Jason D. Lee, Deming Chen, Tri Dao | ![]() |
Github |
| Paper | [//]: #Recommend | |
| Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration | ||
| Zhuofan Wen, Shangtong Gui, Yang Feng | ![]() |
Paper |
| PLD+: Accelerating LLM inference by leveraging Language Model Artifacts | ||
| Shwetha Somasundaram, Anirudh Phukan, Apoorv Saxena | ![]() |
Paper |
| FastDraft: How to Train Your Draft | ||
| Ofir Zafrir, Igor Margulis, Dorin Shteyman, Guy Boudoukh | Paper | |
| SMoA: Improving Multi-agent Large Language Models with Sparse Mixture-of-Agents | ||
| Dawei Li, Zhen Tan, Peijia Qian, Yifan Li, Kumar Satvik Chaudhary, Lijie Hu, Jiayi Shen | ![]() |
Github |
| Paper | [//]: #11/18 | |
| The N-Grammys: Accelerating Autoregressive Inference with Learning-Free Batched Speculation | ||
| Lawrence Stewart, Matthew Trager, Sujan Kumar Gonugondla, Stefano Soatto | Paper | |
| Accelerated AI Inference via Dynamic Execution Methods | ||
| Haim Barad, Jascha Achterberg, Tien Pei Chou, Jean Yu | Paper | |
| SuffixDecoding: A Model-Free Approach to Speeding Up Large Language Model Inference | ||
| Gabriele Oliaro, Zhihao Jia, Daniel Campos, Aurick Qiao | ![]() |
Paper |
| Dynamic Strategy Planning for Efficient Question Answering with Large Language Models | ||
| Tanmay Parekh, Pradyot Prakash, Alexander Radovic, Akshay Shekher, Denis Savenkov | ![]() |
Paper |
| MagicPIG: LSH Sampling for Efficient LLM Generation | ||
| Zhuoming Chen, Ranajoy Sadhukhan, Zihao Ye, Yang Zhou, Jianyu Zhang, Niklas Nolte, Yuandong Tian, Matthijs Douze, Leon Bottou, Zhihao Jia, Beidi Chen | ![]() |
Github |
| Paper | [//]: #10/30 | |
| Faster Language Models with Better Multi-Token Prediction Using Tensor Decomposition | ||
| Artem Basharin, Andrei Chertkov, Ivan Oseledets | ![]() |
Paper |
| Efficient Inference for Augmented Large Language Models | ||
| Rana Shahout, Cong Liang, Shiji Xin, Qianru Lao, Yong Cui, Minlan Yu, Michael Mitzenmacher | ![]() |
Paper |
| Dynamic Vocabulary Pruning in Early-Exit LLMs | ||
| Jort Vincenti, Karim Abdel Sadek, Joan Velja, Matteo Nulli, Metod Jazbec | Github | |
| Paper | [//]: #10/29 | |
| CoreInfer: Accelerating Large Language Model Inference with Semantics-Inspired Adaptive Sparse Activation | ||
| Qinsi Wang, Saeed Vahidian, Hancheng Ye, Jianyang Gu, Jianyi Zhang, Yiran Chen | ![]() |
Github |
| Paper | [//]: #10/29 | |
| DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads | ||
| Guangxuan Xiao, Jiaming Tang, Jingwei Zuo, Junxian Guo, Shang Yang, Haotian Tang, Yao Fu, Song Han | ![]() |
Github |
| Paper | [//]: #10/21 | |
| DySpec: Faster Speculative Decoding with Dynamic Token Tree Structure | ||
| Yunfan Xiong, Ruoyu Zhang, Yanzeng Li, Tianhao Wu, Lei Zou | ![]() |
Paper |
| QSpec: Speculative Decoding with Complementary Quantization Schemes | ||
| Juntao Zhao, Wenhao Lu, Sheng Wang, Lingpeng Kong, Chuan Wu | ![]() |
Paper |
| TidalDecode: Fast and Accurate LLM Decoding with Position Persistent Sparse Attention | ||
| Lijie Yang, Zhihao Zhang, Zhuofu Chen, Zikun Li, Zhihao Jia | ![]() |
Paper |
| ParallelSpec: Parallel Drafter for Efficient Speculative Decoding | ||
| Zilin Xiao, Hongming Zhang, Tao Ge, Siru Ouyang, Vicente Ordonez, Dong Yu | ![]() |
Paper |
| SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration | ||
| Heming Xia, Yongqi Li, Jun Zhang, Cunxiao Du, Wenjie Li | ![]() |
Github |
| Paper | [//]: #10/14 | |
| TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked Text | ||
| Songshuo Lu, Hua Wang, Yutian Rong, Zhi Chen, Yaohua Tang | ![]() |
Github |
| Paper | [//]: #10/13 | |
| A Little Goes a Long Way: Efficient Long Context Training and Inference with Partial Contexts | ||
| Suyu Ge, Xihui Lin, Yunan Zhang, Jiawei Han, Hao Peng | ![]() |
Paper |
| Cache-Craft: Managing Chunk-Caches for Efficient Retrieval-Augmented Generation | ||
| Shubham Agarwal, Sai Sundaresan, Subrata Mitra, Debabrata Mahapatra, Archit Gupta, Rounak Sharma, Nirmal Joshua Kapu, Tong Yu, Shiv Saini | ![]() |
|
| Paper | [//]: #02/05 | |
| Mamba Drafters for Speculative Decoding | ||
| Daewon Choi, Seunghyuk Oh, Saket Dingliwal, Jihoon Tack, Kyuyoung Kim, Woomin Song, Seojin Kim, Insu Han, Jinwoo Shin, Aram Galstyan, Shubham Katiyar, Sravan Babu Bodapati | ![]() |
Paper |
| Accelerated Test-Time Scaling with Model-Free Speculative Sampling | ||
| Woomin Song, Saket Dingliwal, Sai Muralidhar Jayanthi, Bhavana Ganesh, Jinwoo Shin, Aram Galstyan, Sravan Babu Bodapati | ![]() |
Paper |
Efficient MOE
| Title & Authors | Introduction | Links |
|---|---|---|
| :star: Fast Inference of Mixture-of-Experts Language Models with Offloading | ||
| Artyom Eliseev, Denis Mazur | ![]() |
Github |
| Paper | [//]: #Recommend | |
| Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning | ||
| Mingyu Cao, Gen Li, Jie Ji, Jiaqi Zhang, Xiaolong Ma, Shiwei Liu, Lu Yin | ![]() |
Github |
| Paper | [//]: #12/09 | |
| Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference | ||
| Andrii Skliar, Ties van Rozendaal, Romain Lepert, Todor Boinovski, Mart van Baalen, Markus Nagel, Paul Whatmough, Babak Ehteshami Bejnordi | ![]() |
Paper |
| MoNTA: Accelerating Mixture-of-Experts Training with Network-Traffc-Aware Parallel Optimization | ||
| Jingming Guo, Yan Liu, Yu Meng, Zhiwei Tao, Banglan Liu, Gang Chen, Xiang Li | ![]() |
Github |
| Paper | [//]: #11/18 | |
| MoE-I2: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decomposition | ||
| Cheng Yang, Yang Sui, Jinqi Xiao, Lingyi Huang, Yu Gong, Yuanlin Duan, Wenqi Jia, Miao Yin, Yu Cheng, Bo Yuan | ![]() |
Github |
| Paper | [//]: #11/18 | |
| HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference | ||
| Peng Tang, Jiacheng Liu, Xiaofeng Hou, Yifei Pu, Jing Wang, Pheng-Ann Heng, Chao Li, Minyi Guo | ![]() |
Paper |
| ProMoE: Fast MoE-based LLM Serving using Proactive Caching | ||
| Xiaoniu Song, Zihang Zhong, Rong Chen | ![]() |
Paper |
| ExpertFlow: Optimized Expert Activation and Token Allocation for Efficient Mixture-of-Experts Inference | ||
| Xin He, Shunkang Zhang, Yuxin Wang, Haiyan Yin, Zihao Zeng, Shaohuai Shi, Zhenheng Tang, Xiaowen Chu, Ivor Tsang, Ong Yew Soon | ![]() |
Paper |
| EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference | ||
| Yulei Qian, Fengcun Li, Xiangyang Ji, Xiaoyu Zhao, Jianchao Tan, Kefeng Zhang, Xunliang Cai | Paper | |
| MC-MoE: Mixture Compressor for Mixture-of-Experts LLMs Gains More | ||
| Wei Huang, Yue Liao, Jianhui Liu, Ruifei He, Haoru Tan, Shiming Zhang, Hongsheng Li, Si Liu, Xiaojuan Qi | ![]() |
Github |
| Paper | [//]: #10/14 |
Efficient Architecture of LLM
| Title & Authors | Introduction | Links |
|---|---|---|
| Hymba: A Hybrid-head Architecture for Small Language Models | ||
| Xin Dong, Yonggan Fu, Shizhe Diao, Wonmin Byeon, Zijia Chen, Ameya Sunil Mahabaleshwarkar, Shih-Yang Liu, Matthijs Van Keirsbilck, Min-Hung Chen, Yoshi Suhara, Yingyan Lin, Jan Kautz, Pavlo Molchanov | ![]() |
Paper |
| :star: MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT | ||
| Omkar Thawakar, Ashmal Vayani, Salman Khan, Hisham Cholakal, Rao M. Anwer, Michael Felsberg, Tim Baldwin, Eric P. Xing, Fahad Shahbaz Khan | ![]() |
Github |
| Paper | ||
| Model | [//]: #Recommend | |
| :star: Megalodon: Efficient LLM Pretraining and Inference with Unlimited Context Length | ||
| Xuezhe Ma, Xiaomeng Yang, Wenhan Xiong, Beidi Chen, Lili Yu, Hao Zhang, Jonathan May, Luke Zettlemoyer, Omer Levy, Chunting Zhou | ![]() |
Github |
| Paper | [//]: #Recommend | |
| Taipan: Efficient and Expressive State Space Language Models with Selective Attention | ||
| Chien Van Nguyen, Huy Huu Nguyen, Thang M. Pham, Ruiyi Zhang, Hanieh Deilamsalehy, Puneet Mathur, Ryan A. Rossi, Trung Bui, Viet Dac Lai, Franck Dernoncourt, Thien Huu Nguyen | ![]() |
Paper |
| SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs | ||
| Yizhao Gao, Zhichen Zeng, Dayou Du, Shijie Cao, Hayden Kwok-Hay So, Ting Cao, Fan Yang, Mao Yang | ![]() |
Github |
| Paper | [//]: #10/21 | |
| Basis Sharing: Cross-Layer Parameter Sharing for Large Language Model Compression | ||
| Jingcun Wang, Yu-Guang Chen, Ing-Chao Lin, Bing Li, Grace Li Zhang | ![]() |
Github |
| Paper | [//]: #10/14 | |
| Rodimus*: Breaking the Accuracy-Efficiency Trade-Off with Efficient Attentions | ||
| Zhihao He, Hang Yu, Zi Gong, Shizhan Liu, Jianguo Li, Weiyao Lin | ![]() |
Paper |
| Compress, Gather, and Recompute: REFORMing Long-Context Processing in Transformers | ||
| Woomin Song, Sai Muralidhar Jayanthi, Srikanth Ronanki, Kanthashree Mysore Sathyendra, Jinwoo Shin, Aram Galstyan, Shubham Katiyar, Sravan Babu Bodapati | ![]() |
Paper |
KV Cache Compression
Text Compression
Low-Rank Decomposition
| Title & Authors | Introduction | Links |
|---|---|---|
| ESPACE: Dimensionality Reduction of Activations for Model Compression | ||
| Charbel Sakr, Brucek Khailany | ![]() |
Paper |
| Natural GaLore: Accelerating GaLore for memory-efficient LLM Training and Fine-tuning | ||
| Arijit Das | Github | |
| Paper | [//]: #10/30 | |
| CompAct: Compressed Activations for Memory-Efficient LLM Training | ||
| Yara Shamshoum, Nitzan Hodos, Yuval Sieradzki, Assaf Schuster | ![]() |
Paper |
Hardware/System/Serving
Efficient Fine-tuning
Efficient Training
Survey (or Benchmark)
| Title & Authors | Introduction | Links |
|---|---|---|
| Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding | ||
| Hyun Ryu, Eric Kim | ![]() |
Paper |
| LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators | ||
| Krishna Teja Chitty-Venkata, Siddhisanket Raskar, Bharat Kale, Farah Ferdaus et al | Github | |
| Paper | [//]: #11/18 | |
| Prompt Compression for Large Language Models: A Survey | ||
| Zongqian Li, Yinhong Liu, Yixuan Su, Nigel Collier | ![]() |
Github |
| Paper | [//]: #10/21 | |
| Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective | ||
| Jinhao Li, Jiaming Xu, Shan Huang, Yonghua Chen, Wen Li, Jun Liu, Yaoxiu Lian, Jiayi Pan, Li Ding, Hao Zhou, Guohao Dai | ![]() |
Paper |






























































































































































































