← Open Source
codefuse-ai

Awesome-Code-LLM

[TMLR] A curated list of language modeling researches for code (and other software engineering activities), plus related datasets.

ListsPaper collections
Open on GitHub
Momentum
+2stars in 24 hours+0.1%
3.45k
Stars
241
Forks
+6
This week
15
Contributors
Created 2023-09-21 · Updated 2026-10-07 · #2994 today
Top developers
README

Awesome-Code-LLM

This is the repo for our TMLR code LLM survey. If you find this repo helpful, please support us by citing:

@article{zhang2024unifying,
   title={Unifying the Perspectives of {NLP} and Software Engineering: A Survey on Language Models for Code},
   author={Ziyin Zhang and Chaoyu Chen and Bingchang Liu and Cong Liao and Zi Gong and Hang Yu and Jianguo Li and Rui Wang},
   journal={Transactions on Machine Learning Research},
   issn={2835-8856},
   year={2024},
   url={https://openreview.net/forum?id=hkNnGqZnpa}
}

News

🔥🔥🔥 [2026/05/20] Featured papers:

🔥🔥     [2025/12/04] 67 papers from EMNLP 2025 have been added. Search for the keyword "EMNLP 2025"!

🔥         [2024/09/06] Our survey has been accepted for publication by Transactions on Machine Learning Research (TMLR).

🔥🔥🔥 [2026/05/20] News from Codefuse

  • We released CoREB, a comprehensive code search benchmark covering two stages (retrieval, reranking), three tasks (text2code, code2text, code2code), and five languages. [data] [model & data]

  • Our paper ML-Embed is accepted to ICML 2026. [code] [model & data]

  • We released F2LLM-v2, a family of frontier multilingual emebedding models that sets new state-of-the-art on at least 11 MTEB benchmarks. [code] [model & data]

  • We are launching a new awesome project about embedding models: Awesome-Omnimodal-Embeddings

  • We released C2LLM, a family of state-of-the-art code embedding models in 0.5B and 7B sizes. C2LLM-7B ranks first on MTEB-Code leaderboard. [code] [model]

How to Contribute

If you find a paper to be missing from this repository, misplaced in a category, or lacking a reference to its journal/conference information, please do not hesitate to create an issue.

Table of Contents

  1. Surveys

  2. Models

    2.1 Base LLMs and Pretraining Strategies

    2.2 Existing LLM Adapted to Code

    2.3 General Pretraining on Code

    2.4 (Instruction) Fine-Tuning on Code

    2.5 Reinforcement Learning on Code

  3. When Coding Meets Reasoning

    3.1 Coding for Reasoning

    3.2 Code Simulation

    3.3 Code Agents

    3.4 Interactive Coding

    3.5 Frontend Navigation

  4. Code LLM for Low-Resource, Low-Level, and Domain-Specific Languages

  5. Methods/Models for Downstream Tasks

  6. Analysis of AI-Generated Code

  7. Human-LLM Interaction

  8. Datasets

    8.1 Pretraining

    8.2 Benchmarks

  9. Recommended Readings

  10. Other Awesome LLM Reading Lists

  11. Citation

  12. Star History

  13. Join Us

1. Surveys

  1. "Large Language Models Meet NL2Code: A Survey" [2022-12] [ACL 2023] [paper]

  2. "A Survey on Pretrained Language Models for Neural Code Intelligence" [2022-12] [paper]

  3. "An Empirical Comparison of Pre-Trained Models of Source Code" [2023-02] [ICSE 2023] [paper]

  4. "Large Language Models for Software Engineering: A Systematic Literature Review" [2023-08] [paper]

  5. "Towards an Understanding of Large Language Models in Software Engineering Tasks" [2023-08] [paper]

  6. "Pitfalls in Language Models for Code Intelligence: A Taxonomy and Survey" [2023-10] [paper]

  7. "A Survey on Large Language Models for Software Engineering" [2023-12] [paper]

  8. "Deep Learning for Code Intelligence: Survey, Benchmark and Toolkit" [2023-12] [paper]

  9. "A Survey of Neural Code Intelligence: Paradigms, Advances and Beyond" [2024-03] [paper]

  10. "Tasks People Prompt: A Taxonomy of LLM Downstream Tasks in Software Verification and Falsification Approaches" [2024-04] [paper]

  11. "Automatic Programming: Large Language Models and Beyond" [2024-05] [paper]

  12. "Software Engineering and Foundation Models: Insights from Industry Blogs Using a Jury of Foundation Models" [2024-10] [paper]

  13. "Deep Learning-based Software Engineering: Progress, Challenges, and Opportunities" [2024-10] [paper]

  14. "Large Language Models (LLMs) for Source Code Analysis: applications, models and datasets" [2025-03] [paper]

  15. "Challenges and Paths Towards AI for Software Engineering" [2025-03] [paper]

  16. "Software Development Life Cycle Perspective: A Survey of Benchmarks for CodeLLMs and Agents" [2025-05] [paper]

  17. "From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence" [2025-11] [paper]

2. Models

2.1 Base LLMs and Pretraining Strategies

These LLMs are not specifically trained for code, but have demonstrated varying coding capability.

  1. LaMDA: "LaMDA: Language Models for Dialog Applications" [2022-01] [paper]

  2. PaLM: "PaLM: Scaling Language Modeling with Pathways" [2022-04] [JMLR] [paper]

  3. GPT-NeoX: "GPT-NeoX-20B: An Open-Source Autoregressive Language Model" [2022-04] [ACL 2022 Workshop on Challenges & Perspectives in Creating LLMs] [paper] [repo]

  4. BLOOM: "BLOOM: A 176B-Parameter Open-Access Multilingual Language Model" [2022-11] [paper] [model]

  5. LLaMA: "LLaMA: Open and Efficient Foundation Language Models" [2023-02] [paper]

  6. GPT-4: "GPT-4 Technical Report" [2023-03] [paper]

  7. LLaMA 2: "Llama 2: Open Foundation and Fine-Tuned Chat Models" [2023-07] [paper] [repo]

  8. Phi-1.5: "Textbooks Are All You Need II: phi-1.5 technical report" [2023-09] [paper] [model]

  9. Baichuan 2: "Baichuan 2: Open Large-scale Language Models" [2023-09] [paper] [repo]

  10. Qwen: "Qwen Technical Report" [2023-09] [paper] [repo]

  11. Mistral: "Mistral 7B" [2023-10] [paper] [repo]

  12. Gemini: "Gemini: A Family of Highly Capable Multimodal Models" [2023-12] [paper]

  13. Phi-2: "Phi-2: The surprising power of small language models" [2023-12] [blog]

  14. YAYI2: "YAYI 2: Multilingual Open-Source Large Language Models" [2023-12] [paper] [repo]

  15. DeepSeek: "DeepSeek LLM: Scaling Open-Source Language Models with Longtermism" [2024-01] [paper] [repo]

  16. Mixtral: "Mixtral of Experts" [2024-01] [paper] [blog]

  17. DeepSeekMoE: "DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models" [2024-01] [paper] [repo]

  18. Orion: "Orion-14B: Open-source Multilingual Large Language Models" [2024-01] [paper] [repo]

  19. OLMo: "OLMo: Accelerating the Science of Language Models" [2024-02] [paper] [repo]

  20. Gemma: "Gemma: Open Models Based on Gemini Research and Technology" [2024-02] [paper] [blog]

  21. Claude 3: "The Claude 3 Model Family: Opus, Sonnet, Haiku" [2024-03] [paper] [blog]

  22. Yi: "Yi: Open Foundation Models by 01.AI" [2024-03] [paper] [repo]

  23. Poro: "Poro 34B and the Blessing of Multilinguality" [2024-04] [paper] [model]

  24. JetMoE: "JetMoE: Reaching Llama2 Performance with 0.1M Dollars" [2024-04] [paper] [repo]

  25. LLaMA 3: "The Llama 3 Herd of Models" [2024-04] [blog] [repo] [paper]

  26. Reka Core: "Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models" [2024-04] [paper]

  27. Phi-3: "Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone" [2024-04] [paper]

  28. OpenELM: "OpenELM: An Efficient Language Model Family with Open-source Training and Inference Framework" [2024-04] [paper] [repo]

  29. Tele-FLM: "Tele-FLM Technical Report" [2024-04] [paper] [model]

  30. DeepSeek-V2: "DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model" [2024-05] [paper] [repo]

  31. GECKO: "GECKO: Generative Language Model for English, Code and Korean" [2024-05] [paper] [model]

  32. MAP-Neo: "MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series" [2024-05] [paper] [repo]

  33. Zyda: "Zyda: A 1.3T Dataset for Open Language Modeling" [2024-06] [paper]

  34. Skywork-MoE: "Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models" [2024-06] [paper]

  35. Xmodel-LM: "Xmodel-LM Technical Report" [2024-06] [paper]

  36. GEB: "GEB-1.3B: Open Lightweight Large Language Model" [2024-06] [paper]

  37. HARE: "HARE: HumAn pRiors, a key to small language model Efficiency" [2024-06] [paper]

  38. DCLM: "DataComp-LM: In search of the next generation of training sets for language models" [2024-06] [paper]

  39. Nemotron-4: "Nemotron-4 340B Technical Report" [2024-06] [paper]

  40. ChatGLM: "ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools" [2024-06] [paper]

  41. FineWeb: "The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale" [2024-06] [paper]

  42. YuLan: "YuLan: An Open-source Large Language Model" [2024-06] [paper]

  43. Gemma 2: "Gemma 2: Improving Open Language Models at a Practical Size" [2024-06] [paper]

  44. H2O-Danube3: "H2O-Danube3 Technical Report" [2024-07] [paper]

  45. Qwen2: "Qwen2 Technical Report" [2024-07] [paper]

  46. ALLaM: "ALLaM: Large Language Models for Arabic and English" [2024-07] [paper]

  47. SeaLLMs 3: "SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian Languages" [2024-07] [paper]

  48. AFM: "Apple Intelligence Foundation Language Models" [2024-07] [paper]

  49. "To Code, or Not To Code? Exploring Impact of Code in Pre-training" [2024-08] [ICLR 2025] [paper]

  50. OLMoE: "OLMoE: Open Mixture-of-Experts Language Models" [2024-09] [paper]

  51. "How Does Code Pretraining Affect Language Model Task Performance?" [2024-09] [paper]

  52. EuroLLM: "EuroLLM: Multilingual Language Models for Europe" [2024-09] [paper]

  53. "Which Programming Language and What Features at Pre-training Stage Affect Downstream Logical Inference Performance?" [2024-10] [EMNLP 2024] [paper]

  54. GPT-4o: "GPT-4o System Card" [2024-10] [paper]

  55. Hunyuan-Large: "Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent" [2024-11] [paper]

  56. Crystal: "Crystal: Illuminating LLM Abilities on Language and Code" [2024-11] [paper]

  57. Zyda-2: "Zyda-2: a 5 Trillion Token High-Quality Dataset" [2024-11] [paper]

  58. Xmodel-1.5: "Xmodel-1.5: An 1B-scale Multilingual LLM" [2024-11] [paper]

  59. Yi-Lightning: "Yi-Lightning Technical Report" [2024-12] [paper]

  60. "RedStone: Curating General, Code, Math, and QA Data for Large Language Models" [2024-12] [paper]

  61. EXAONE 3.5: "EXAONE 3.5: Series of Large Language Models for Real-world Use Cases" [2024-12] [paper]

  62. "The Rise and Down of Babel Tower: Investigating the Evolution Process of Multilingual Code Large Language Model" [2024-12] [ICLR 2025] [paper]

  63. Phi-4: "Phi-4 Technical Report" [2024-12] [paper]

  64. Typhoon 2: "Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models" [2024-12] [paper]

  65. Qwen2.5: "Qwen2.5 Technical Report" [2024-12] [paper]

  66. YuLan-Mini: "YuLan-Mini: An Open Data-efficient Language Model" [2024-12] [paper]

  67. DeepSeek-V3: "DeepSeek-V3 Technical Report" [2024-12] [paper]

  68. OLMo 2: "2 OLMo 2 Furious" [2024-12] [paper]

  69. FinerWeb: "FinerWeb-10BT: Refining Web Data with LLM-Based Line-Level Filtering" [2025-01] [paper]

  70. MiniMax-01: "MiniMax-01: Scaling Foundation Models with Lightning Attention" [2025-01] [paper]

  71. SmolLM2: "SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model" [2025-02] [paper]

  72. Salamandra: "Salamandra Technical Report" [2025-02] [paper]

  73. Kanana: "Kanana: Compute-efficient Bilingual Language Models" [2025-02] [paper]

  74. Phi-4-Mini: "Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs" [2025-03] [paper]

  75. Ling: "Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs" [2025-03] [paper]

  76. Gemma 3: "Gemma 3 Technical Report" [2025-03] [paper]

  77. Command A: "Command A: An Enterprise-Ready Large Language Model" [2025-04] [paper]

  78. Llama-Nemotron: "Llama-Nemotron: Efficient Reasoning Models" [2025-05] [paper]

  79. MiMo: "MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining" [2025-05] [paper]

  80. xGen-small: "xGen-small Technical Report" [2025-05] [paper]

  81. Qwen3: "Qwen3 Technical Report" [2025-05] [paper]

  82. Hunyuan-TurboS: "Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought" [2025-05] [paper]

  83. EuroLLM-9B: "EuroLLM-9B: Technical Report" [2025-06] [paper]

  84. Gemini 2.5: "Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities" [2025-07] [paper]

  85. EXAONE 4.0: "EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes" [2025-07] [paper]

  86. TeleChat2: "Technical Report of TeleChat2, TeleChat2.5 and T1" [2025-07] [paper]

  87. Kimi K2: "Kimi K2: Open Agentic Intelligence" [2025-07] [paper]

  88. GLM-4.5: "GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models" [2025-08] [paper]

  89. GPT-OSS: "gpt-oss-120b & gpt-oss-20b Model Card" [2025-08] [paper]

  90. LongCat-Flash: "LongCat-Flash Technical Report" [2025-09] [paper]

  91. LLaDA-MoE: "LLaDA-MoE: A Sparse MoE Diffusion Language Model" [2025-09] [paper]

  92. Ring-1T: "Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model" [2025-10] [paper]

  93. Motif-2: "Motif 2 12.7B technical report" [2025-11] [paper]

  94. Instella: "Instella: Fully Open Language Models with Stellar Performance" [2025-11] [paper]

  95. DeepSeek-V3.2: "DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models" [2025-12] [paper]

  96. Olmo 3: "Olmo 3" [2025-12] [paper]

  97. T5Gemma 2: "T5Gemma 2: Seeing, Reading, and Understanding Longer" [2025-12] [paper]

  98. LLaDA2.0: "LLaDA2.0: Scaling Up Diffusion Language Models to 100B" [2025-12] [paper]

  99. Sigma-Moe-Tiny: "Sigma-Moe-Tiny Technical Report" [2025-12] [paper]

  100. Nemotron 3 Nano: "Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning" [2025-12] [paper]

  101. K-EXAONE: "K-EXAONE Technical Report" [2026-01] [paper]

  102. MiMo-V2-Flash: "MiMo-V2-Flash Technical Report" [2026-01] [paper]

  103. Ministral 3: "Ministral 3" [2026-01] [paper]

  104. Kimi K2.5: "Kimi K2.5: Visual Agentic Intelligence" [2026-02] [paper]

  105. EuroLLM-22B: "EuroLLM-22B: Technical Report" [2026-02] [paper]

  106. Step 3.5 Flash: "Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters" [2026-02] [paper]

  107. Nanbeige4.1: "Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts" [2026-02] [paper]

  108. GLM-5: "GLM-5: from Vibe Coding to Agentic Engineering" [2026-02] [paper]

  109. Trinity: "Arcee Trinity Large Technical Report" [2026-02] [paper]

  110. JoyAI-LLM Flash: "JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency" [2026-04] [paper]

2.2 Existing LLM Adapted to Code

These models are general-purpose LLMs further pretrained on code-related data.

  • Codex (GPT-3): "Evaluating Large Language Models Trained on Code" [2021-07] [paper]

  • PaLM Coder (PaLM): "PaLM: Scaling Language Modeling with Pathways" [2022-04] [JMLR] [paper]

  • Minerva (PaLM): "Solving Quantitative Reasoning Problems with Language Models" [2022-06] [paper]

  • PaLM 2 * (PaLM 2): "PaLM 2 Technical Report" [2023-05] [paper]

  • Code LLaMA (LLaMA 2): "Code Llama: Open Foundation Models for Code" [2023-08] [paper] [repo]

  • Lemur (LLaMA 2): "Lemur: Harmonizing Natural Language and Code for Language Agents" [2023-10] [ICLR 2024 Spotlight] [paper]

  • BTX (LLaMA 2): "Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM" [2024-03] [paper]

  • HiRoPE: "HiRoPE: Length Extrapolation for Code Models Using Hierarchical Position" [2024-03] [ACL 2024] [paper]

  • "Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models" [2024-03] [paper]

  • CodeGemma: "CodeGemma: Open Code Models Based on Gemma" [2024-04] [paper] [model]

  • DeepSeek-Coder-V2: "DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence" [2024-06] [paper]

  • "Promise and Peril of Collaborative Code Generation Models: Balancing Effectiveness and Memorization" [2024-09] [paper]

  • Qwen2.5-Coder: "Qwen2.5-Coder Technical Report" [2024-09] [paper]

  • Lingma SWE-GPT: "Lingma SWE-GPT: An Open Development-Process-Centric Language Model for Automated Software Improvement" [2024-11] [paper]

  • Ling-Coder-Lite: "Every Sample Matters: Leveraging Mixture-of-Experts and High-Quality Data for Efficient and Accurate Code LLM" [2025-03] [paper]

  • Mify-Coder: "State-of-the-art Small Language Coder Model: Mify-Coder" [2025-12] [paper]

  • Composer 2: "Composer 2 Technical Report" [2026-03] [paper]

2.3 General Pretraining on Code

These models are Transformer encoders, decoders, and encoder-decoders pretrained from scratch using existing objectives for general language modeling.

Encoder

  1. CuBERT (MLM + NSP): "Learning and Evaluating Contextual Embedding of Source Code" [2019-12] [ICML 2020] [paper] [repo]

  2. CodeBERT (MLM + RTD): "CodeBERT: A Pre-Trained Model for Programming and Natural Languages" [2020-02] [EMNLP 2020 findings] [paper] [repo]

  3. GraphCodeBERT (MLM + DFG Edge Prediction + DFG Node Alignment): "GraphCodeBERT: Pre-training Code Representations with Data Flow" [2020-09] [ICLR 2021] [paper] [repo]

  4. SynCoBERT (MLM + Identifier Prediction + AST Edge Prediction + Contrastive Learning): "SynCoBERT: Syntax-Guided Multi-Modal Contrastive Pre-Training for Code Representation" [2021-08] [paper]

  5. DISCO (MLM + Node Type MLM + Contrastive Learning): "Towards Learning (Dis)-Similarity of Source Code from Program Contrasts" [2021-10] [ACL 2022] [paper]

  6. Code-MVP (MLM + Type Inference + Contrastive Learning): "CODE-MVP: Learning to Represent Source Code from Multiple Views with Contrastive Pre-Training" [2022-05] [NAACL 2022 Technical Track] [paper]

  7. CodeSage (MLM + Deobfuscation + Contrastive Learning): "Code Representation Learning At Scale" [2024-02] [ICLR 2024] [paper]

  8. CoLSBERT (MLM): "Scaling Laws Behind Code Understanding Model" [2024-02] [paper]

  9. CodeSSM: "CodeSSM: Towards State Space Models for Code Understanding" [2025-05] [EMNLP 2025] [paper]

Decoder

  1. GPT-C (CLM): "IntelliCode Compose: Code Generation Using Transformer" [2020-05] [ESEC/FSE 2020] [paper]

  2. CodeGPT (CLM): "CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation" [2021-02] [NeurIPS Datasets and Benchmarks 2021] [paper] [repo]

  3. CodeParrot (CLM) [2021-12] [blog]

  4. PolyCoder (CLM): "A Systematic Evaluation of Large Language Models of Code" [2022-02] [DL4C@ICLR 2022] [paper] [repo]

  5. CodeGen (CLM): "CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis" [2022-03] [ICLR 2023] [paper] [repo]

  6. InCoder (Causal Masking): "InCoder: A Generative Model for Code Infilling and Synthesis" [2022-04] [ICLR 2023] [paper] [repo]

  7. PyCodeGPT (CLM): "CERT: Continual Pre-Training on Sketches for Library-Oriented Code Generation" [2022-06] [IJCAI-ECAI 2022] [paper] [repo]

  8. PanGu-Coder (CLM): "PanGu-Coder: Program Synthesis with Function-Level Language Modeling" [2022-07] [paper]

  9. SantaCoder (FIM): "SantaCoder: don't reach for the stars!" [2023-01] [paper] [model]

  10. CodeGeeX (CLM): "CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Evaluations on HumanEval-X" [2023-03] [paper] [repo]

  11. StarCoder (FIM): "StarCoder: may the source be with you!" [2023-05] [paper] [model]

  12. Phi-1 (CLM): "Textbooks Are All You Need" [2023-06] [paper] [model]

  13. CodeFuse (CLM): "CodeFuse-13B: A Pretrained Multi-lingual Code Large Language Model" [2023-10] [paper] [model]

  14. DeepSeek Coder (CLM+FIM): "DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence" [2024-01] [paper] [repo]

  15. StarCoder2 (CLM+FIM): "StarCoder 2 and The Stack v2: The Next Generation" [2024-02] [paper] [repo]

  16. CodeShell (CLM+FIM): "CodeShell Technical Report" [2024-03] [paper] [repo]

  17. CodeQwen1.5 [2024-04] [blog]

  18. Granite: "Granite Code Models: A Family of Open Foundation Models for Code Intelligence" [2024-05] [paper] "Scaling Granite Code Models to 128K Context" [2024-07] [paper]

  19. NT-Java: "Narrow Transformer: Starcoder-Based Java-LM For Desktop" [2024-07] [paper]

  20. Arctic-SnowCoder: "Arctic-SnowCoder: Demystifying High-Quality Data in Code Pretraining" [2024-09] [paper]

  21. aiXcoder: "aiXcoder-7B: A Lightweight and Effective Large Language Model for Code Completion" [2024-10] [paper]

  22. OpenCoder: "OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models" [2024-11] [ACL 2025] [paper]

  23. ObscuraCoder: "ObscuraCoder: Powering Efficient Code LM Pre-Training Via Obfuscation Grounding" [2025-03] [ICLR 2025] [paper]

  24. "Structure-Aware Fill-in-the-Middle Pretraining for Code" [2025-05] [paper]

  25. Seed-Coder: "Seed-Coder: Let the Code Model Curate Data for Itself" [2025-06] [paper]

  26. CWM: "CWM: An Open-Weights LLM for Research on Code Generation with World Models" [2025-09] [paper]

  27. Mellum: "Mellum: Production-Grade in-IDE Contextual Code Completion with Multi-File Project Understanding" [2025-10] [paper]

  28. "Scaling Laws for Code: A More Data-Hungry Regime" [2025-10] [paper]

  29. "Scaling Laws for Code: Every Programming Language Matters" [2025-12] [paper]

  30. InCoder: "InCoder-32B: Code Foundation Model for Industrial Scenarios" [2026-03] [paper]

Encoder-Decoder

  1. PyMT5 (Span Corruption): "PyMT5: multi-mode translation of natural language and Python code with transformers" [2020-10] [EMNLP 2020] [paper]

  2. Mastropaolo et al. (MLM + Deobfuscation): "DOBF: A Deobfuscation Pre-Training Objective for Programming Languages" [2021-02] [ICSE 2021] [paper] [repo]

  3. DOBF (Span Corruption): "Studying the Usage of Text-To-Text Transfer Transformer to Support Code-Related Tasks" [2021-02] [NeurIPS 2021] [paper] [repo]

  4. PLBART (DAE): "Unified Pre-training for Program Understanding and Generation" [2021-03] [NAACL 2021] [paper] [repo]

  5. CodeT5 (Span Corruption + Identifier Tagging + Masked Identifier Prediction + Text2Code + Code2Text): "CodeT5: Identifier-aware Unified Pre-trained Encoder-Decoder Models for Code Understanding and Generation" [2021-09] [EMNLP 2021] [paper] [repo]

  6. SPT-Code (Span Corruption + NSP + Method Name Prediction): "SPT-Code: Sequence-to-Sequence Pre-Training for Learning Source Code Representations" [2022-01] [ICSE 2022 Technical Track] [paper]

  7. AlphaCode (MLM + CLM): "Competition-Level Code Generation with AlphaCode" [2022-02] [Science] [paper] [blog]

  8. NatGen (Code Naturalization): "NatGen: Generative pre-training by "Naturalizing" source code" [2022-06] [ESEC/FSE 2022] [paper] [repo]

  9. ERNIE-Code (Span Corruption + Pivot-based Translation LM): "ERNIE-Code: Beyond English-Centric Cross-lingual Pretraining for Programming Languages" [2022-12] [ACL23 (Findings)] [paper][repo]

  10. CodeT5+ (Span Corruption + CLM + Text-Code Contrastive Learning + Text-Code Translation): "CodeT5+: Open Code Large Language Models for Code Understanding and Generation" [2023-05] [EMNLP 2023] [paper] [repo]

  11. AST-T5 (Span Corruption): "AST-T5: Structure-Aware Pretraining for Code Generation and Understanding" [2024-01] [ICML 2024] [paper]

  12. DivoT5: "Directional Diffusion-Style Code Editing Pre-training" [2025-01] [paper]

UniLM

  1. CugLM (MLM + NSP + CLM): "Multi-task Learning based Pre-trained Language Model for Code Completion" [2020-12] [ASE 2020] [paper]

  2. UniXcoder (MLM + NSP + CLM + Span Corruption + Contrastive Learning + Code2Text): "UniXcoder: Unified Cross-Modal Pre-training for Code Representation" [2022-03] [ACL 2022] [paper] [repo]

Other Models

  1. DiffuCoder: "DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation" [2025-06] [paper]

  2. Dream-Coder: "Dream-Coder 7B: An Open Diffusion Language Model for Code" [2025-09] [paper]

  3. "Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation" [2025-09] [paper]

  4. CoDA: "CoDA: Coding LM via Diffusion Adaptation" [2025-10] [paper]

  5. Stable-DiffCoder: "Stable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Model" [2026-01] [paper]

  6. DreamOn: "DreamOn: Diffusion Language Models For Code Infilling Beyond Fixed-size Canvas" [2026-02] [paper]

  7. "CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding" [2026-02] [paper]

  8. IQuest-Coder-V1: "IQuest-Coder-V1 Technical Report" [2026-02] [paper]

2.4 (Instruction) Fine-Tuning on Code

These models apply Instruction Fine-Tuning techniques to enhance the capacities of Code LLMs.

  1. WizardCoder (StarCoder + Evol-Instruct): "WizardCoder: Empowering Code Large Language Models with Evol-Instruct" [2023-06] [ICLR 2024] [paper] [repo]

  2. PanGu-Coder 2 (StarCoder + Evol-Instruct + RRTF): "PanGu-Coder2: Boosting Large Language Models for Code with Ranking Feedback" [2023-07] [paper]

  3. OctoCoder (StarCoder) / OctoGeeX (CodeGeeX2): "OctoPack: Instruction Tuning Code Large Language Models" [2023-08] [ICLR 2024 Spotlight] [paper] [repo]

  4. "At Which Training Stage Does Code Data Help LLMs Reasoning" [2023-09] [ICLR 2024 Spotlight] [paper]

  5. InstructCoder: "InstructCoder: Instruction Tuning Large Language Models for Code Editing" [paper] [repo]

  6. MFTCoder: "MFTCoder: Boosting Code LLMs with Multitask Fine-Tuning" [2023-11] [KDD 2024] [paper] [repo]

  7. "LLM-Assisted Code Cleaning For Training Accurate Code Generators" [2023-11] [ICLR 2024] [paper]

  8. Magicoder: "Magicoder: Empowering Code Generation with OSS-Instruct" [2023-12] [ICML 2024] [paper]

  9. WaveCoder: "WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning" [2023-12] [ACL 2024] [paper]

  10. Astraios: "Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models" [2024-01] [paper]

  11. DolphCoder: "DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning" [2024-02] [ACL 2024] [paper]

  12. SafeCoder: "Instruction Tuning for Secure Code Generation" [2024-02] [ICML 2024] [paper]

  13. "Code Needs Comments: Enhancing Code LLMs with Comment Augmentation" [ACL 2024 Findings] [paper]

  14. CCT: "Code Comparison Tuning for Code Large Language Models" [2024-03] [paper]

  15. SAT: "Structure-aware Fine-tuning for Code Pre-trained Models" [2024-04] [paper]

  16. CodeFort: "CodeFort: Robust Training for Code Generation Models" [2024-04] [EMNLP 2024 Findings] [paper]

  17. XFT: "XFT: Unlocking the Power of Code Instruction Tuning by Simply Merging Upcycled Mixture-of-Experts" [2024-04] [ACL 2024] [paper] [repo]

  18. AIEV-Instruct: "AutoCoder: Enhancing Code Large Language Model with AIEV-Instruct" [2024-05] [paper]

  19. AlchemistCoder: "AlchemistCoder: Harmonizing and Eliciting Code Capability by Hindsight Tuning on Multi-source Data" [2024-05] [NeurIPS 2024] [paper]

  20. "From Symbolic Tasks to Code Generation: Diversification Yields Better Task Performers" [2024-05] [paper]

  21. "Unveiling the Impact of Coding Data Instruction Fine-Tuning on Large Language Models Reasoning" [2024-05] [paper]

  22. SemCoder: "SemCoder: Training Code Language Models with Comprehensive Semantics Reasoning" [2024-06] [NeurIPS 2024] [paper]

  23. PLUM: "PLUM: Preference Learning Plus Test Cases Yields Better Code Language Models" [2024-06] [paper]

  24. mCoder: "McEval: Massively Multilingual Code Evaluation" [2024-06] [ICLR 2025] [paper]

  25. "Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models" [2024-06] [paper]

  26. Code-Optimise: "Code-Optimise: Self-Generated Preference Data for Correctness and Efficiency" [2024-06] [paper]

  27. UniCoder: "UniCoder: Scaling Code Large Language Model via Universal Code" [2024-06] [ACL 2024] [paper]

  28. "Brevity is the soul of wit: Pruning long files for code generation" [2024-06] [paper]

  29. "Code Less, Align More: Efficient LLM Fine-tuning for Code Generation with Data Pruning" [2024-07] [paper]

  30. InverseCoder: "InverseCoder: Unleashing the Power of Instruction-Tuned Code LLMs with Inverse-Instruct" [2024-07] [paper]

  31. "Curriculum Learning for Small Code Language Models" [2024-07] [paper]

  32. Genetic-Instruct: "Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models" [2024-07] [paper]

  33. DataScope: "API-guided Dataset Synthesis to Finetune Large Code Models" [2024-08] [paper]

  34. XCoder: "How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data" [2024-09] [EMNLP 2024] [paper]

  35. GALLa: "GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding" [2024-09] [ACL 2025] [paper]

  36. HexaCoder: "HexaCoder: Secure Code Generation via Oracle-Guided Synthetic Training Data" [2024-09] [paper]

  37. AMR-Evol: "AMR-Evol: Adaptive Modular Response Evolution Elicits Better Knowledge Distillation for Large Language Models in Code Generation" [2024-10] [EMNLP 2024] [paper]

  38. LintSeq: "Training Language Models on Synthetic Edit Sequences Improves Code Synthesis" [2024-10] [ICLR 2025] [paper]

  39. CoBa: "CoBa: Convergence Balancer for Multitask Finetuning of Large Language Models" [2024-10] [EMNLP 2024] [paper]

  40. CursorCore: "CursorCore: Assist Programming through Aligning Anything" [2024-10] [paper]

  41. SelfCodeAlign: "SelfCodeAlign: Self-Alignment for Code Generation" [2024-10] [NeurIPS 2024] [paper]

  42. "Mastering the Craft of Data Synthesis for CodeLLMs" [2024-10] [paper]

  43. CodeLutra: "CodeLutra: Boosting LLM Code Generation via Preference-Guided Refinement" [2024-11] [paper]

  44. DSTC: "DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs" [2024-11] [paper]

  45. WarriorCoder: "WarriorCoder: Learning from Expert Battles to Augment Code Large Language Models" [2024-12] [ACL 2025] [paper]

  46. EpiCoder: "EpiCoder: Encompassing Diversity and Complexity in Code Generation" [2025-01] [ICML 2025] [paper]

  47. Qwen2.5-xCoder: "Multi-Agent Collaboration for Multilingual Code Instruction Tuning" [2025-02] [ACL 2025] [paper]

  48. UnitCoder: "UnitCoder: Scalable Code Synthesis from Pre-training Corpora" [2025-02] [EMNLP 2025] [paper]

  49. GiFT: "GiFT: Gibbs Fine-Tuning for Code Generation" [2025-02] [ACL 2025] [paper]

  50. KODCODE: "KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding" [2025-03] [ACL 2025 Findings] [paper]

  51. NextCoder: "NextCoder: Robust Adaptation of Code LMs to Diverse Code Edits" [2025-03] [ICML 2025] [paper]

  52. FAIT: "FAIT: Fault-Aware Fine-Tuning for Better Code Generation" [2025-03] [paper]

  53. Z1: "Z1: Efficient Test-time Scaling with Code" [2025-04] [EMNLP 2025 Industry] [paper]

  54. OpenCodeReasoning: "OpenCodeReasoning: Advancing Data Distillation for Competitive Coding" [2025-04] [paper]

  55. OpenCodeInstruct: "OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs" [2025-04] [paper]

  56. "Data-efficient LLM Fine-tuning for Code Generation" [2025-04] [paper]

  57. "AKD : Adversarial Knowledge Distillation For Large Language Models Alignment on Coding tasks" [2025-05] [paper]

  58. "CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation" [2025-05] [paper]

  59. VisCoder: "VisCoder: Fine-Tuning LLMs for Executable Python Visualization Code Generation" [2025-05] [EMNLP 2025 Findings] [paper]

  60. "AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy" [2025-06] [paper]

  61. MoLE: "Mix-of-Language-Experts Architecture for Multilingual Programming" [2025-06] [paper]

  62. OpenCodeReasoning-II: "OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique" [2025-07] [paper]

  63. "CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback" [2025-07] [paper]

  64. Tree-of-Evolution: "Tree-of-Evolution: Tree-Structured Instruction Evolution for Code Generation in Large Language Models" [2025-07] [ACL 2025] [paper]

  65. SCoder: "SCoder: Progressive Self-Distillation for Bootstrapping Small-Scale Data Synthesizers to Empower Code LLMs" [2025-09] [EMNLP 2025 Fidnings] [paper]

  66. "Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models" [2025-09] [EMNLP 2025 Findings] [paper]

  67. "SCoGen: Scenario-Centric Graph-Based Synthesis of Real-World Code Problems" [2025-09] [paper]

  68. "Verification Limits Code LLM Training" [2025-09] [paper]

  69. JanusCoder: "JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence" [2025-10] [paper]

  70. VisCoder2: "VisCoder2: Building Multi-Language Visualization Coding Agents" [2025-10] [paper]

  71. "Beyond Language Boundaries: Uncovering Programming Language Families for Code Language Models" [2025-12] [paper]

  72. X-Coder: "X-Coder: Advancing Competitive Programming with Fully Synthetic Tasks, Solutions, and Tests" [2026-01] [paper]

  73. SRI: "From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning" [2026-01] [paper]

  74. "HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-BENCH" [2026-01] [paper]

  75. "Multi-task Code LLMs: Data Mix or Model Merge?" [2026-01] [paper]

  76. "QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions" [2026-03] [paper]

  77. "Embarrassingly Simple Self-Distillation Improves Code Generation" [2026-04] [paper]

  78. "Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL" [2026-04] [paper]

2.5 Reinforcement Learning on Code

  1. CompCoder: "Compilable Neural Code Generation with Compiler Feedback" [2022-03] [ACL 2022] [paper]

  2. CodeRL: "CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning" [2022-07] [NeurIPS 2022] [paper] [repo]

  3. PPOCoder: "Execution-based Code Generation using Deep Reinforcement Learning" [2023-01] [TMLR 2023] [paper] [repo]

  4. RLTF: "RLTF: Reinforcement Learning from Unit Test Feedback" [2023-07] [paper] [repo]

  5. B-Coder: "B-Coder: Value-Based Deep Reinforcement Learning for Program Synthesis" [2023-10] [ICLR 2024] [paper]

  6. IRCoCo: "IRCoCo: Immediate Rewards-Guided Deep Reinforcement Learning for Code Completion" [2024-01] [FSE 2024] [paper]

  7. StepCoder: "StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback" [2024-02] [ACL 2024] [paper]

  8. RLPF & DPA: "Performance-Aligned LLMs for Generating Fast Code" [2024-04] [paper]

  9. "Measuring memorization in RLHF for code completion" [2024-06] [ICLR 2025] [paper]

  10. "Applying RLAIF for Code Generation with API-usage in Lightweight LLMs" [2024-06] [paper]

  11. RLCoder: "RLCoder: Reinforcement Learning for Repository-Level Code Completion" [2024-07] [paper]

  12. PF-PPO: "Policy Filtration in RLHF to Fine-Tune LLM for Code Generation" [2024-09] [paper]

  13. Coffee-Gym: "Coffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Code" [2024-09] [EMNLP 2024] [paper]

  14. RLEF: "RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning" [2024-10] [ICML 2025] [paper]

  15. CodePMP: "CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning" [2024-10] [paper]

  16. CodeDPO: "CodeDPO: Aligning Code Models with Self Generated and Verified Source Code" [2024-10] [ACL 2025] [paper]

  17. "Process Supervision-Guided Policy Optimization for Code Generation" [2024-10] [paper]

  18. "Aligning CodeLLMs with Direct Preference Optimization" [2024-10] [paper]

  19. FALCON: "FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system" [2024-10] [paper]

  20. PFPO: "Preference Optimization for Reasoning with Pseudo Feedback" [2024-11] [paper]

  21. o1-Coder: "o1-Coder: an o1 Replication for Coding" [2024-11] [paper]

  22. PRLCoder: "Process-Supervised Reinforcement Learning for Code Generation" [2025-02] [EMNLP 2025] [paper]

  23. AceCoder: "ACECODER: Acing Coder RL via Automated Test-Case Synthesis" [2025-02] [ACL 2025] [paper]

  24. Focused-DPO: "Focused-DPO: Enhancing Code Generation Through Focused Preference Optimization on Error-Prone Points" [2025-02] [ACL 2025 Findings] [paper]

  25. SWE-RL: "SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution" [2025-02] [paper]

  26. AceReason-Nemotron: "AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning" [2025-05] [paper]

  27. rStar-Coder: "rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset" [2025-05] [paper]

  28. CURE: "Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning" [2025-06] [paper]

  29. Magistral [2025-06] [paper]

  30. Ring-lite: "Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs" [2025-06] [paper]

  31. ReST-RL: "ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding" [2025-08] [paper]

  32. "Towards Better Correctness and Efficiency in Code Generation" [2025-08] [paper]

  33. "Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization" [2025-09] [paper]

  34. "DELTA-Code: How Does RL Unlock and Transfer New Programming Algorithms in LLMs?" [2025-09] [paper]

  35. Critique-Coder: "Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning" [2025-09] [paper]

  36. CodeRL+: "CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment" [2025-10] [paper]

  37. "GAPO: Group Adaptive Policy Optimization for Real-World Code Edit" [2025-10] [paper]

  38. AesCoder: "Code Aesthetics with Agentic Reward Feedback" [2025-10] [paper]

  39. MURPHY: "MURPHY: Multi-Turn GRPO for Self Correcting Code Generation" [2025-11] [paper]

  40. VeRPO: "VeRPO: Verifiable Dense Reward Policy Optimization for Code Generation" [2026-01] [paper]

  41. Cobalt: "Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation" [2026-02] [paper]

  42. MicroCoder-GRPO: "Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models" [2026-03] [paper]

  43. "ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning" [2026-03] [paper]

  44. EvolveCoder: "EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning" [2026-03] [paper]

  45. Code-A1: "Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning" [2026-03] [paper]

3. When Coding Meets Reasoning

3.1 Coding for Reasoning

  1. PAL: "PAL: Program-aided Language Models" [2022-11] [ICML 2023] [paper] [repo]

  2. PoT: "Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks" [2022-11] [TMLR 2023] [paper] [repo]

  3. PaD: "PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning" [2023-05] [NAACL 2024] [paper]

  4. CSV: "Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification" [2023-08] [ICLR 2024] [paper]

  5. MathCoder: "MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning" [2023-10] [ICLR 2024] [paper]

  6. CoC: "Chain of Code: Reasoning with a Language Model-Augmented Code Emulator" [2023-12] [ICML 2024] [paper]

  7. EHRAgent: "EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health Records" [2024-01] [EMNLP 2024] [paper]

  8. MARIO: "MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline" [2024-01] [ACL 2024 Findings] [paper]

  9. "Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMs" [2024-01] [EMNLP 2024] [paper]

  10. ReGAL: "ReGAL: Refactoring Programs to Discover Generalizable Abstractions" [2024-01] [ICML 2024] [paper]

  11. CodeAct: "Executable Code Actions Elicit Better LLM Agents" [2024-02] [ICML 2024] [paper]

  12. MultiPoT: "Python is Not Always the Best Choice: Embracing Multilingual Program of Thoughts" [2024-02] [EMNLP 2024] [paper]

  13. HProPro: "Exploring Hybrid Question Answering via Program-based Prompting" [2024-02] [ACL 2024] [paper]

  14. HTL: "How Do Humans Write Code? Large Models Do It the Same Way Too" [2024-02] [EMNLP 2024] [paper]

  15. xSTREET: "Eliciting Better Multilingual Structured Reasoning from LLMs through Code" [2024-03] [ACL 2024] [paper]

  16. FlowMind: "FlowMind: Automatic Workflow Generation with LLMs" [2024-03] [paper]

  17. Think-and-Execute: "Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language Models" [2024-04] [EMNLP 2024] [paper]

  18. CoRE: "CoRE: LLM as Interpreter for Natural Language Programming, Pseudo-Code Programming, and Flow Programming of AI Agents" [2024-05] [paper]

  19. MuMath-Code: "MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical Reasoning" [2024-05] [EMNLP 2024] [paper]

  20. COGEX: "Learning to Reason via Program Generation, Emulation, and Search" [2024-05] [NeurIPS 2024] [paper]

  21. "Arithmetic Reasoning with LLM: Prolog Generation & Permutation" [2024-05] [paper]

  22. "Can LLMs Reason in the Wild with Programs?" [2024-06] [EMNLP 2024 Findings] [paper]

  23. DotaMath: "DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning" [2024-07] [paper]

  24. CIBench: "CIBench: Evaluating Your LLMs with a Code Interpreter Plugin" [2024-07] [paper]

  25. PyBench: "PyBench: Evaluating LLM Agent on various real-world coding tasks" [2024-07] [paper]

  26. AdaCoder: "AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering" [2024-07] [paper]

  27. PyramidCoder: "Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering" [2024-07] [paper]

  28. CodeGraph: "CodeGraph: Enhancing Graph Reasoning of LLMs with Code" [2024-08] [paper]

  29. SIaM: "SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models" [2024-08] [paper]

  30. CodePlan: "CodePlan: Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning" [2024-09] [ICLR 2025] [paper]

  31. PoT: "Proof of Thought : Neurosymbolic Program Synthesis allows Robust and Interpretable Reasoning" [2024-09] [paper]

  32. MetaMath: "MetaMath: Integrating Natural Language and Code for Enhanced Mathematical Reasoning in Large Language Models" [2024-09] [paper]

  33. "BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data" [2024-10] [paper]

  34. CodeSteer: "Steering Large Language Models between Code Execution and Textual Reasoning" [2024-10] [ICLR 2025] [paper]

  35. MathCoder2: "MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical Code" [2024-10] [ICLR 2025] [paper]

  36. LLMFP: "Planning Anything with Rigor: General-Purpose Zero-Shot Planning with LLM-based Formalized Programming" [2024-10] [paper]

  37. Prove: "Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning" [2024-10] [paper]

  38. PROVE: "Trust but Verify: Programmatic VLM Evaluation in the Wild" [2024-10] [paper]

  39. GeoCoder: "GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models" [2024-10] [paper]

  40. ReasonAgain: "ReasonAgain: Using Extractable Symbolic Programs to Evaluate Mathematical Reasoning" [2024-10] [paper]

  41. GFP: "Gap-Filling Prompting Enhances Code-Assisted Mathematical Reasoning" [2024-11] [paper]

  42. UTMath: "UTMath: Math Evaluation with Unit Test via Reasoning-to-Coding Thoughts" [2024-11] [paper]

  43. CoCoP: "CoCoP: Enhancing Text Classification with LLM through Code Completion Prompt" [2024-11] [paper]

  44. REPL-Plan: "Interactive and Expressive Code-Augmented Planning with Large Language Models" [2024-11] [paper]

  45. CrossPAL: "Empowering Multi-step Reasoning across Languages via Program-Aided Language Models" [2024-11] [EMNLP 2024] [paper]

  46. "From Code to Play: Benchmarking Program Search for Games Using Large Language Models" [2024-12] [paper]

  47. CoinMath: "CoinMath: Harnessing the Power of Coding Instruction for Math LLMs" [2024-12] [ACL 2025 Findings] [paper]

  48. MultiLingPoT: "MultiLingPoT: Boosting Mathematical Reasoning in LLMs through Multilingual Program Integration" [2024-12] [EMNLP 2025 Findings] [paper]

  49. ProgCo: "ProgCo: Program Helps Self-Correction of Large Language Models" [2025-01] [ACL 2025] [paper]

  50. PIE: "Pseudocode-Injection Magic: Enabling LLMs to Tackle Graph Computational Tasks" [2025-01] [paper]

  51. AutoCode4Math: "Learning Autonomous Code Integration for Math Language Models" [2025-02] [paper]

  52. MIHTCCT: "MIH-TCCT: Mitigating Inconsistent Hallucinations in LLMs via Event-Driven Text-Code Cyclic Training" [2025-02] [paper]

  53. ToolCoder: "ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language Models" [2025-02] [paper]

  54. RM-PoT: "RM-PoT: Reformulating Mathematical Problems and Solving via Program of Thoughts" [2025-02] [paper]

  55. SBSC: "SBSC: Step-By-Step Coding for Improving Mathematical Olympiad Performance" [2025-02] [ICLR 2025] [paper]

  56. "Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments" [2025-02] [ACL 2025 Findings] [paper]

  57. "Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs" [2025-02] [EMNLP 2025] [paper]

  58. "The KoLMogorov Test: Compression by Code Generation" [2025-03] [ICLR 2025] [paper]

  59. MathCoder-VL: "MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning" [2025-05] [ACL 2025 Findings] [paper]

  60. R1-Code-Interpreter: "R1-Code-Interpreter: Training LLMs to Reason with Code via Supervised and Reinforcement Learning" [2025-05] [paper]

  61. "Towards Effective Code-Integrated Reasoning" [2025-05] [paper]

  62. "CoRT: Code-integrated Reasoning within Thinking" [2025-06] [paper]

  63. "Code Execution as Grounded Supervision for LLM Reasoning" [2025-06] [EMNLP 2025] [paper]

  64. PBB: "Programming by Backprop: LLMs Acquire Reusable Algorithmic Abstractions During Code Training" [2025-06] [paper]

  65. "On Code-Induced Reasoning in LLMs" [2025-09] [paper]

  66. PIPS: "Once Upon an Input: Reasoning via Per-Instance Program Synthesis" [2025-10] [paper]

3.2 Code Simulation

  • "Code Simulation Challenges for Large Language Models" [2024-01] [paper]

  • "CodeMind: A Framework to Challenge Large Language Models for Code Reasoning" [2024-02] [paper]

  • "Executing Natural Language-Described Algorithms with Large Language Models: An Investigation" [2024-02] [paper]

  • "Can Language Models Pretend Solvers? Logic Code Simulation with LLMs" [2024-03] [paper]

  • "Evaluating Large Language Models with Runtime Behavior of Program Execution" [2024-03] [paper]

  • "NExT: Teaching Large Language Models to Reason about Code Execution" [2024-04] [ICML 2024] [paper]

  • "SelfPiCo: Self-Guided Partial Code Execution with LLMs" [2024-07] [paper]

  • "LogicPro: Improving Complex Logical Reasoning via Program-Guided Learning" [2024-09] [ACL 2025] [paper]

  • "Large Language Models as Code Executors: An Exploratory Study" [2024-10] [paper]

  • "VISUALCODER: Guiding Large Language Models in Code Execution with Fine-grained Multimodal Chain-of-Thought Reasoning" [2024-10] [paper]

  • "CoCoNUT: Structural Code Understanding does not fall out of a tree" [2025-01] [paper]

  • "CodeI/O: Condensing Reasoning Patterns via Code Input-Output Prediction" [2025-02] [ICML 2025] [paper]

  • "SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors" [2025-02] [EMNLP 2025] [paper]

  • "What I cannot execute, I do not understand: Training and Evaluating LLMs on Program Execution Traces" [2025-02] [paper]

  • "L0-Reasoning Bench: Evaluating Procedural Correctness in Language Models via Simple Program Execution" [2025-03] [paper]

  • "PLSemanticsBench: Large Language Models As Programming Language Interpreters" [2025-10] [paper]

  • "Metric Calculating Benchmark: Code-Verifiable Complicate Instruction Following Benchmark for Large Language Models" [2025-10] [paper]

  • "Breaking the Attention Trap in Code LLMs: A Rejection Sampling Approach to Enhance Code Execution Prediction" [2025-11] [EMNLP 2025 Findings] [paper]

3.3 Code Agents

  1. Self-collaboration: "Self-collaboration Code Generation via ChatGPT" [2023-04] [paper]

  2. ChatDev: "Communicative Agents for Software Development" [2023-07] [paper] [repo]

  3. MetaGPT: "MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework" [2023-08] [paper] [repo]

  4. CodeChain: "CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modules" [2023-10] [ICLR 2024] [paper]

  5. CodeAgent: "CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges" [2024-01] [ACL 2024] [paper]

  6. CONLINE: "CoCoST: Automatic Complex Code Generation with Online Searching and Correctness Testing" [2024-03] [EMNLP 2024] [paper]

  7. LCG: "When LLM-based Code Generation Meets the Software Development Process" [2024-03] [paper]

  8. RepairAgent: "RepairAgent: An Autonomous, LLM-Based Agent for Program Repair" [2024-03] [paper]

  9. MAGIS:: "MAGIS: LLM-Based Multi-Agent Framework for GitHub Issue Resolution" [2024-03] [paper]

  10. SoA: "Self-Organized Agents: A LLM Multi-Agent Framework toward Ultra Large-Scale Code Generation and Optimization" [2024-04] [paper]

  11. AutoCodeRover: "AutoCodeRover: Autonomous Program Improvement" [2024-04] [paper]

  12. SWE-agent: "SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering" [2024-05] [paper]

  13. MapCoder: "MapCoder: Multi-Agent Code Generation for Competitive Problem Solving" [2024-05] [ACL 2024] [paper]

  14. "Fight Fire with Fire: How Much Can We Trust ChatGPT on Source Code-Related Tasks?" [2024-05] [paper]

  15. FunCoder: "Divide-and-Conquer Meets Consensus: Unleashing the Power of Functions in Code Generation" [2024-05] [paper]

  16. CTC: "Multi-Agent Software Development through Cross-Team Collaboration" [2024-06] [paper]

  17. MASAI: "MASAI: Modular Architecture for Software-engineering AI Agents" [2024-06] [paper]

  18. AgileCoder: "AgileCoder: Dynamic Collaborative Agents for Software Development based on Agile Methodology" [2024-06] [paper]

  19. CodeNav: "CodeNav: Beyond tool-use to using real-world codebases with LLM agents" [2024-06] [paper]

  20. INDICT: "INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness" [2024-06] [paper]

  21. AppWorld: "AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents" [2024-07] [paper]

  22. CortexCompile: "CortexCompile: Harnessing Cortical-Inspired Architectures for Enhanced Multi-Agent NLP Code Synthesis" [2024-08] [paper]

  23. DEI: "Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents" [2024-08] [ICLR 2025] [paper]

  24. Survey: "Large Language Model-Based Agents for Software Engineering: A Survey" [2024-09] [paper]

  25. PairCoder: "A Pair Programming Framework for Code Generation via Multi-Plan Exploration and Feedback-Driven Refinement" [2024-09] [ASE 2024] [paper] [repo]

  26. AutoSafeCoder: "AutoSafeCoder: A Multi-Agent Framework for Securing LLM Code Generation through Static Analysis and Fuzz Testing" [2024-09] [paper]

  27. SuperCoder2.0: "SuperCoder2.0: Technical Report on Exploring the feasibility of LLMs as Autonomous Programmer" [2024-09] [paper]

  28. Survey: "Agents in Software Engineering: Survey, Landscape, and Vision" [2024-09] [paper]

  29. MOSS: "MOSS: Enabling Code-Driven Evolution and Context Management for AI Agents" [2024-09] [paper]

  30. HyperAgent: "HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale" [2024-09] [paper]

  31. "Compositional Hardness of Code in Large Language Models -- A Probabilistic Perspective" [2024-09] [paper]

  32. RGD: "RGD: Multi-LLM Based Agent Debugger via Refinement and Generation Guidance" [2024-10] [paper]

  33. Seeker: "Seeker: Enhancing Exception Handling in Code with LLM-based Multi-Agent Approach" [2024-10] [paper]

  34. REDO: "REDO: Execution-Free Runtime Error Detection for COding Agents" [2024-10] [paper]

  35. "Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios" [2024-10] [paper]

  36. EvoMAC: "Self-Evolving Multi-Agent Collaboration Networks for Software Development" [2024-10] [ICLR 2025] [paper]

  37. VisionCoder: "VisionCoder: Empowering Multi-Agent Auto-Programming for Image Processing with Hybrid LLMs" [2024-10] [paper]

  38. AutoKaggle: "AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions" [2024-10] [paper]

  39. Watson: "Watson: A Cognitive Observability Framework for the Reasoning of Foundation Model-Powered Agents" [2024-11] [paper]

  40. CodeTree: "CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models" [2024-11] [paper]

  41. EvoCoder: "LLMs as Continuous Learners: Improving the Reproduction of Defective Code in Software Issues" [2024-11] [paper]

  42. AEGIS: "AEGIS: An Agent-based Framework for General Bug Reproduction from Issue Descriptions" [2024-11] [paper]

  43. ExecutionAgent: "You Name It, I Run It: An LLM Agent to Execute Tests of Arbitrary Projects" [2024-12] [paper]

  44. GHIssueMarket: "GHIssuemarket: A Sandbox Environment for SWE-Agents Economic Experimentation" [2024-12] [paper]

  45. SWE-Gym: "Training Software Engineering Agents and Verifiers with SWE-Gym" [2024-12] [ICML 2025] [paper]

  46. SWE-Fixer: "SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolution" [2025-01] [ACL 2025 Findings] [paper]

  47. CodeCoR: "CodeCoR: An LLM-Based Self-Reflective Multi-Agent Framework for Code Generation" [2025-01] [paper]

  48. QualityFlow: "QualityFlow: An Agentic Workflow for Program Synthesis Controlled by LLM Quality Checks" [2025-01] [paper]

  49. Cogito: "Cogito, ergo sum: A Neurobiologically-Inspired Cognition-Memory-Growth System for Code Generation" [2025-01] [paper]

  50. OrcaLoca: "OrcaLoca: An LLM Agent Framework for Software Issue Localization" [2025-02] [ICML 2025] [paper]

  51. BRT Agent: "Agentic Bug Reproduction for Effective Automated Program Repair at Google" [2025-02] [paper]

  52. CodeSim: "CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging" [2025-02] [paper]

  53. SyncMind: "SyncMind: Measuring Agent Out-of-Sync Recovery in Collaborative Software Engineering" [2025-02] [ICML 2025] [paper]

  54. SoRFT: "SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-Tuning" [2025-02] [paper]

  55. "Is Multi-Agent Debate (MAD) the Silver Bullet? An Empirical Analysis of MAD in Code Summarization and Translation" [2025-03] [paper]

  56. DARS: "DARS: Dynamic Action Re-Sampling to Enhance Coding Agent Performance by Adaptive Tree Traversal" [2025-03] [ACL 2025] [paper]

  57. SEAlign: "SEAlign: Alignment Training for Software Engineering Agent" [2025-03] [paper]

  58. SWE-SynInfer: "Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute" [2025-03] [paper]

  59. AdaCoder: "AdaCoder: An Adaptive Planning and Multi-Agent Framework for Function-Level Code Generation" [2025-04] [paper]

  60. SICA: "A Self-Improving Coding Agent" [2025-04] [paper]

  61. SWE-smith: "SWE-smith: Scaling Data for Software Engineering Agents" [2025-04] [paper]

  62. "Enhancing LLM Code Generation: A Systematic Evaluation of Multi-Agent Collaboration and Runtime Debugging for Improved Accuracy, Reliability, and Latency" [2025-05] [paper]

  63. SEW: "SEW: Self-Evolving Agentic Workflows for Automated Code Generation" [2025-05] [paper]

  64. RepoMaster: "RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving" [2025-05] [paper]

  65. Code Researcher: "Code Researcher: Deep Research Agent for Large Systems Code and Commit History" [2025-05] [paper]

  66. "Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve" [2025-05] [paper]

  67. "EvoGit: Decentralized Code Evolution via Git-Based Multi-Agent Collaboration" [2025-06] [paper]

  68. SWE-Factory: "SWE-Factory: Your Automated Factory for Issue Resolution Training Data and Evaluation Benchmarks" [2025-06] [paper]

  69. Agent-RLVR: "Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards" [2025-06] [paper]

  70. AlphaEvolve: "AlphaEvolve: A coding agent for scientific and algorithmic discovery" [2025-06] [paper]

  71. USEagent: "Unified Software Engineering agent as AI Software Engineer" [2025-06] [paper]

  72. SemAgent: "SemAgent: A Semantics Aware Program Repair Agent" [2025-06] [paper]

  73. Trae Agent: "Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling" [2025-07] [paper]

  74. "Nemotron-CORTEXA: Enhancing LLM Agents for Software Engineering Tasks via Improved Localization and Solution Diversity" [2025-07] [ICML 2025] [paper]

  75. DebateCoder: "DebateCoder: Towards Collective Intelligence of LLMs via Test Case Driven LLM Debate for Code Generation" [2025-07] [ACL 2025] [paper]

  76. "GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging" [2025-08] [paper]

  77. MapCoder-Lite: "MapCoder-Lite: Squeezing Multi-Agent Coding into a Single Small LLM" [2025-09] [paper]

  78. Devstral: "Devstral: Fine-tuning Language Models for Coding Agent Applications" [2025-09] [paper]

  79. Lita: "Lita: Light Agent Uncovers the Agentic Coding Capabilities of LLMs" [2025-09] [paper]

  80. Kimi-Dev: "Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents" [2025-09] [paper]

  81. VeriGuard: "VeriGuard: Enhancing LLM Agent Safety via Verified Code Generation" [2025-10] [paper]

  82. KAT-Coder: "KAT-Coder Technical Report" [2025-10] [paper]

  83. TOM-SWE: "TOM-SWE: User Mental Modeling For Software Engineering Agents" [2025-10] [paper]

  84. SwiftSolve: "SwiftSolve: A Self-Iterative, Complexity-Aware Multi-Agent Framework for Competitive Programming" [2025-10] [paper]

  85. CodeClash: "CodeClash: Benchmarking Goal-Oriented Software Engineering" [2025-11] [paper]

  86. "A Comprehensive Empirical Evaluation of Agent Frameworks on Code-centric Software Engineering Tasks" [2025-10] [paper]

  87. "Designing LLM-based Multi-Agent Systems for Software Engineering Tasks: Quality Attributes, Design Patterns and Rationale" [2025-11] [paper]

  88. "Evaluating Software Process Models for Multi-Agent Class-Level Code Generation" [2025-11] [paper]

  89. LoCoBench-Agent: "LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering" [2025-11] [paper]

  90. Live-SWE-agent: "Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?" [2025-11] [paper]

  91. "Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems" [2025-11] [paper]

  92. "Process-Centric Analysis of Agentic Software Systems" [2025-12] [paper]

  93. PARC: "PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks" [2025-12] [paper]

  94. DeepCode: "DeepCode: Open Agentic Coding" [2025-12] [paper]

  95. CCA: "Confucius Code Agent: An Open-sourced AI Software Engineer at Industrial Scale" [2025-12] [paper]

  96. SWE-Playground: "Training Versatile Coding Agents in Synthetic Environments" [2025-12] [paper]

  97. SSR: "Toward Training Superintelligent Software Agents through Self-Play SWE-RL" [2025-12] [paper]

  98. RepoNavigator: "One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents" [2025-12] [paper]

  99. SWE-RM: "SWE-RM: Execution-free Feedback For Software Engineering Agents" [2025-12] [paper]

  100. MemGovern: "MemGovern: Enhancing Code Agents through Learning from Governed Human Experiences" [2026-01] [paper]

  101. "APEX-SWE" [2026-01] [paper]

  102. Terminal-Bench: "Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces" [2026-01] [paper]

  103. CooperBench: "CooperBench: Why Coding Agents Cannot be Your Teammates Yet" [2026-01] [paper]

  104. SWE-Pruner: "SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents" [2026-01] [paper]

  105. daVinci-Dev: "daVinci-Dev: Agent-native Mid-training for Software Engineering" [2026-01] [paper]

  106. DevOps-Gym: "DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle" [2026-01] [paper]

  107. TerminalTraj: "Large-Scale Terminal Agentic Trajectory Generation from Dockerized Environments" [2026-02] [paper]

  108. RPG-Encoder: "Closing the Loop: Universal Repository Representation with RPG-Encoder" [2026-02] [paper]

  109. TDScaling: "Beyond Quantity: Trajectory Diversity Scaling for Code Agents" [2026-02] [paper]

  110. SWE-Master: "SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training" [2026-02] [paper]

  111. SWE-World: "SWE-World: Building Software Engineering Agents in Docker-Free Environments" [2026-02] [paper]

  112. "Scaling Agentic Verifier for Competitive Coding" [2026-02] [paper]

  113. TermiGen: "TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents" [2026-02] [paper]

  114. LongCLI-Bench: "LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces" [2026-02] [paper]

  115. Hybrid-Gym: "Hybrid-Gym: Training Coding Agents to Generalize Across Tasks" [2026-02] [paper]

  116. "Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining" [2026-03] [paper]

  117. DeepCommit: "EvoClaw: Evaluating AI Agents on Continuous Software Evolution" [2026-03] [paper]

  118. CAID: "Effective Strategies for Asynchronous Software Engineering Agents" [2026-03] [paper]

  119. "Coding Agents are Effective Long-Context Processors" [2026-03] [paper]

  120. SlopCodeBench: "SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks" [2026-03] [paper]

  121. KAT-Coder-V2: "KAT-Coder-V2 Technical Report" [2026-03] [paper]

  122. SWE Atlas: "SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution" [2026-05] [paper]

3.4 Interactive Coding

  • "Interactive Program Synthesis" [2017-03] [paper]

  • "Question selection for interactive program synthesis" [2020-06] [PLDI 2020] [paper]

  • "Interactive Code Generation via Test-Driven User-Intent Formalization" [2022-08] [paper]

  • "Improving Code Generation by Training with Natural Language Feedback" [2023-03] [TMLR] [paper]

  • "Self-Refine: Iterative Refinement with Self-Feedback" [2023-03] [NeurIPS 2023] [paper]

  • "Teaching Large Language Models to Self-Debug" [2023-04] [paper]

  • "Self-Edit: Fault-Aware Code Editor for Code Generation" [2023-05] [ACL 2023] [paper]

  • "LeTI: Learning to Generate from Textual Interactions" [2023-05] [paper]

  • "Is Self-Repair a Silver Bullet for Code Generation?" [2023-06] [ICLR 2024] [paper]

  • "InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback" [2023-06] [NeurIPS 2023] [paper]

  • "INTERVENOR: Prompting the Coding Ability of Large Language Models with the Interactive Chain of Repair" [2023-11] [ACL 2024 Findings] [paper]

  • "OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement" [2024-02] [ACL 2024 Findings] [paper]

  • "Iterative Refinement of Project-Level Code Context for Precise Code Generation with Compiler Feedback" [2024-03] [ACL 2024 Findings] [paper]

  • "CYCLE: Learning to Self-Refine the Code Generation" [2024-03] [paper]

  • "LLM-based Test-driven Interactive Code Generation: User Study and Empirical Evaluation" [2024-04] [paper]

  • "SOAP: Enhancing Efficiency of Generated Code via Self-Optimization" [2024-05] [paper]

  • "Code Repair with LLMs gives an Exploration-Exploitation Tradeoff" [2024-05] [NeurIPS 2024] [paper]

  • "ReflectionCoder: Learning from Reflection Sequence for Enhanced One-off Code Generation" [2024-05] [ACL 2025] [paper]

  • "Training LLMs to Better Self-Debug and Explain Code" [2024-05] [NeurIPS 2024] [paper]

  • "Requirements are All You Need: From Requirements to Code with LLMs" [2024-06] [paper]

  • "I Need Help! Evaluating LLM's Ability to Ask for Users' Support: A Case Study on Text-to-SQL Generation" [2024-07] [EMNLP 2024] [paper]

  • "An Empirical Study on Self-correcting Large Language Models for Data Science Code Generation" [2024-08] [paper]

  • "RethinkMCTS: Refining Erroneous Thoughts in Monte Carlo Tree Search for Code Generation" [2024-09] [EMNLP 2025] [paper]

  • "From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging" [2024-10] [paper] [repo]

  • "What Makes Large Language Models Reason in (Multi-Turn) Code Generation?" [2024-10] [ICLR 2025] [paper]

  • "The First Prompt Counts the Most! An Evaluation of Large Language Models on Iterative Example-based Code Generation" [2024-11] [paper]

  • "Planning-Driven Programming: A Large Language Model Programming Workflow" [2024-11] [ACL 2025] [paper]

  • "ConAIR:Consistency-Augmented Iterative Interaction Framework to Enhance the Reliability of Code Generation" [2024-11] [paper]

  • "Socratic Human Feedback (SoHF): Expert Steering Strategies for LLM Code Generation" [2024-11] [EMNLP 2024 Findings] [paper]

  • "PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback" [2024-11] [paper]

  • "GenX: Mastering Code and Test Generation with Execution Feedback" [2024-12] [paper]

  • "Helping LLMs Improve Code Generation Using Feedback from Testing and Static Analysis" [2024-12] [paper]

  • "Outcome-Refining Process Supervision for Code Generation" [2024-12] [paper]

  • "Tree-of-Code: A Tree-Structured Exploring Framework for End-to-End Code Generation and Execution in Complex Task Handling" [2024-12] [ACL 2025 Findings] [paper]

  • "Dynamic Scaling of Unit Tests for Code Reward Modeling" [2025-01] [ACL 2025] [paper]

  • "Revisit Self-Debugging with Self-Generated Tests for Code Generation" [2025-01] [ACL 2025] [paper]

  • "Learning to Generate Unit Tests for Automated Debugging" [2025-02] [paper]

  • "Large Language Model Guided Self-Debugging Code Generation" [2025-02] [paper]

  • "On Iterative Evaluation and Enhancement of Code Quality Using GPT-4o" [2025-02] [paper]

  • "Intention is All You Need: Refining Your Code from Your Intention" [2025-02] [paper]

  • "RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation" [2025-02] [paper]

  • "VisPath: Automated Visualization Code Synthesis via Multi-Path Reasoning and Feedback-Driven Optimization" [2025-02] [paper]

  • "S*: Test Time Scaling for Code Generation" [2025-02] [EMNLP 2025 Findings] [paper]

  • "When Benchmarks Talk: Re-Evaluating Code LLMs with Interactive Feedback" [2025-02] [ACL 2025 Findings] [paper]

  • "LLM4EFFI: Leveraging Large Language Models to Enhance Code Efficiency and Correctness" [2025-02] [paper]

  • "Multi-Turn Code Generation Through Single-Step Rewards" [2025-02] [ICML 2025] [paper]

  • "ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments" [2025-02] [ICLR 2025] [paper]

  • "Teaching Your Models to Understand Code via Focal Preference Alignment" [2025-03] [EMNLP 2025] [paper]

  • "debug-gym: A Text-Based Environment for Interactive Debugging" [2025-03] [paper]

  • "CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation" [2025-03] [paper]

  • "CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation" [2025-04] [paper]

  • "Use Property-Based Testing to Bridge LLM Code Generation and Validation" [2025-06] [paper]

  • "CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance" [2025-07] [paper]

  • "SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement" [2025-09] [paper]

  • "Benchmarking Correctness and Security in Multi-Turn Code Generation" [2025-10] [paper]

3.5 Frontend Navigation

  • "MarkupLM: Pre-training of Text and Markup Language for Visually-rich Document Understanding" [2021-10] [ACL 2022] [paper]

  • "WebKE: Knowledge Extraction from Semi-structured Web with Pre-trained Markup Language Model" [2021-10] [CIKM 2021] [paper]

  • "WebGPT: Browser-assisted question-answering with human feedback" [2021-12] [paper]

  • "CM3: A Causal Masked Multimodal Model of the Internet" [2022-01] [paper]

  • "DOM-LM: Learning Generalizable Representations for HTML Documents" [2022-01] [paper]

  • "WebFormer: The Web-page Transformer for Structure Information Extraction" [2022-02] [WWW 2022] [paper]

  • "A Dataset for Interactive Vision-Language Navigation with Unknown Command Feasibility" [2022-02] [ECCV 2022] [paper]

  • "WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents" [2022-07] [NeurIPS 2022] [paper]

  • "Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding" [2022-10] [ICML 2023] [paper]

  • "Understanding HTML with Large Language Models" [2022-10] [EMNLP 2023 findings] [paper]

  • "WebUI: A Dataset for Enhancing Visual UI Understanding with Web Semantics" [2023-01] [CHI 2023] [paper]

  • "Mind2Web: Towards a Generalist Agent for the Web" [2023-06] [NeurIPS 2023] [paper]

  • "A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis", [2023-07] [ICLR 2024] [paper]

  • "WebArena: A Realistic Web Environment for Building Autonomous Agents" [2023-07] [paper]

  • "CogAgent: A Visual Language Model for GUI Agents" [2023-12] [paper]

  • "GPT-4V(ision) is a Generalist Web Agent, if Grounded" [2024-01] [paper]

  • "WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models" [2024-01] [paper]

  • "WebLINX: Real-World Website Navigation with Multi-Turn Dialogue" [2024-02] [paper]

  • "OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web" [2024-02] [paper]

  • "AutoWebGLM: Bootstrap And Reinforce A Large Language Model-based Web Navigating Agent" [2024-04] [paper]

  • "WILBUR: Adaptive In-Context Learning for Robust and Accurate Web Agents" [2024-04] [paper]

  • "AutoCrawler: A Progressive Understanding Web Agent for Web Crawler Generation" [2024-04] [paper]

  • "GUICourse: From General Vision Language Models to Versatile GUI Agents" [2024-06] [paper]

  • "NaviQAte: Functionality-Guided Web Application Navigation" [2024-09] [paper]

  • "MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding" [2024-09] [paper]

  • "Multimodal Auto Validation For Self-Refinement in Web Agents" [2024-10] [paper]

  • "Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents" [2024-10] [paper]

  • "Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web Navigation" [2024-10] [paper]

  • "Harnessing Webpage UIs for Text-Rich Visual Understanding" [2024-10] [paper]

  • "AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents" [2024-10] [paper]

  • "Beyond Browsing: API-Based Web Agents" [2024-10] [paper]

  • "Large Language Models Empowered Personalized Web Agents" [2024-10] [paper]

  • "AdvWeb: Controllable Black-box Attacks on VLM-powered Web Agents" [2024-10] [paper]

  • "Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agents" [2024-10] [paper]

  • "OS-ATLAS: A Foundation Action Model for Generalist GUI Agents" [2024-10] [paper]

  • "From Context to Action: Analysis of the Impact of State Representation and Context on the Generalization of Multi-Turn Web Navigation Agents" [2024-10] [paper]

  • "AutoGLM: Autonomous Foundation Agents for GUIs" [2024-10] [paper]

  • "WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning" [2024-11] [paper]

  • "The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use" [2024-11] [paper]

  • "ScribeAgent: Towards Specialized Web Agents Using Production-Scale Workflow Data" [2024-11] [paper]

  • "ShowUI: One Vision-Language-Action Model for GUI Visual Agent" [2024-11] [paper]

  • "Large Language Model-Brained GUI Agents: A Survey" [2024-11] [paper]

  • "Free your mouse! Command Large Language Models to Generate Code to Format Word Documents" [2024-11] [EMNLP 2024] [paper]

  • "Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction" [2024-12] [paper]

  • "Falcon-UI: Understanding GUI Before Following User Instructions" [2024-12] [paper]

  • "WEPO: Web Element Preference Optimization for LLM-based Web Navigation" [2024-12] [paper]

  • "AutoDroid-V2: Boosting SLM-based GUI Agents via Code Generation" [2024-12] [paper]

  • "Beyond Pass or Fail: A Multi-dimensional Benchmark for Mobile UI Navigation" [2025-01] [paper]

  • "WebWalker: Benchmarking LLMs in Web Traversal" [2025-01] [paper]

  • "GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration" [2025-01] [paper]

  • "UI-TARS: Pioneering Automated GUI Interaction with Native Agents" [2025-01] [paper]

  • "Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks" [2025-03] [paper]

  • "WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks" [2025-06] [paper]

  • "UI-Venus Technical Report: Building High-performance UI Agents with RFT" [2025-08] [paper]

  • "Mano Report" [2025-09] [paper]

  • "UI-Venus-1.5 Technical Report" [2026-02] [paper]

  • "AutoWebWorld: Synthesizing Infinite Verifiable Web Environments via Finite State Machines" [2026-02] [paper]

4. Code LLM for Low-Resource, Low-Level, and Domain-Specific Languages

  • [Ruby] "On the Transferability of Pre-trained Language Models for Low-Resource Programming Languages" [2022-04] [ICPC 2022] [paper]

  • [Verilog] "Benchmarking Large Language Models for Automated Verilog RTL Code Generation" [2022-12] [DATE 2023] [paper]

  • [OCL] "On Codex Prompt Engineering for OCL Generation: An Empirical Study" [2023-03] [MSR 2023] [paper]

  • [Ansible-YAML] "Automated Code generation for Information Technology Tasks in YAML through Large Language Models" [2023-05] [DAC 2023] [paper]

  • [Hansl] "The potential of LLMs for coding with low-resource and domain-specific programming languages" [2023-07] [paper]

  • [Verilog] "VeriGen: A Large Language Model for Verilog Code Generation" [2023-07] [paper]

  • [Verilog] "RTLLM: An Open-Source Benchmark for Design RTL Generation with Large Language Model" [2023-08] [paper]

  • [Racket, OCaml, Lua, R, Julia] "Knowledge Transfer from High-Resource to Low-Resource Programming Languages for Code LLMs" [2023-08] [paper]

  • [Verilog] "VerilogEval: Evaluating Large Language Models for Verilog Code Generation" [2023-09] [ICCAD 2023] [paper]

  • [Verilog] "RTLFixer: Automatically Fixing RTL Syntax Errors with Large Language Models" [2023-11] [paper]

  • [Verilog] "Advanced Large Language Model (LLM)-Driven Verilog Development: Enhancing Power, Performance, and Area Optimization in Code Synthesis" [2023-12] [paper]

  • [Verilog] "RTLCoder: Outperforming GPT-3.5 in Design RTL Generation with Our Open-Source Dataset and Lightweight Solution" [2023-12] [paper]

  • [Verilog] "BetterV: Controlled Verilog Generation with Discriminative Guidance" [2024-02] [ICML 2024] [paper]

  • [R] "Empirical Studies of Parameter Efficient Methods for Large Language Models of Code and Knowledge Transfer to R" [2024-03] [paper]

  • [Haskell] "Investigating the Performance of Language Models for Completing Code in Functional Programming Languages: a Haskell Case Study" [2024-03] [paper]

  • [Verilog] "A Multi-Expert Large Language Model Architecture for Verilog Code Generation" [2024-04] [paper]

  • [Verilog] "CreativEval: Evaluating Creativity of LLM-Based Hardware Code Generation" [2024-04] [paper]

  • [Alloy] "An Empirical Evaluation of Pre-trained Large Language Models for Repairing Declarative Formal Specifications" [2024-04] [paper]

  • [Verilog] "Evaluating LLMs for Hardware Design and Test" [2024-04] [paper]

  • [Kotlin, Swift, and Rust] "Software Vulnerability Prediction in Low-Resource Languages: An Empirical Study of CodeBERT and ChatGPT" [2024-04] [paper]

  • [Verilog] "MEIC: Re-thinking RTL Debug Automation using LLMs" [2024-05] [paper]

  • [Bash] "Tackling Execution-Based Evaluation for NL2Bash" [2024-05] [paper]

  • [Fortran, Julia, Matlab, R, Rust] "Evaluating AI-generated code for C++, Fortran, Go, Java, Julia, Matlab, Python, R, and Rust" [2024-05] [paper]

  • [OpenAPI] "Optimizing Large Language Models for OpenAPI Code Completion" [2024-05] [paper]

  • [Kotlin] "Kotlin ML Pack: Technical Report" [2024-05] [paper]

  • [UCLID5] "Synthetic Programming Elicitation for Text-to-Code in Very Low-Resource Programming and Formal Languages" [2024-06] [NeurIPS 2024] [paper]

  • [Verilog] "VerilogReader: LLM-Aided Hardware Test Generation" [2024-06] [paper]

  • "Benchmarking Generative Models on Computational Thinking Tests in Elementary Visual Programming" [2024-06] [paper]

  • [Logo] "Program Synthesis Benchmark for Visual Programming in XLogoOnline Environment" [2024-06] [ACL 2025] [paper]

  • [Ansible YAML, Bash] "DocCGen: Document-based Controlled Code Generation" [2024-06] [EMNLP 2024] [paper]

  • [Qiskit] "Qiskit HumanEval: An Evaluation Benchmark For Quantum Code Generative Models" [2024-06] [paper]

  • [Perl, Golang, Swift] "DistiLRR: Transferring Code Repair for Low-Resource Programming Languages" [2024-06] [paper]

  • [Verilog] "AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion Generation" [2024-06] [paper]

  • "A Comparative Study of DSL Code Generation: Fine-Tuning vs. Optimized Retrieval Augmentation" [2024-07] [paper]

  • [Json, XLM, YAML] "ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages" [2024-07] [paper]

  • [Verilog] "AutoBench: Automatic Testbench Generation and Evaluation Using LLMs for HDL Design" [2024-07] [paper]

  • [Verilog] "CodeV: Empowering LLMs for Verilog Generation through Multi-Level Summarization" [2024-07] [paper]

  • [Verilog] "ITERTL: An Iterative Framework for Fine-tuning LLMs for RTL Code Generation" [2024-07] [paper]

  • [Verilog] "OriGen:Enhancing RTL Code Generation with Code-to-Code Augmentation and Self-Reflection" [2024-07] [paper]

  • [Verilog] "Large Language Model for Verilog Generation with Golden Code Feedback" [2024-07] [paper]

  • [Verilog] "AutoVCoder: A Systematic Framework for Automated Verilog Code Generation using LLMs" [2024-07] [paper]

  • [RPA] "Plan with Code: Comparing approaches for robust NL to DSL generation" [2024-08] [paper]

  • [Verilog] "VerilogCoder: Autonomous Verilog Coding Agents with Graph-based Planning and Abstract Syntax Tree (AST)-based Waveform Tracing Tool" [2024-08] [paper]

  • [Verilog] "Revisiting VerilogEval: Newer LLMs, In-Context Learning, and Specification-to-RTL Tasks" [2024-08] [paper]

  • [MaxMSP, Web Audio] "Benchmarking LLM Code Generation for Audio Programming with Visual Dataflow Languages" [2024-09] [paper]

  • [Verilog] "RTLRewriter: Methodologies for Large Models aided RTL Code Optimization" [2024-09] [paper]

  • [Verilog] "CraftRTL: High-quality Synthetic Data Generation for Verilog Code Models with Correct-by-Construction Non-Textual Representations and Targeted Code Repair" [2024-09] [ICLR 2025] [paper]

  • [Bash] "ScriptSmith: A Unified LLM Framework for Enhancing IT Operations via Automated Bash Script Generation, Assessment, and Refinement" [2024-09] [paper]

  • [Survey] "Survey on Code Generation for Low resource and Domain Specific Programming Languages" [2024-10] [paper]

  • [R] "Do Current Language Models Support Code Intelligence for R Programming Language?" [2024-10] [paper]

  • [PLC] "Agents4PLC: Automating Closed-loop PLC Code Generation and Verification in Industrial Control Systems using LLM-based Agents" [2024-10] [paper]

  • [Lua] "Evaluating Quantized Large Language Models for Code Generation on Low-Resource Language Benchmarks" [2024-10] [paper]

  • "Improving Parallel Program Performance Through DSL-Driven Code Generation with LLM Optimizers" [2024-10] [paper]

  • [R, D, Racket, Bash]: "Bridge-Coder: Unlocking LLMs' Potential to Overcome Language Gaps in Low-Resource Code" [2024-10] [ACL 2025 Findings] [paper]

  • [SPICE]: "SPICEPilot: Navigating SPICE Code Generation and Simulation with AI Guidance" [2024-10] [paper]

  • [IEC 61131-3 ST]: "Training LLMs for Generating IEC 61131-3 Structured Text with Online Feedback" [2024-10] [paper]

  • [Verilog] "MetRex: A Benchmark for Verilog Code Metric Reasoning Using LLMs" [2024-11] [paper]

  • [Verilog] "CorrectBench: Automatic Testbench Generation with Functional Self-Correction using LLMs for HDL Design" [2024-11] [paper]

  • [MUMPS, ALC] "Leveraging LLMs for Legacy Code Modernization: Challenges and Opportunities for LLM-Generated Documentation" [2024-11] [paper]

  • [Power Query M, OfficeScript, Excel formulas] "RAR: Retrieval-augmented retrieval for code generation in low resource languages" [2024-11] [EMNLP 2024] [paper]

  • [ST] "A Multi-Agent Framework for Extensible Structured Text Generation in PLCs" [2024-12] [paper]

  • [Verilog] "PromptV: Leveraging LLM-powered Multi-Agent Prompting for High-quality Verilog Generation" [2024-12] [paper]

  • [HPC] "HPC-Coder-V2: Studying Code LLMs Across Low-Resource Parallel Languages" [2024-12] [paper]

  • [Verilog] "RTLSquad: Multi-Agent Based Interpretable RTL Design" [2025-01] [paper]

  • [G] "GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback" [2025-01] [paper]

  • [Julia, Lua, R, Racket] "Enhancing Code Generation for Low-Resource Languages: No Silver Bullet" [2025-01] [paper]

  • [F*] "Building A Proof-Oriented Programmer That Is 64% Better Than GPT-4o Under Data Scarsity" [2025-02] [ACL 2025 Findings] [paper]

  • "Exploring Code Language Models for Automated HLS-based Hardware Generation: Benchmark, Infrastructure and Analysis" [2025-02] [ASP-DAC 2025] [paper]

  • [Alloy*] "On the Effectiveness of Large Language Models in Writing Alloy Formulas" [2025-02] [paper]

  • [Solidity] "SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation" [2025-02] [paper]

  • [PennyLane] "PennyLang: Pioneering LLM-Based Quantum Code Generation with a Novel PennyLane-Centric Dataset" [2025-03] [paper]

  • [Verilog] "VeriMind: Agentic LLM for Automated Verilog Generation with a Novel Evaluation Metric" [2025-03] [paper]

  • [Modelica] "ModiGen: A Large Language Model-Based Workflow for Multi-Task Modelica Code Generation" [2025-03] [paper]

  • [Excel] "Synthetic Function Demonstrations Improve Generation in Low-Resource Programming Languages" [2025-03] [paper]

  • "RTLRepoCoder: Repository-Level RTL Code Completion through the Combination of Fine-Tuning and Retrieval Augmentation" [2025-04] [paper]

  • [Verilog] "SymRTLO: Enhancing RTL Code Optimization with LLMs and Neuron-Inspired Symbolic Reasoning" [2025-04] [paper]

  • [Verilog] "ReasoningV: Efficient Verilog Code Generation with Adaptive Hybrid Reasoning Model" [2025-04] [paper]

  • [Verilog] "VeriCoder: Enhancing LLM-Based RTL Code Generation through Functional Correctness Validation" [2025-04] [paper]

  • [Chisel] "ChiseLLM: Unleashing the Power of Reasoning LLMs for Chisel Agile Hardware Development" [2025-04] [paper]

  • [Verilog] "ComplexVCoder: An LLM-Driven Framework for Systematic Generation of Complex Verilog Code" [2025-04] [paper]

  • [Lean] "CLEVER: A Curated Benchmark for Formally Verified Code Generation" [2025-05] [paper]

  • [*