Awesome-Code-LLM

This is the repo for our TMLR code LLM survey. If you find this repo helpful, please support us by citing:
@article{zhang2024unifying,
title={Unifying the Perspectives of {NLP} and Software Engineering: A Survey on Language Models for Code},
author={Ziyin Zhang and Chaoyu Chen and Bingchang Liu and Cong Liao and Zi Gong and Hang Yu and Jianguo Li and Rui Wang},
journal={Transactions on Machine Learning Research},
issn={2835-8856},
year={2024},
url={https://openreview.net/forum?id=hkNnGqZnpa}
}
News
🔥🔥🔥 [2026/05/20] Featured papers:
-
🔥🔥 Beyond Retrieval: A Multitask Benchmark and Model for Code Search from Ant Group.
-
🔥 Composer 2 Technical Report from Cursor Research Team.
🔥🔥 [2025/12/04] 67 papers from EMNLP 2025 have been added. Search for the keyword "EMNLP 2025"!
🔥 [2024/09/06] Our survey has been accepted for publication by Transactions on Machine Learning Research (TMLR).
🔥🔥🔥 [2026/05/20] News from Codefuse
-
We released CoREB, a comprehensive code search benchmark covering two stages (retrieval, reranking), three tasks (text2code, code2text, code2code), and five languages. [data] [model & data]
-
Our paper ML-Embed is accepted to ICML 2026. [code] [model & data]
-
We released F2LLM-v2, a family of frontier multilingual emebedding models that sets new state-of-the-art on at least 11 MTEB benchmarks. [code] [model & data]
-
We are launching a new awesome project about embedding models: Awesome-Omnimodal-Embeddings
-
We released C2LLM, a family of state-of-the-art code embedding models in 0.5B and 7B sizes. C2LLM-7B ranks first on MTEB-Code leaderboard. [code] [model]
How to Contribute
If you find a paper to be missing from this repository, misplaced in a category, or lacking a reference to its journal/conference information, please do not hesitate to create an issue.
Table of Contents
-
2.1 Base LLMs and Pretraining Strategies
2.2 Existing LLM Adapted to Code
2.3 General Pretraining on Code
-
3.2 Code Simulation
3.3 Code Agents
-
Code LLM for Low-Resource, Low-Level, and Domain-Specific Languages
-
Methods/Models for Downstream Tasks
-
Programming
- Code Generation
- Code RAG
- Code Ranking
- Code Translation
- Code Commenting and Summarization
- Program Repair
- Code Similarity and Embedding (Clone Detection, Code Search)
- Code Refactoring and Migration
- Type Prediction
- Repository-Level Coding
- Issue Resolution
- Frontend Development
- Automated Machine Learning
- Text-To-SQL
- Program Proof
-
Testing and Deployment
-
DevOps
-
Requirement
-
-
8.1 Pretraining
8.2 Benchmarks
1. Surveys
-
"Large Language Models Meet NL2Code: A Survey" [2022-12] [ACL 2023] [paper]
-
"A Survey on Pretrained Language Models for Neural Code Intelligence" [2022-12] [paper]
-
"An Empirical Comparison of Pre-Trained Models of Source Code" [2023-02] [ICSE 2023] [paper]
-
"Large Language Models for Software Engineering: A Systematic Literature Review" [2023-08] [paper]
-
"Towards an Understanding of Large Language Models in Software Engineering Tasks" [2023-08] [paper]
-
"Pitfalls in Language Models for Code Intelligence: A Taxonomy and Survey" [2023-10] [paper]
-
"A Survey on Large Language Models for Software Engineering" [2023-12] [paper]
-
"Deep Learning for Code Intelligence: Survey, Benchmark and Toolkit" [2023-12] [paper]
-
"A Survey of Neural Code Intelligence: Paradigms, Advances and Beyond" [2024-03] [paper]
-
"Tasks People Prompt: A Taxonomy of LLM Downstream Tasks in Software Verification and Falsification Approaches" [2024-04] [paper]
-
"Automatic Programming: Large Language Models and Beyond" [2024-05] [paper]
-
"Software Engineering and Foundation Models: Insights from Industry Blogs Using a Jury of Foundation Models" [2024-10] [paper]
-
"Deep Learning-based Software Engineering: Progress, Challenges, and Opportunities" [2024-10] [paper]
-
"Large Language Models (LLMs) for Source Code Analysis: applications, models and datasets" [2025-03] [paper]
-
"Challenges and Paths Towards AI for Software Engineering" [2025-03] [paper]
-
"Software Development Life Cycle Perspective: A Survey of Benchmarks for CodeLLMs and Agents" [2025-05] [paper]
-
"From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence" [2025-11] [paper]
2. Models

2.1 Base LLMs and Pretraining Strategies
These LLMs are not specifically trained for code, but have demonstrated varying coding capability.
-
LaMDA: "LaMDA: Language Models for Dialog Applications" [2022-01] [paper]
-
PaLM: "PaLM: Scaling Language Modeling with Pathways" [2022-04] [JMLR] [paper]
-
GPT-NeoX: "GPT-NeoX-20B: An Open-Source Autoregressive Language Model" [2022-04] [ACL 2022 Workshop on Challenges & Perspectives in Creating LLMs] [paper] [repo]
-
BLOOM: "BLOOM: A 176B-Parameter Open-Access Multilingual Language Model" [2022-11] [paper] [model]
-
LLaMA: "LLaMA: Open and Efficient Foundation Language Models" [2023-02] [paper]
-
GPT-4: "GPT-4 Technical Report" [2023-03] [paper]
-
LLaMA 2: "Llama 2: Open Foundation and Fine-Tuned Chat Models" [2023-07] [paper] [repo]
-
Phi-1.5: "Textbooks Are All You Need II: phi-1.5 technical report" [2023-09] [paper] [model]
-
Baichuan 2: "Baichuan 2: Open Large-scale Language Models" [2023-09] [paper] [repo]
-
Gemini: "Gemini: A Family of Highly Capable Multimodal Models" [2023-12] [paper]
-
Phi-2: "Phi-2: The surprising power of small language models" [2023-12] [blog]
-
YAYI2: "YAYI 2: Multilingual Open-Source Large Language Models" [2023-12] [paper] [repo]
-
DeepSeek: "DeepSeek LLM: Scaling Open-Source Language Models with Longtermism" [2024-01] [paper] [repo]
-
DeepSeekMoE: "DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models" [2024-01] [paper] [repo]
-
Orion: "Orion-14B: Open-source Multilingual Large Language Models" [2024-01] [paper] [repo]
-
OLMo: "OLMo: Accelerating the Science of Language Models" [2024-02] [paper] [repo]
-
Gemma: "Gemma: Open Models Based on Gemini Research and Technology" [2024-02] [paper] [blog]
-
Claude 3: "The Claude 3 Model Family: Opus, Sonnet, Haiku" [2024-03] [paper] [blog]
-
Yi: "Yi: Open Foundation Models by 01.AI" [2024-03] [paper] [repo]
-
Poro: "Poro 34B and the Blessing of Multilinguality" [2024-04] [paper] [model]
-
JetMoE: "JetMoE: Reaching Llama2 Performance with 0.1M Dollars" [2024-04] [paper] [repo]
-
LLaMA 3: "The Llama 3 Herd of Models" [2024-04] [blog] [repo] [paper]
-
Reka Core: "Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models" [2024-04] [paper]
-
Phi-3: "Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone" [2024-04] [paper]
-
OpenELM: "OpenELM: An Efficient Language Model Family with Open-source Training and Inference Framework" [2024-04] [paper] [repo]
-
Tele-FLM: "Tele-FLM Technical Report" [2024-04] [paper] [model]
-
DeepSeek-V2: "DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model" [2024-05] [paper] [repo]
-
GECKO: "GECKO: Generative Language Model for English, Code and Korean" [2024-05] [paper] [model]
-
MAP-Neo: "MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series" [2024-05] [paper] [repo]
-
Zyda: "Zyda: A 1.3T Dataset for Open Language Modeling" [2024-06] [paper]
-
Skywork-MoE: "Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models" [2024-06] [paper]
-
Xmodel-LM: "Xmodel-LM Technical Report" [2024-06] [paper]
-
GEB: "GEB-1.3B: Open Lightweight Large Language Model" [2024-06] [paper]
-
HARE: "HARE: HumAn pRiors, a key to small language model Efficiency" [2024-06] [paper]
-
DCLM: "DataComp-LM: In search of the next generation of training sets for language models" [2024-06] [paper]
-
Nemotron-4: "Nemotron-4 340B Technical Report" [2024-06] [paper]
-
ChatGLM: "ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools" [2024-06] [paper]
-
FineWeb: "The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale" [2024-06] [paper]
-
YuLan: "YuLan: An Open-source Large Language Model" [2024-06] [paper]
-
Gemma 2: "Gemma 2: Improving Open Language Models at a Practical Size" [2024-06] [paper]
-
H2O-Danube3: "H2O-Danube3 Technical Report" [2024-07] [paper]
-
Qwen2: "Qwen2 Technical Report" [2024-07] [paper]
-
ALLaM: "ALLaM: Large Language Models for Arabic and English" [2024-07] [paper]
-
SeaLLMs 3: "SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian Languages" [2024-07] [paper]
-
AFM: "Apple Intelligence Foundation Language Models" [2024-07] [paper]
-
"To Code, or Not To Code? Exploring Impact of Code in Pre-training" [2024-08] [ICLR 2025] [paper]
-
OLMoE: "OLMoE: Open Mixture-of-Experts Language Models" [2024-09] [paper]
-
"How Does Code Pretraining Affect Language Model Task Performance?" [2024-09] [paper]
-
EuroLLM: "EuroLLM: Multilingual Language Models for Europe" [2024-09] [paper]
-
"Which Programming Language and What Features at Pre-training Stage Affect Downstream Logical Inference Performance?" [2024-10] [EMNLP 2024] [paper]
-
GPT-4o: "GPT-4o System Card" [2024-10] [paper]
-
Hunyuan-Large: "Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent" [2024-11] [paper]
-
Crystal: "Crystal: Illuminating LLM Abilities on Language and Code" [2024-11] [paper]
-
Zyda-2: "Zyda-2: a 5 Trillion Token High-Quality Dataset" [2024-11] [paper]
-
Xmodel-1.5: "Xmodel-1.5: An 1B-scale Multilingual LLM" [2024-11] [paper]
-
Yi-Lightning: "Yi-Lightning Technical Report" [2024-12] [paper]
-
"RedStone: Curating General, Code, Math, and QA Data for Large Language Models" [2024-12] [paper]
-
EXAONE 3.5: "EXAONE 3.5: Series of Large Language Models for Real-world Use Cases" [2024-12] [paper]
-
"The Rise and Down of Babel Tower: Investigating the Evolution Process of Multilingual Code Large Language Model" [2024-12] [ICLR 2025] [paper]
-
Phi-4: "Phi-4 Technical Report" [2024-12] [paper]
-
Typhoon 2: "Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models" [2024-12] [paper]
-
Qwen2.5: "Qwen2.5 Technical Report" [2024-12] [paper]
-
YuLan-Mini: "YuLan-Mini: An Open Data-efficient Language Model" [2024-12] [paper]
-
DeepSeek-V3: "DeepSeek-V3 Technical Report" [2024-12] [paper]
-
OLMo 2: "2 OLMo 2 Furious" [2024-12] [paper]
-
FinerWeb: "FinerWeb-10BT: Refining Web Data with LLM-Based Line-Level Filtering" [2025-01] [paper]
-
MiniMax-01: "MiniMax-01: Scaling Foundation Models with Lightning Attention" [2025-01] [paper]
-
SmolLM2: "SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model" [2025-02] [paper]
-
Salamandra: "Salamandra Technical Report" [2025-02] [paper]
-
Kanana: "Kanana: Compute-efficient Bilingual Language Models" [2025-02] [paper]
-
Phi-4-Mini: "Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs" [2025-03] [paper]
-
Ling: "Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs" [2025-03] [paper]
-
Gemma 3: "Gemma 3 Technical Report" [2025-03] [paper]
-
Command A: "Command A: An Enterprise-Ready Large Language Model" [2025-04] [paper]
-
Llama-Nemotron: "Llama-Nemotron: Efficient Reasoning Models" [2025-05] [paper]
-
MiMo: "MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining" [2025-05] [paper]
-
xGen-small: "xGen-small Technical Report" [2025-05] [paper]
-
Qwen3: "Qwen3 Technical Report" [2025-05] [paper]
-
Hunyuan-TurboS: "Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought" [2025-05] [paper]
-
EuroLLM-9B: "EuroLLM-9B: Technical Report" [2025-06] [paper]
-
Gemini 2.5: "Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities" [2025-07] [paper]
-
EXAONE 4.0: "EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes" [2025-07] [paper]
-
TeleChat2: "Technical Report of TeleChat2, TeleChat2.5 and T1" [2025-07] [paper]
-
Kimi K2: "Kimi K2: Open Agentic Intelligence" [2025-07] [paper]
-
GLM-4.5: "GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models" [2025-08] [paper]
-
GPT-OSS: "gpt-oss-120b & gpt-oss-20b Model Card" [2025-08] [paper]
-
LongCat-Flash: "LongCat-Flash Technical Report" [2025-09] [paper]
-
LLaDA-MoE: "LLaDA-MoE: A Sparse MoE Diffusion Language Model" [2025-09] [paper]
-
Ring-1T: "Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model" [2025-10] [paper]
-
Motif-2: "Motif 2 12.7B technical report" [2025-11] [paper]
-
Instella: "Instella: Fully Open Language Models with Stellar Performance" [2025-11] [paper]
-
DeepSeek-V3.2: "DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models" [2025-12] [paper]
-
Olmo 3: "Olmo 3" [2025-12] [paper]
-
T5Gemma 2: "T5Gemma 2: Seeing, Reading, and Understanding Longer" [2025-12] [paper]
-
LLaDA2.0: "LLaDA2.0: Scaling Up Diffusion Language Models to 100B" [2025-12] [paper]
-
Sigma-Moe-Tiny: "Sigma-Moe-Tiny Technical Report" [2025-12] [paper]
-
Nemotron 3 Nano: "Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning" [2025-12] [paper]
-
K-EXAONE: "K-EXAONE Technical Report" [2026-01] [paper]
-
MiMo-V2-Flash: "MiMo-V2-Flash Technical Report" [2026-01] [paper]
-
Ministral 3: "Ministral 3" [2026-01] [paper]
-
Kimi K2.5: "Kimi K2.5: Visual Agentic Intelligence" [2026-02] [paper]
-
EuroLLM-22B: "EuroLLM-22B: Technical Report" [2026-02] [paper]
-
Step 3.5 Flash: "Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters" [2026-02] [paper]
-
Nanbeige4.1: "Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts" [2026-02] [paper]
-
GLM-5: "GLM-5: from Vibe Coding to Agentic Engineering" [2026-02] [paper]
-
Trinity: "Arcee Trinity Large Technical Report" [2026-02] [paper]
-
JoyAI-LLM Flash: "JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency" [2026-04] [paper]
2.2 Existing LLM Adapted to Code
These models are general-purpose LLMs further pretrained on code-related data.
-
Codex (GPT-3): "Evaluating Large Language Models Trained on Code" [2021-07] [paper]
-
PaLM Coder (PaLM): "PaLM: Scaling Language Modeling with Pathways" [2022-04] [JMLR] [paper]
-
Minerva (PaLM): "Solving Quantitative Reasoning Problems with Language Models" [2022-06] [paper]
-
PaLM 2 * (PaLM 2): "PaLM 2 Technical Report" [2023-05] [paper]
-
Code LLaMA (LLaMA 2): "Code Llama: Open Foundation Models for Code" [2023-08] [paper] [repo]
-
Lemur (LLaMA 2): "Lemur: Harmonizing Natural Language and Code for Language Agents" [2023-10] [ICLR 2024 Spotlight] [paper]
-
BTX (LLaMA 2): "Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM" [2024-03] [paper]
-
HiRoPE: "HiRoPE: Length Extrapolation for Code Models Using Hierarchical Position" [2024-03] [ACL 2024] [paper]
-
"Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models" [2024-03] [paper]
-
CodeGemma: "CodeGemma: Open Code Models Based on Gemma" [2024-04] [paper] [model]
-
DeepSeek-Coder-V2: "DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence" [2024-06] [paper]
-
"Promise and Peril of Collaborative Code Generation Models: Balancing Effectiveness and Memorization" [2024-09] [paper]
-
Qwen2.5-Coder: "Qwen2.5-Coder Technical Report" [2024-09] [paper]
-
Lingma SWE-GPT: "Lingma SWE-GPT: An Open Development-Process-Centric Language Model for Automated Software Improvement" [2024-11] [paper]
-
Ling-Coder-Lite: "Every Sample Matters: Leveraging Mixture-of-Experts and High-Quality Data for Efficient and Accurate Code LLM" [2025-03] [paper]
-
Mify-Coder: "State-of-the-art Small Language Coder Model: Mify-Coder" [2025-12] [paper]
-
Composer 2: "Composer 2 Technical Report" [2026-03] [paper]
2.3 General Pretraining on Code
These models are Transformer encoders, decoders, and encoder-decoders pretrained from scratch using existing objectives for general language modeling.

Encoder
-
CuBERT (MLM + NSP): "Learning and Evaluating Contextual Embedding of Source Code" [2019-12] [ICML 2020] [paper] [repo]
-
CodeBERT (MLM + RTD): "CodeBERT: A Pre-Trained Model for Programming and Natural Languages" [2020-02] [EMNLP 2020 findings] [paper] [repo]
-
GraphCodeBERT (MLM + DFG Edge Prediction + DFG Node Alignment): "GraphCodeBERT: Pre-training Code Representations with Data Flow" [2020-09] [ICLR 2021] [paper] [repo]
-
SynCoBERT (MLM + Identifier Prediction + AST Edge Prediction + Contrastive Learning): "SynCoBERT: Syntax-Guided Multi-Modal Contrastive Pre-Training for Code Representation" [2021-08] [paper]
-
DISCO (MLM + Node Type MLM + Contrastive Learning): "Towards Learning (Dis)-Similarity of Source Code from Program Contrasts" [2021-10] [ACL 2022] [paper]
-
Code-MVP (MLM + Type Inference + Contrastive Learning): "CODE-MVP: Learning to Represent Source Code from Multiple Views with Contrastive Pre-Training" [2022-05] [NAACL 2022 Technical Track] [paper]
-
CodeSage (MLM + Deobfuscation + Contrastive Learning): "Code Representation Learning At Scale" [2024-02] [ICLR 2024] [paper]
-
CoLSBERT (MLM): "Scaling Laws Behind Code Understanding Model" [2024-02] [paper]
-
CodeSSM: "CodeSSM: Towards State Space Models for Code Understanding" [2025-05] [EMNLP 2025] [paper]
Decoder
-
GPT-C (CLM): "IntelliCode Compose: Code Generation Using Transformer" [2020-05] [ESEC/FSE 2020] [paper]
-
CodeGPT (CLM): "CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation" [2021-02] [NeurIPS Datasets and Benchmarks 2021] [paper] [repo]
-
CodeParrot (CLM) [2021-12] [blog]
-
PolyCoder (CLM): "A Systematic Evaluation of Large Language Models of Code" [2022-02] [DL4C@ICLR 2022] [paper] [repo]
-
CodeGen (CLM): "CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis" [2022-03] [ICLR 2023] [paper] [repo]
-
InCoder (Causal Masking): "InCoder: A Generative Model for Code Infilling and Synthesis" [2022-04] [ICLR 2023] [paper] [repo]
-
PyCodeGPT (CLM): "CERT: Continual Pre-Training on Sketches for Library-Oriented Code Generation" [2022-06] [IJCAI-ECAI 2022] [paper] [repo]
-
PanGu-Coder (CLM): "PanGu-Coder: Program Synthesis with Function-Level Language Modeling" [2022-07] [paper]
-
SantaCoder (FIM): "SantaCoder: don't reach for the stars!" [2023-01] [paper] [model]
-
CodeGeeX (CLM): "CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Evaluations on HumanEval-X" [2023-03] [paper] [repo]
-
StarCoder (FIM): "StarCoder: may the source be with you!" [2023-05] [paper] [model]
-
Phi-1 (CLM): "Textbooks Are All You Need" [2023-06] [paper] [model]
-
CodeFuse (CLM): "CodeFuse-13B: A Pretrained Multi-lingual Code Large Language Model" [2023-10] [paper] [model]
-
DeepSeek Coder (CLM+FIM): "DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence" [2024-01] [paper] [repo]
-
StarCoder2 (CLM+FIM): "StarCoder 2 and The Stack v2: The Next Generation" [2024-02] [paper] [repo]
-
CodeShell (CLM+FIM): "CodeShell Technical Report" [2024-03] [paper] [repo]
-
CodeQwen1.5 [2024-04] [blog]
-
Granite: "Granite Code Models: A Family of Open Foundation Models for Code Intelligence" [2024-05] [paper] "Scaling Granite Code Models to 128K Context" [2024-07] [paper]
-
NT-Java: "Narrow Transformer: Starcoder-Based Java-LM For Desktop" [2024-07] [paper]
-
Arctic-SnowCoder: "Arctic-SnowCoder: Demystifying High-Quality Data in Code Pretraining" [2024-09] [paper]
-
aiXcoder: "aiXcoder-7B: A Lightweight and Effective Large Language Model for Code Completion" [2024-10] [paper]
-
OpenCoder: "OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models" [2024-11] [ACL 2025] [paper]
-
ObscuraCoder: "ObscuraCoder: Powering Efficient Code LM Pre-Training Via Obfuscation Grounding" [2025-03] [ICLR 2025] [paper]
-
"Structure-Aware Fill-in-the-Middle Pretraining for Code" [2025-05] [paper]
-
Seed-Coder: "Seed-Coder: Let the Code Model Curate Data for Itself" [2025-06] [paper]
-
CWM: "CWM: An Open-Weights LLM for Research on Code Generation with World Models" [2025-09] [paper]
-
Mellum: "Mellum: Production-Grade in-IDE Contextual Code Completion with Multi-File Project Understanding" [2025-10] [paper]
-
"Scaling Laws for Code: A More Data-Hungry Regime" [2025-10] [paper]
-
"Scaling Laws for Code: Every Programming Language Matters" [2025-12] [paper]
-
InCoder: "InCoder-32B: Code Foundation Model for Industrial Scenarios" [2026-03] [paper]
Encoder-Decoder
-
PyMT5 (Span Corruption): "PyMT5: multi-mode translation of natural language and Python code with transformers" [2020-10] [EMNLP 2020] [paper]
-
Mastropaolo et al. (MLM + Deobfuscation): "DOBF: A Deobfuscation Pre-Training Objective for Programming Languages" [2021-02] [ICSE 2021] [paper] [repo]
-
DOBF (Span Corruption): "Studying the Usage of Text-To-Text Transfer Transformer to Support Code-Related Tasks" [2021-02] [NeurIPS 2021] [paper] [repo]
-
PLBART (DAE): "Unified Pre-training for Program Understanding and Generation" [2021-03] [NAACL 2021] [paper] [repo]
-
CodeT5 (Span Corruption + Identifier Tagging + Masked Identifier Prediction + Text2Code + Code2Text): "CodeT5: Identifier-aware Unified Pre-trained Encoder-Decoder Models for Code Understanding and Generation" [2021-09] [EMNLP 2021] [paper] [repo]
-
SPT-Code (Span Corruption + NSP + Method Name Prediction): "SPT-Code: Sequence-to-Sequence Pre-Training for Learning Source Code Representations" [2022-01] [ICSE 2022 Technical Track] [paper]
-
AlphaCode (MLM + CLM): "Competition-Level Code Generation with AlphaCode" [2022-02] [Science] [paper] [blog]
-
NatGen (Code Naturalization): "NatGen: Generative pre-training by "Naturalizing" source code" [2022-06] [ESEC/FSE 2022] [paper] [repo]
-
ERNIE-Code (Span Corruption + Pivot-based Translation LM): "ERNIE-Code: Beyond English-Centric Cross-lingual Pretraining for Programming Languages" [2022-12] [ACL23 (Findings)] [paper][repo]
-
CodeT5+ (Span Corruption + CLM + Text-Code Contrastive Learning + Text-Code Translation): "CodeT5+: Open Code Large Language Models for Code Understanding and Generation" [2023-05] [EMNLP 2023] [paper] [repo]
-
AST-T5 (Span Corruption): "AST-T5: Structure-Aware Pretraining for Code Generation and Understanding" [2024-01] [ICML 2024] [paper]
-
DivoT5: "Directional Diffusion-Style Code Editing Pre-training" [2025-01] [paper]
UniLM
-
CugLM (MLM + NSP + CLM): "Multi-task Learning based Pre-trained Language Model for Code Completion" [2020-12] [ASE 2020] [paper]
-
UniXcoder (MLM + NSP + CLM + Span Corruption + Contrastive Learning + Code2Text): "UniXcoder: Unified Cross-Modal Pre-training for Code Representation" [2022-03] [ACL 2022] [paper] [repo]
Other Models
-
DiffuCoder: "DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation" [2025-06] [paper]
-
Dream-Coder: "Dream-Coder 7B: An Open Diffusion Language Model for Code" [2025-09] [paper]
-
"Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation" [2025-09] [paper]
-
CoDA: "CoDA: Coding LM via Diffusion Adaptation" [2025-10] [paper]
-
Stable-DiffCoder: "Stable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Model" [2026-01] [paper]
-
DreamOn: "DreamOn: Diffusion Language Models For Code Infilling Beyond Fixed-size Canvas" [2026-02] [paper]
-
"CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding" [2026-02] [paper]
-
IQuest-Coder-V1: "IQuest-Coder-V1 Technical Report" [2026-02] [paper]
2.4 (Instruction) Fine-Tuning on Code
These models apply Instruction Fine-Tuning techniques to enhance the capacities of Code LLMs.
-
WizardCoder (StarCoder + Evol-Instruct): "WizardCoder: Empowering Code Large Language Models with Evol-Instruct" [2023-06] [ICLR 2024] [paper] [repo]
-
PanGu-Coder 2 (StarCoder + Evol-Instruct + RRTF): "PanGu-Coder2: Boosting Large Language Models for Code with Ranking Feedback" [2023-07] [paper]
-
OctoCoder (StarCoder) / OctoGeeX (CodeGeeX2): "OctoPack: Instruction Tuning Code Large Language Models" [2023-08] [ICLR 2024 Spotlight] [paper] [repo]
-
"At Which Training Stage Does Code Data Help LLMs Reasoning" [2023-09] [ICLR 2024 Spotlight] [paper]
-
InstructCoder: "InstructCoder: Instruction Tuning Large Language Models for Code Editing" [paper] [repo]
-
MFTCoder: "MFTCoder: Boosting Code LLMs with Multitask Fine-Tuning" [2023-11] [KDD 2024] [paper] [repo]
-
"LLM-Assisted Code Cleaning For Training Accurate Code Generators" [2023-11] [ICLR 2024] [paper]
-
Magicoder: "Magicoder: Empowering Code Generation with OSS-Instruct" [2023-12] [ICML 2024] [paper]
-
WaveCoder: "WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning" [2023-12] [ACL 2024] [paper]
-
Astraios: "Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models" [2024-01] [paper]
-
DolphCoder: "DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning" [2024-02] [ACL 2024] [paper]
-
SafeCoder: "Instruction Tuning for Secure Code Generation" [2024-02] [ICML 2024] [paper]
-
"Code Needs Comments: Enhancing Code LLMs with Comment Augmentation" [ACL 2024 Findings] [paper]
-
CCT: "Code Comparison Tuning for Code Large Language Models" [2024-03] [paper]
-
SAT: "Structure-aware Fine-tuning for Code Pre-trained Models" [2024-04] [paper]
-
CodeFort: "CodeFort: Robust Training for Code Generation Models" [2024-04] [EMNLP 2024 Findings] [paper]
-
XFT: "XFT: Unlocking the Power of Code Instruction Tuning by Simply Merging Upcycled Mixture-of-Experts" [2024-04] [ACL 2024] [paper] [repo]
-
AIEV-Instruct: "AutoCoder: Enhancing Code Large Language Model with AIEV-Instruct" [2024-05] [paper]
-
AlchemistCoder: "AlchemistCoder: Harmonizing and Eliciting Code Capability by Hindsight Tuning on Multi-source Data" [2024-05] [NeurIPS 2024] [paper]
-
"From Symbolic Tasks to Code Generation: Diversification Yields Better Task Performers" [2024-05] [paper]
-
"Unveiling the Impact of Coding Data Instruction Fine-Tuning on Large Language Models Reasoning" [2024-05] [paper]
-
SemCoder: "SemCoder: Training Code Language Models with Comprehensive Semantics Reasoning" [2024-06] [NeurIPS 2024] [paper]
-
PLUM: "PLUM: Preference Learning Plus Test Cases Yields Better Code Language Models" [2024-06] [paper]
-
mCoder: "McEval: Massively Multilingual Code Evaluation" [2024-06] [ICLR 2025] [paper]
-
"Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models" [2024-06] [paper]
-
Code-Optimise: "Code-Optimise: Self-Generated Preference Data for Correctness and Efficiency" [2024-06] [paper]
-
UniCoder: "UniCoder: Scaling Code Large Language Model via Universal Code" [2024-06] [ACL 2024] [paper]
-
"Brevity is the soul of wit: Pruning long files for code generation" [2024-06] [paper]
-
"Code Less, Align More: Efficient LLM Fine-tuning for Code Generation with Data Pruning" [2024-07] [paper]
-
InverseCoder: "InverseCoder: Unleashing the Power of Instruction-Tuned Code LLMs with Inverse-Instruct" [2024-07] [paper]
-
"Curriculum Learning for Small Code Language Models" [2024-07] [paper]
-
Genetic-Instruct: "Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models" [2024-07] [paper]
-
DataScope: "API-guided Dataset Synthesis to Finetune Large Code Models" [2024-08] [paper]
-
XCoder: "How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data" [2024-09] [EMNLP 2024] [paper]
-
GALLa: "GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding" [2024-09] [ACL 2025] [paper]
-
HexaCoder: "HexaCoder: Secure Code Generation via Oracle-Guided Synthetic Training Data" [2024-09] [paper]
-
AMR-Evol: "AMR-Evol: Adaptive Modular Response Evolution Elicits Better Knowledge Distillation for Large Language Models in Code Generation" [2024-10] [EMNLP 2024] [paper]
-
LintSeq: "Training Language Models on Synthetic Edit Sequences Improves Code Synthesis" [2024-10] [ICLR 2025] [paper]
-
CoBa: "CoBa: Convergence Balancer for Multitask Finetuning of Large Language Models" [2024-10] [EMNLP 2024] [paper]
-
CursorCore: "CursorCore: Assist Programming through Aligning Anything" [2024-10] [paper]
-
SelfCodeAlign: "SelfCodeAlign: Self-Alignment for Code Generation" [2024-10] [NeurIPS 2024] [paper]
-
"Mastering the Craft of Data Synthesis for CodeLLMs" [2024-10] [paper]
-
CodeLutra: "CodeLutra: Boosting LLM Code Generation via Preference-Guided Refinement" [2024-11] [paper]
-
DSTC: "DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs" [2024-11] [paper]
-
WarriorCoder: "WarriorCoder: Learning from Expert Battles to Augment Code Large Language Models" [2024-12] [ACL 2025] [paper]
-
EpiCoder: "EpiCoder: Encompassing Diversity and Complexity in Code Generation" [2025-01] [ICML 2025] [paper]
-
Qwen2.5-xCoder: "Multi-Agent Collaboration for Multilingual Code Instruction Tuning" [2025-02] [ACL 2025] [paper]
-
UnitCoder: "UnitCoder: Scalable Code Synthesis from Pre-training Corpora" [2025-02] [EMNLP 2025] [paper]
-
GiFT: "GiFT: Gibbs Fine-Tuning for Code Generation" [2025-02] [ACL 2025] [paper]
-
KODCODE: "KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding" [2025-03] [ACL 2025 Findings] [paper]
-
NextCoder: "NextCoder: Robust Adaptation of Code LMs to Diverse Code Edits" [2025-03] [ICML 2025] [paper]
-
FAIT: "FAIT: Fault-Aware Fine-Tuning for Better Code Generation" [2025-03] [paper]
-
Z1: "Z1: Efficient Test-time Scaling with Code" [2025-04] [EMNLP 2025 Industry] [paper]
-
OpenCodeReasoning: "OpenCodeReasoning: Advancing Data Distillation for Competitive Coding" [2025-04] [paper]
-
OpenCodeInstruct: "OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs" [2025-04] [paper]
-
"Data-efficient LLM Fine-tuning for Code Generation" [2025-04] [paper]
-
"AKD : Adversarial Knowledge Distillation For Large Language Models Alignment on Coding tasks" [2025-05] [paper]
-
"CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation" [2025-05] [paper]
-
VisCoder: "VisCoder: Fine-Tuning LLMs for Executable Python Visualization Code Generation" [2025-05] [EMNLP 2025 Findings] [paper]
-
"AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy" [2025-06] [paper]
-
MoLE: "Mix-of-Language-Experts Architecture for Multilingual Programming" [2025-06] [paper]
-
OpenCodeReasoning-II: "OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique" [2025-07] [paper]
-
"CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback" [2025-07] [paper]
-
Tree-of-Evolution: "Tree-of-Evolution: Tree-Structured Instruction Evolution for Code Generation in Large Language Models" [2025-07] [ACL 2025] [paper]
-
SCoder: "SCoder: Progressive Self-Distillation for Bootstrapping Small-Scale Data Synthesizers to Empower Code LLMs" [2025-09] [EMNLP 2025 Fidnings] [paper]
-
"Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models" [2025-09] [EMNLP 2025 Findings] [paper]
-
"SCoGen: Scenario-Centric Graph-Based Synthesis of Real-World Code Problems" [2025-09] [paper]
-
"Verification Limits Code LLM Training" [2025-09] [paper]
-
JanusCoder: "JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence" [2025-10] [paper]
-
VisCoder2: "VisCoder2: Building Multi-Language Visualization Coding Agents" [2025-10] [paper]
-
"Beyond Language Boundaries: Uncovering Programming Language Families for Code Language Models" [2025-12] [paper]
-
X-Coder: "X-Coder: Advancing Competitive Programming with Fully Synthetic Tasks, Solutions, and Tests" [2026-01] [paper]
-
SRI: "From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning" [2026-01] [paper]
-
"HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-BENCH" [2026-01] [paper]
-
"Multi-task Code LLMs: Data Mix or Model Merge?" [2026-01] [paper]
-
"QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions" [2026-03] [paper]
-
"Embarrassingly Simple Self-Distillation Improves Code Generation" [2026-04] [paper]
-
"Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL" [2026-04] [paper]
2.5 Reinforcement Learning on Code
-
CompCoder: "Compilable Neural Code Generation with Compiler Feedback" [2022-03] [ACL 2022] [paper]
-
CodeRL: "CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning" [2022-07] [NeurIPS 2022] [paper] [repo]
-
PPOCoder: "Execution-based Code Generation using Deep Reinforcement Learning" [2023-01] [TMLR 2023] [paper] [repo]
-
RLTF: "RLTF: Reinforcement Learning from Unit Test Feedback" [2023-07] [paper] [repo]
-
B-Coder: "B-Coder: Value-Based Deep Reinforcement Learning for Program Synthesis" [2023-10] [ICLR 2024] [paper]
-
IRCoCo: "IRCoCo: Immediate Rewards-Guided Deep Reinforcement Learning for Code Completion" [2024-01] [FSE 2024] [paper]
-
StepCoder: "StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback" [2024-02] [ACL 2024] [paper]
-
RLPF & DPA: "Performance-Aligned LLMs for Generating Fast Code" [2024-04] [paper]
-
"Measuring memorization in RLHF for code completion" [2024-06] [ICLR 2025] [paper]
-
"Applying RLAIF for Code Generation with API-usage in Lightweight LLMs" [2024-06] [paper]
-
RLCoder: "RLCoder: Reinforcement Learning for Repository-Level Code Completion" [2024-07] [paper]
-
PF-PPO: "Policy Filtration in RLHF to Fine-Tune LLM for Code Generation" [2024-09] [paper]
-
Coffee-Gym: "Coffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Code" [2024-09] [EMNLP 2024] [paper]
-
RLEF: "RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning" [2024-10] [ICML 2025] [paper]
-
CodePMP: "CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning" [2024-10] [paper]
-
CodeDPO: "CodeDPO: Aligning Code Models with Self Generated and Verified Source Code" [2024-10] [ACL 2025] [paper]
-
"Process Supervision-Guided Policy Optimization for Code Generation" [2024-10] [paper]
-
"Aligning CodeLLMs with Direct Preference Optimization" [2024-10] [paper]
-
FALCON: "FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system" [2024-10] [paper]
-
PFPO: "Preference Optimization for Reasoning with Pseudo Feedback" [2024-11] [paper]
-
o1-Coder: "o1-Coder: an o1 Replication for Coding" [2024-11] [paper]
-
PRLCoder: "Process-Supervised Reinforcement Learning for Code Generation" [2025-02] [EMNLP 2025] [paper]
-
AceCoder: "ACECODER: Acing Coder RL via Automated Test-Case Synthesis" [2025-02] [ACL 2025] [paper]
-
Focused-DPO: "Focused-DPO: Enhancing Code Generation Through Focused Preference Optimization on Error-Prone Points" [2025-02] [ACL 2025 Findings] [paper]
-
SWE-RL: "SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution" [2025-02] [paper]
-
AceReason-Nemotron: "AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning" [2025-05] [paper]
-
rStar-Coder: "rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset" [2025-05] [paper]
-
CURE: "Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning" [2025-06] [paper]
-
Magistral [2025-06] [paper]
-
Ring-lite: "Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs" [2025-06] [paper]
-
ReST-RL: "ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding" [2025-08] [paper]
-
"Towards Better Correctness and Efficiency in Code Generation" [2025-08] [paper]
-
"Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization" [2025-09] [paper]
-
"DELTA-Code: How Does RL Unlock and Transfer New Programming Algorithms in LLMs?" [2025-09] [paper]
-
Critique-Coder: "Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning" [2025-09] [paper]
-
CodeRL+: "CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment" [2025-10] [paper]
-
"GAPO: Group Adaptive Policy Optimization for Real-World Code Edit" [2025-10] [paper]
-
AesCoder: "Code Aesthetics with Agentic Reward Feedback" [2025-10] [paper]
-
MURPHY: "MURPHY: Multi-Turn GRPO for Self Correcting Code Generation" [2025-11] [paper]
-
VeRPO: "VeRPO: Verifiable Dense Reward Policy Optimization for Code Generation" [2026-01] [paper]
-
Cobalt: "Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation" [2026-02] [paper]
-
MicroCoder-GRPO: "Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models" [2026-03] [paper]
-
"ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning" [2026-03] [paper]
-
EvolveCoder: "EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning" [2026-03] [paper]
-
Code-A1: "Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning" [2026-03] [paper]
3. When Coding Meets Reasoning
3.1 Coding for Reasoning
-
PAL: "PAL: Program-aided Language Models" [2022-11] [ICML 2023] [paper] [repo]
-
PoT: "Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks" [2022-11] [TMLR 2023] [paper] [repo]
-
PaD: "PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning" [2023-05] [NAACL 2024] [paper]
-
CSV: "Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification" [2023-08] [ICLR 2024] [paper]
-
MathCoder: "MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning" [2023-10] [ICLR 2024] [paper]
-
CoC: "Chain of Code: Reasoning with a Language Model-Augmented Code Emulator" [2023-12] [ICML 2024] [paper]
-
EHRAgent: "EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health Records" [2024-01] [EMNLP 2024] [paper]
-
MARIO: "MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline" [2024-01] [ACL 2024 Findings] [paper]
-
"Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMs" [2024-01] [EMNLP 2024] [paper]
-
ReGAL: "ReGAL: Refactoring Programs to Discover Generalizable Abstractions" [2024-01] [ICML 2024] [paper]
-
CodeAct: "Executable Code Actions Elicit Better LLM Agents" [2024-02] [ICML 2024] [paper]
-
MultiPoT: "Python is Not Always the Best Choice: Embracing Multilingual Program of Thoughts" [2024-02] [EMNLP 2024] [paper]
-
HProPro: "Exploring Hybrid Question Answering via Program-based Prompting" [2024-02] [ACL 2024] [paper]
-
HTL: "How Do Humans Write Code? Large Models Do It the Same Way Too" [2024-02] [EMNLP 2024] [paper]
-
xSTREET: "Eliciting Better Multilingual Structured Reasoning from LLMs through Code" [2024-03] [ACL 2024] [paper]
-
FlowMind: "FlowMind: Automatic Workflow Generation with LLMs" [2024-03] [paper]
-
Think-and-Execute: "Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language Models" [2024-04] [EMNLP 2024] [paper]
-
CoRE: "CoRE: LLM as Interpreter for Natural Language Programming, Pseudo-Code Programming, and Flow Programming of AI Agents" [2024-05] [paper]
-
MuMath-Code: "MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical Reasoning" [2024-05] [EMNLP 2024] [paper]
-
COGEX: "Learning to Reason via Program Generation, Emulation, and Search" [2024-05] [NeurIPS 2024] [paper]
-
"Arithmetic Reasoning with LLM: Prolog Generation & Permutation" [2024-05] [paper]
-
"Can LLMs Reason in the Wild with Programs?" [2024-06] [EMNLP 2024 Findings] [paper]
-
DotaMath: "DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning" [2024-07] [paper]
-
CIBench: "CIBench: Evaluating Your LLMs with a Code Interpreter Plugin" [2024-07] [paper]
-
PyBench: "PyBench: Evaluating LLM Agent on various real-world coding tasks" [2024-07] [paper]
-
AdaCoder: "AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering" [2024-07] [paper]
-
PyramidCoder: "Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering" [2024-07] [paper]
-
CodeGraph: "CodeGraph: Enhancing Graph Reasoning of LLMs with Code" [2024-08] [paper]
-
SIaM: "SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models" [2024-08] [paper]
-
CodePlan: "CodePlan: Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning" [2024-09] [ICLR 2025] [paper]
-
PoT: "Proof of Thought : Neurosymbolic Program Synthesis allows Robust and Interpretable Reasoning" [2024-09] [paper]
-
MetaMath: "MetaMath: Integrating Natural Language and Code for Enhanced Mathematical Reasoning in Large Language Models" [2024-09] [paper]
-
"BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data" [2024-10] [paper]
-
CodeSteer: "Steering Large Language Models between Code Execution and Textual Reasoning" [2024-10] [ICLR 2025] [paper]
-
MathCoder2: "MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical Code" [2024-10] [ICLR 2025] [paper]
-
LLMFP: "Planning Anything with Rigor: General-Purpose Zero-Shot Planning with LLM-based Formalized Programming" [2024-10] [paper]
-
Prove: "Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning" [2024-10] [paper]
-
PROVE: "Trust but Verify: Programmatic VLM Evaluation in the Wild" [2024-10] [paper]
-
GeoCoder: "GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models" [2024-10] [paper]
-
ReasonAgain: "ReasonAgain: Using Extractable Symbolic Programs to Evaluate Mathematical Reasoning" [2024-10] [paper]
-
GFP: "Gap-Filling Prompting Enhances Code-Assisted Mathematical Reasoning" [2024-11] [paper]
-
UTMath: "UTMath: Math Evaluation with Unit Test via Reasoning-to-Coding Thoughts" [2024-11] [paper]
-
CoCoP: "CoCoP: Enhancing Text Classification with LLM through Code Completion Prompt" [2024-11] [paper]
-
REPL-Plan: "Interactive and Expressive Code-Augmented Planning with Large Language Models" [2024-11] [paper]
-
CrossPAL: "Empowering Multi-step Reasoning across Languages via Program-Aided Language Models" [2024-11] [EMNLP 2024] [paper]
-
"From Code to Play: Benchmarking Program Search for Games Using Large Language Models" [2024-12] [paper]
-
CoinMath: "CoinMath: Harnessing the Power of Coding Instruction for Math LLMs" [2024-12] [ACL 2025 Findings] [paper]
-
MultiLingPoT: "MultiLingPoT: Boosting Mathematical Reasoning in LLMs through Multilingual Program Integration" [2024-12] [EMNLP 2025 Findings] [paper]
-
ProgCo: "ProgCo: Program Helps Self-Correction of Large Language Models" [2025-01] [ACL 2025] [paper]
-
PIE: "Pseudocode-Injection Magic: Enabling LLMs to Tackle Graph Computational Tasks" [2025-01] [paper]
-
AutoCode4Math: "Learning Autonomous Code Integration for Math Language Models" [2025-02] [paper]
-
MIHTCCT: "MIH-TCCT: Mitigating Inconsistent Hallucinations in LLMs via Event-Driven Text-Code Cyclic Training" [2025-02] [paper]
-
ToolCoder: "ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language Models" [2025-02] [paper]
-
RM-PoT: "RM-PoT: Reformulating Mathematical Problems and Solving via Program of Thoughts" [2025-02] [paper]
-
SBSC: "SBSC: Step-By-Step Coding for Improving Mathematical Olympiad Performance" [2025-02] [ICLR 2025] [paper]
-
"Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments" [2025-02] [ACL 2025 Findings] [paper]
-
"Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs" [2025-02] [EMNLP 2025] [paper]
-
"The KoLMogorov Test: Compression by Code Generation" [2025-03] [ICLR 2025] [paper]
-
MathCoder-VL: "MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning" [2025-05] [ACL 2025 Findings] [paper]
-
R1-Code-Interpreter: "R1-Code-Interpreter: Training LLMs to Reason with Code via Supervised and Reinforcement Learning" [2025-05] [paper]
-
"Towards Effective Code-Integrated Reasoning" [2025-05] [paper]
-
"CoRT: Code-integrated Reasoning within Thinking" [2025-06] [paper]
-
"Code Execution as Grounded Supervision for LLM Reasoning" [2025-06] [EMNLP 2025] [paper]
-
PBB: "Programming by Backprop: LLMs Acquire Reusable Algorithmic Abstractions During Code Training" [2025-06] [paper]
-
"On Code-Induced Reasoning in LLMs" [2025-09] [paper]
-
PIPS: "Once Upon an Input: Reasoning via Per-Instance Program Synthesis" [2025-10] [paper]
3.2 Code Simulation
-
"Code Simulation Challenges for Large Language Models" [2024-01] [paper]
-
"CodeMind: A Framework to Challenge Large Language Models for Code Reasoning" [2024-02] [paper]
-
"Executing Natural Language-Described Algorithms with Large Language Models: An Investigation" [2024-02] [paper]
-
"Can Language Models Pretend Solvers? Logic Code Simulation with LLMs" [2024-03] [paper]
-
"Evaluating Large Language Models with Runtime Behavior of Program Execution" [2024-03] [paper]
-
"NExT: Teaching Large Language Models to Reason about Code Execution" [2024-04] [ICML 2024] [paper]
-
"SelfPiCo: Self-Guided Partial Code Execution with LLMs" [2024-07] [paper]
-
"LogicPro: Improving Complex Logical Reasoning via Program-Guided Learning" [2024-09] [ACL 2025] [paper]
-
"Large Language Models as Code Executors: An Exploratory Study" [2024-10] [paper]
-
"VISUALCODER: Guiding Large Language Models in Code Execution with Fine-grained Multimodal Chain-of-Thought Reasoning" [2024-10] [paper]
-
"CoCoNUT: Structural Code Understanding does not fall out of a tree" [2025-01] [paper]
-
"CodeI/O: Condensing Reasoning Patterns via Code Input-Output Prediction" [2025-02] [ICML 2025] [paper]
-
"SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors" [2025-02] [EMNLP 2025] [paper]
-
"What I cannot execute, I do not understand: Training and Evaluating LLMs on Program Execution Traces" [2025-02] [paper]
-
"L0-Reasoning Bench: Evaluating Procedural Correctness in Language Models via Simple Program Execution" [2025-03] [paper]
-
"PLSemanticsBench: Large Language Models As Programming Language Interpreters" [2025-10] [paper]
-
"Metric Calculating Benchmark: Code-Verifiable Complicate Instruction Following Benchmark for Large Language Models" [2025-10] [paper]
-
"Breaking the Attention Trap in Code LLMs: A Rejection Sampling Approach to Enhance Code Execution Prediction" [2025-11] [EMNLP 2025 Findings] [paper]
3.3 Code Agents
-
Self-collaboration: "Self-collaboration Code Generation via ChatGPT" [2023-04] [paper]
-
ChatDev: "Communicative Agents for Software Development" [2023-07] [paper] [repo]
-
MetaGPT: "MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework" [2023-08] [paper] [repo]
-
CodeChain: "CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modules" [2023-10] [ICLR 2024] [paper]
-
CodeAgent: "CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges" [2024-01] [ACL 2024] [paper]
-
CONLINE: "CoCoST: Automatic Complex Code Generation with Online Searching and Correctness Testing" [2024-03] [EMNLP 2024] [paper]
-
LCG: "When LLM-based Code Generation Meets the Software Development Process" [2024-03] [paper]
-
RepairAgent: "RepairAgent: An Autonomous, LLM-Based Agent for Program Repair" [2024-03] [paper]
-
MAGIS:: "MAGIS: LLM-Based Multi-Agent Framework for GitHub Issue Resolution" [2024-03] [paper]
-
SoA: "Self-Organized Agents: A LLM Multi-Agent Framework toward Ultra Large-Scale Code Generation and Optimization" [2024-04] [paper]
-
AutoCodeRover: "AutoCodeRover: Autonomous Program Improvement" [2024-04] [paper]
-
SWE-agent: "SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering" [2024-05] [paper]
-
MapCoder: "MapCoder: Multi-Agent Code Generation for Competitive Problem Solving" [2024-05] [ACL 2024] [paper]
-
"Fight Fire with Fire: How Much Can We Trust ChatGPT on Source Code-Related Tasks?" [2024-05] [paper]
-
FunCoder: "Divide-and-Conquer Meets Consensus: Unleashing the Power of Functions in Code Generation" [2024-05] [paper]
-
CTC: "Multi-Agent Software Development through Cross-Team Collaboration" [2024-06] [paper]
-
MASAI: "MASAI: Modular Architecture for Software-engineering AI Agents" [2024-06] [paper]
-
AgileCoder: "AgileCoder: Dynamic Collaborative Agents for Software Development based on Agile Methodology" [2024-06] [paper]
-
CodeNav: "CodeNav: Beyond tool-use to using real-world codebases with LLM agents" [2024-06] [paper]
-
INDICT: "INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness" [2024-06] [paper]
-
AppWorld: "AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents" [2024-07] [paper]
-
CortexCompile: "CortexCompile: Harnessing Cortical-Inspired Architectures for Enhanced Multi-Agent NLP Code Synthesis" [2024-08] [paper]
-
DEI: "Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents" [2024-08] [ICLR 2025] [paper]
-
Survey: "Large Language Model-Based Agents for Software Engineering: A Survey" [2024-09] [paper]
-
PairCoder: "A Pair Programming Framework for Code Generation via Multi-Plan Exploration and Feedback-Driven Refinement" [2024-09] [ASE 2024] [paper] [repo]
-
AutoSafeCoder: "AutoSafeCoder: A Multi-Agent Framework for Securing LLM Code Generation through Static Analysis and Fuzz Testing" [2024-09] [paper]
-
SuperCoder2.0: "SuperCoder2.0: Technical Report on Exploring the feasibility of LLMs as Autonomous Programmer" [2024-09] [paper]
-
Survey: "Agents in Software Engineering: Survey, Landscape, and Vision" [2024-09] [paper]
-
MOSS: "MOSS: Enabling Code-Driven Evolution and Context Management for AI Agents" [2024-09] [paper]
-
HyperAgent: "HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale" [2024-09] [paper]
-
"Compositional Hardness of Code in Large Language Models -- A Probabilistic Perspective" [2024-09] [paper]
-
RGD: "RGD: Multi-LLM Based Agent Debugger via Refinement and Generation Guidance" [2024-10] [paper]
-
Seeker: "Seeker: Enhancing Exception Handling in Code with LLM-based Multi-Agent Approach" [2024-10] [paper]
-
REDO: "REDO: Execution-Free Runtime Error Detection for COding Agents" [2024-10] [paper]
-
"Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios" [2024-10] [paper]
-
EvoMAC: "Self-Evolving Multi-Agent Collaboration Networks for Software Development" [2024-10] [ICLR 2025] [paper]
-
VisionCoder: "VisionCoder: Empowering Multi-Agent Auto-Programming for Image Processing with Hybrid LLMs" [2024-10] [paper]
-
AutoKaggle: "AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions" [2024-10] [paper]
-
Watson: "Watson: A Cognitive Observability Framework for the Reasoning of Foundation Model-Powered Agents" [2024-11] [paper]
-
CodeTree: "CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models" [2024-11] [paper]
-
EvoCoder: "LLMs as Continuous Learners: Improving the Reproduction of Defective Code in Software Issues" [2024-11] [paper]
-
AEGIS: "AEGIS: An Agent-based Framework for General Bug Reproduction from Issue Descriptions" [2024-11] [paper]
-
ExecutionAgent: "You Name It, I Run It: An LLM Agent to Execute Tests of Arbitrary Projects" [2024-12] [paper]
-
GHIssueMarket: "GHIssuemarket: A Sandbox Environment for SWE-Agents Economic Experimentation" [2024-12] [paper]
-
SWE-Gym: "Training Software Engineering Agents and Verifiers with SWE-Gym" [2024-12] [ICML 2025] [paper]
-
SWE-Fixer: "SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolution" [2025-01] [ACL 2025 Findings] [paper]
-
CodeCoR: "CodeCoR: An LLM-Based Self-Reflective Multi-Agent Framework for Code Generation" [2025-01] [paper]
-
QualityFlow: "QualityFlow: An Agentic Workflow for Program Synthesis Controlled by LLM Quality Checks" [2025-01] [paper]
-
Cogito: "Cogito, ergo sum: A Neurobiologically-Inspired Cognition-Memory-Growth System for Code Generation" [2025-01] [paper]
-
OrcaLoca: "OrcaLoca: An LLM Agent Framework for Software Issue Localization" [2025-02] [ICML 2025] [paper]
-
BRT Agent: "Agentic Bug Reproduction for Effective Automated Program Repair at Google" [2025-02] [paper]
-
CodeSim: "CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging" [2025-02] [paper]
-
SyncMind: "SyncMind: Measuring Agent Out-of-Sync Recovery in Collaborative Software Engineering" [2025-02] [ICML 2025] [paper]
-
SoRFT: "SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-Tuning" [2025-02] [paper]
-
"Is Multi-Agent Debate (MAD) the Silver Bullet? An Empirical Analysis of MAD in Code Summarization and Translation" [2025-03] [paper]
-
DARS: "DARS: Dynamic Action Re-Sampling to Enhance Coding Agent Performance by Adaptive Tree Traversal" [2025-03] [ACL 2025] [paper]
-
SEAlign: "SEAlign: Alignment Training for Software Engineering Agent" [2025-03] [paper]
-
SWE-SynInfer: "Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute" [2025-03] [paper]
-
AdaCoder: "AdaCoder: An Adaptive Planning and Multi-Agent Framework for Function-Level Code Generation" [2025-04] [paper]
-
SICA: "A Self-Improving Coding Agent" [2025-04] [paper]
-
SWE-smith: "SWE-smith: Scaling Data for Software Engineering Agents" [2025-04] [paper]
-
"Enhancing LLM Code Generation: A Systematic Evaluation of Multi-Agent Collaboration and Runtime Debugging for Improved Accuracy, Reliability, and Latency" [2025-05] [paper]
-
SEW: "SEW: Self-Evolving Agentic Workflows for Automated Code Generation" [2025-05] [paper]
-
RepoMaster: "RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving" [2025-05] [paper]
-
Code Researcher: "Code Researcher: Deep Research Agent for Large Systems Code and Commit History" [2025-05] [paper]
-
"Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve" [2025-05] [paper]
-
"EvoGit: Decentralized Code Evolution via Git-Based Multi-Agent Collaboration" [2025-06] [paper]
-
SWE-Factory: "SWE-Factory: Your Automated Factory for Issue Resolution Training Data and Evaluation Benchmarks" [2025-06] [paper]
-
Agent-RLVR: "Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards" [2025-06] [paper]
-
AlphaEvolve: "AlphaEvolve: A coding agent for scientific and algorithmic discovery" [2025-06] [paper]
-
USEagent: "Unified Software Engineering agent as AI Software Engineer" [2025-06] [paper]
-
SemAgent: "SemAgent: A Semantics Aware Program Repair Agent" [2025-06] [paper]
-
Trae Agent: "Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling" [2025-07] [paper]
-
"Nemotron-CORTEXA: Enhancing LLM Agents for Software Engineering Tasks via Improved Localization and Solution Diversity" [2025-07] [ICML 2025] [paper]
-
DebateCoder: "DebateCoder: Towards Collective Intelligence of LLMs via Test Case Driven LLM Debate for Code Generation" [2025-07] [ACL 2025] [paper]
-
"GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging" [2025-08] [paper]
-
MapCoder-Lite: "MapCoder-Lite: Squeezing Multi-Agent Coding into a Single Small LLM" [2025-09] [paper]
-
Devstral: "Devstral: Fine-tuning Language Models for Coding Agent Applications" [2025-09] [paper]
-
Lita: "Lita: Light Agent Uncovers the Agentic Coding Capabilities of LLMs" [2025-09] [paper]
-
Kimi-Dev: "Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents" [2025-09] [paper]
-
VeriGuard: "VeriGuard: Enhancing LLM Agent Safety via Verified Code Generation" [2025-10] [paper]
-
KAT-Coder: "KAT-Coder Technical Report" [2025-10] [paper]
-
TOM-SWE: "TOM-SWE: User Mental Modeling For Software Engineering Agents" [2025-10] [paper]
-
SwiftSolve: "SwiftSolve: A Self-Iterative, Complexity-Aware Multi-Agent Framework for Competitive Programming" [2025-10] [paper]
-
CodeClash: "CodeClash: Benchmarking Goal-Oriented Software Engineering" [2025-11] [paper]
-
"A Comprehensive Empirical Evaluation of Agent Frameworks on Code-centric Software Engineering Tasks" [2025-10] [paper]
-
"Designing LLM-based Multi-Agent Systems for Software Engineering Tasks: Quality Attributes, Design Patterns and Rationale" [2025-11] [paper]
-
"Evaluating Software Process Models for Multi-Agent Class-Level Code Generation" [2025-11] [paper]
-
LoCoBench-Agent: "LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering" [2025-11] [paper]
-
Live-SWE-agent: "Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?" [2025-11] [paper]
-
"Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems" [2025-11] [paper]
-
"Process-Centric Analysis of Agentic Software Systems" [2025-12] [paper]
-
PARC: "PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks" [2025-12] [paper]
-
DeepCode: "DeepCode: Open Agentic Coding" [2025-12] [paper]
-
CCA: "Confucius Code Agent: An Open-sourced AI Software Engineer at Industrial Scale" [2025-12] [paper]
-
SWE-Playground: "Training Versatile Coding Agents in Synthetic Environments" [2025-12] [paper]
-
SSR: "Toward Training Superintelligent Software Agents through Self-Play SWE-RL" [2025-12] [paper]
-
RepoNavigator: "One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents" [2025-12] [paper]
-
SWE-RM: "SWE-RM: Execution-free Feedback For Software Engineering Agents" [2025-12] [paper]
-
MemGovern: "MemGovern: Enhancing Code Agents through Learning from Governed Human Experiences" [2026-01] [paper]
-
"APEX-SWE" [2026-01] [paper]
-
Terminal-Bench: "Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces" [2026-01] [paper]
-
CooperBench: "CooperBench: Why Coding Agents Cannot be Your Teammates Yet" [2026-01] [paper]
-
SWE-Pruner: "SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents" [2026-01] [paper]
-
daVinci-Dev: "daVinci-Dev: Agent-native Mid-training for Software Engineering" [2026-01] [paper]
-
DevOps-Gym: "DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle" [2026-01] [paper]
-
TerminalTraj: "Large-Scale Terminal Agentic Trajectory Generation from Dockerized Environments" [2026-02] [paper]
-
RPG-Encoder: "Closing the Loop: Universal Repository Representation with RPG-Encoder" [2026-02] [paper]
-
TDScaling: "Beyond Quantity: Trajectory Diversity Scaling for Code Agents" [2026-02] [paper]
-
SWE-Master: "SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training" [2026-02] [paper]
-
SWE-World: "SWE-World: Building Software Engineering Agents in Docker-Free Environments" [2026-02] [paper]
-
"Scaling Agentic Verifier for Competitive Coding" [2026-02] [paper]
-
TermiGen: "TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents" [2026-02] [paper]
-
LongCLI-Bench: "LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces" [2026-02] [paper]
-
Hybrid-Gym: "Hybrid-Gym: Training Coding Agents to Generalize Across Tasks" [2026-02] [paper]
-
"Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining" [2026-03] [paper]
-
DeepCommit: "EvoClaw: Evaluating AI Agents on Continuous Software Evolution" [2026-03] [paper]
-
CAID: "Effective Strategies for Asynchronous Software Engineering Agents" [2026-03] [paper]
-
"Coding Agents are Effective Long-Context Processors" [2026-03] [paper]
-
SlopCodeBench: "SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks" [2026-03] [paper]
-
KAT-Coder-V2: "KAT-Coder-V2 Technical Report" [2026-03] [paper]
-
SWE Atlas: "SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution" [2026-05] [paper]
3.4 Interactive Coding
-
"Interactive Program Synthesis" [2017-03] [paper]
-
"Question selection for interactive program synthesis" [2020-06] [PLDI 2020] [paper]
-
"Interactive Code Generation via Test-Driven User-Intent Formalization" [2022-08] [paper]
-
"Improving Code Generation by Training with Natural Language Feedback" [2023-03] [TMLR] [paper]
-
"Self-Refine: Iterative Refinement with Self-Feedback" [2023-03] [NeurIPS 2023] [paper]
-
"Teaching Large Language Models to Self-Debug" [2023-04] [paper]
-
"Self-Edit: Fault-Aware Code Editor for Code Generation" [2023-05] [ACL 2023] [paper]
-
"LeTI: Learning to Generate from Textual Interactions" [2023-05] [paper]
-
"Is Self-Repair a Silver Bullet for Code Generation?" [2023-06] [ICLR 2024] [paper]
-
"InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback" [2023-06] [NeurIPS 2023] [paper]
-
"INTERVENOR: Prompting the Coding Ability of Large Language Models with the Interactive Chain of Repair" [2023-11] [ACL 2024 Findings] [paper]
-
"OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement" [2024-02] [ACL 2024 Findings] [paper]
-
"Iterative Refinement of Project-Level Code Context for Precise Code Generation with Compiler Feedback" [2024-03] [ACL 2024 Findings] [paper]
-
"CYCLE: Learning to Self-Refine the Code Generation" [2024-03] [paper]
-
"LLM-based Test-driven Interactive Code Generation: User Study and Empirical Evaluation" [2024-04] [paper]
-
"SOAP: Enhancing Efficiency of Generated Code via Self-Optimization" [2024-05] [paper]
-
"Code Repair with LLMs gives an Exploration-Exploitation Tradeoff" [2024-05] [NeurIPS 2024] [paper]
-
"ReflectionCoder: Learning from Reflection Sequence for Enhanced One-off Code Generation" [2024-05] [ACL 2025] [paper]
-
"Training LLMs to Better Self-Debug and Explain Code" [2024-05] [NeurIPS 2024] [paper]
-
"Requirements are All You Need: From Requirements to Code with LLMs" [2024-06] [paper]
-
"I Need Help! Evaluating LLM's Ability to Ask for Users' Support: A Case Study on Text-to-SQL Generation" [2024-07] [EMNLP 2024] [paper]
-
"An Empirical Study on Self-correcting Large Language Models for Data Science Code Generation" [2024-08] [paper]
-
"RethinkMCTS: Refining Erroneous Thoughts in Monte Carlo Tree Search for Code Generation" [2024-09] [EMNLP 2025] [paper]
-
"From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging" [2024-10] [paper] [repo]
-
"What Makes Large Language Models Reason in (Multi-Turn) Code Generation?" [2024-10] [ICLR 2025] [paper]
-
"The First Prompt Counts the Most! An Evaluation of Large Language Models on Iterative Example-based Code Generation" [2024-11] [paper]
-
"Planning-Driven Programming: A Large Language Model Programming Workflow" [2024-11] [ACL 2025] [paper]
-
"ConAIR:Consistency-Augmented Iterative Interaction Framework to Enhance the Reliability of Code Generation" [2024-11] [paper]
-
"Socratic Human Feedback (SoHF): Expert Steering Strategies for LLM Code Generation" [2024-11] [EMNLP 2024 Findings] [paper]
-
"PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback" [2024-11] [paper]
-
"GenX: Mastering Code and Test Generation with Execution Feedback" [2024-12] [paper]
-
"Helping LLMs Improve Code Generation Using Feedback from Testing and Static Analysis" [2024-12] [paper]
-
"Outcome-Refining Process Supervision for Code Generation" [2024-12] [paper]
-
"Tree-of-Code: A Tree-Structured Exploring Framework for End-to-End Code Generation and Execution in Complex Task Handling" [2024-12] [ACL 2025 Findings] [paper]
-
"Dynamic Scaling of Unit Tests for Code Reward Modeling" [2025-01] [ACL 2025] [paper]
-
"Revisit Self-Debugging with Self-Generated Tests for Code Generation" [2025-01] [ACL 2025] [paper]
-
"Learning to Generate Unit Tests for Automated Debugging" [2025-02] [paper]
-
"Large Language Model Guided Self-Debugging Code Generation" [2025-02] [paper]
-
"On Iterative Evaluation and Enhancement of Code Quality Using GPT-4o" [2025-02] [paper]
-
"Intention is All You Need: Refining Your Code from Your Intention" [2025-02] [paper]
-
"RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation" [2025-02] [paper]
-
"VisPath: Automated Visualization Code Synthesis via Multi-Path Reasoning and Feedback-Driven Optimization" [2025-02] [paper]
-
"S*: Test Time Scaling for Code Generation" [2025-02] [EMNLP 2025 Findings] [paper]
-
"When Benchmarks Talk: Re-Evaluating Code LLMs with Interactive Feedback" [2025-02] [ACL 2025 Findings] [paper]
-
"LLM4EFFI: Leveraging Large Language Models to Enhance Code Efficiency and Correctness" [2025-02] [paper]
-
"Multi-Turn Code Generation Through Single-Step Rewards" [2025-02] [ICML 2025] [paper]
-
"ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments" [2025-02] [ICLR 2025] [paper]
-
"Teaching Your Models to Understand Code via Focal Preference Alignment" [2025-03] [EMNLP 2025] [paper]
-
"debug-gym: A Text-Based Environment for Interactive Debugging" [2025-03] [paper]
-
"CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation" [2025-03] [paper]
-
"CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation" [2025-04] [paper]
-
"Use Property-Based Testing to Bridge LLM Code Generation and Validation" [2025-06] [paper]
-
"CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance" [2025-07] [paper]
-
"SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement" [2025-09] [paper]
-
"Benchmarking Correctness and Security in Multi-Turn Code Generation" [2025-10] [paper]
3.5 Frontend Navigation
-
"MarkupLM: Pre-training of Text and Markup Language for Visually-rich Document Understanding" [2021-10] [ACL 2022] [paper]
-
"WebKE: Knowledge Extraction from Semi-structured Web with Pre-trained Markup Language Model" [2021-10] [CIKM 2021] [paper]
-
"WebGPT: Browser-assisted question-answering with human feedback" [2021-12] [paper]
-
"CM3: A Causal Masked Multimodal Model of the Internet" [2022-01] [paper]
-
"DOM-LM: Learning Generalizable Representations for HTML Documents" [2022-01] [paper]
-
"WebFormer: The Web-page Transformer for Structure Information Extraction" [2022-02] [WWW 2022] [paper]
-
"A Dataset for Interactive Vision-Language Navigation with Unknown Command Feasibility" [2022-02] [ECCV 2022] [paper]
-
"WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents" [2022-07] [NeurIPS 2022] [paper]
-
"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding" [2022-10] [ICML 2023] [paper]
-
"Understanding HTML with Large Language Models" [2022-10] [EMNLP 2023 findings] [paper]
-
"WebUI: A Dataset for Enhancing Visual UI Understanding with Web Semantics" [2023-01] [CHI 2023] [paper]
-
"Mind2Web: Towards a Generalist Agent for the Web" [2023-06] [NeurIPS 2023] [paper]
-
"A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis", [2023-07] [ICLR 2024] [paper]
-
"WebArena: A Realistic Web Environment for Building Autonomous Agents" [2023-07] [paper]
-
"CogAgent: A Visual Language Model for GUI Agents" [2023-12] [paper]
-
"GPT-4V(ision) is a Generalist Web Agent, if Grounded" [2024-01] [paper]
-
"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models" [2024-01] [paper]
-
"WebLINX: Real-World Website Navigation with Multi-Turn Dialogue" [2024-02] [paper]
-
"OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web" [2024-02] [paper]
-
"AutoWebGLM: Bootstrap And Reinforce A Large Language Model-based Web Navigating Agent" [2024-04] [paper]
-
"WILBUR: Adaptive In-Context Learning for Robust and Accurate Web Agents" [2024-04] [paper]
-
"AutoCrawler: A Progressive Understanding Web Agent for Web Crawler Generation" [2024-04] [paper]
-
"GUICourse: From General Vision Language Models to Versatile GUI Agents" [2024-06] [paper]
-
"NaviQAte: Functionality-Guided Web Application Navigation" [2024-09] [paper]
-
"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding" [2024-09] [paper]
-
"Multimodal Auto Validation For Self-Refinement in Web Agents" [2024-10] [paper]
-
"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents" [2024-10] [paper]
-
"Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web Navigation" [2024-10] [paper]
-
"Harnessing Webpage UIs for Text-Rich Visual Understanding" [2024-10] [paper]
-
"AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents" [2024-10] [paper]
-
"Beyond Browsing: API-Based Web Agents" [2024-10] [paper]
-
"Large Language Models Empowered Personalized Web Agents" [2024-10] [paper]
-
"AdvWeb: Controllable Black-box Attacks on VLM-powered Web Agents" [2024-10] [paper]
-
"Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agents" [2024-10] [paper]
-
"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents" [2024-10] [paper]
-
"From Context to Action: Analysis of the Impact of State Representation and Context on the Generalization of Multi-Turn Web Navigation Agents" [2024-10] [paper]
-
"AutoGLM: Autonomous Foundation Agents for GUIs" [2024-10] [paper]
-
"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning" [2024-11] [paper]
-
"The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use" [2024-11] [paper]
-
"ScribeAgent: Towards Specialized Web Agents Using Production-Scale Workflow Data" [2024-11] [paper]
-
"ShowUI: One Vision-Language-Action Model for GUI Visual Agent" [2024-11] [paper]
-
"Large Language Model-Brained GUI Agents: A Survey" [2024-11] [paper]
-
"Free your mouse! Command Large Language Models to Generate Code to Format Word Documents" [2024-11] [EMNLP 2024] [paper]
-
"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction" [2024-12] [paper]
-
"Falcon-UI: Understanding GUI Before Following User Instructions" [2024-12] [paper]
-
"WEPO: Web Element Preference Optimization for LLM-based Web Navigation" [2024-12] [paper]
-
"AutoDroid-V2: Boosting SLM-based GUI Agents via Code Generation" [2024-12] [paper]
-
"Beyond Pass or Fail: A Multi-dimensional Benchmark for Mobile UI Navigation" [2025-01] [paper]
-
"WebWalker: Benchmarking LLMs in Web Traversal" [2025-01] [paper]
-
"GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration" [2025-01] [paper]
-
"UI-TARS: Pioneering Automated GUI Interaction with Native Agents" [2025-01] [paper]
-
"Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks" [2025-03] [paper]
-
"WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks" [2025-06] [paper]
-
"UI-Venus Technical Report: Building High-performance UI Agents with RFT" [2025-08] [paper]
-
"Mano Report" [2025-09] [paper]
-
"UI-Venus-1.5 Technical Report" [2026-02] [paper]
-
"AutoWebWorld: Synthesizing Infinite Verifiable Web Environments via Finite State Machines" [2026-02] [paper]
4. Code LLM for Low-Resource, Low-Level, and Domain-Specific Languages
-
[Ruby] "On the Transferability of Pre-trained Language Models for Low-Resource Programming Languages" [2022-04] [ICPC 2022] [paper]
-
[Verilog] "Benchmarking Large Language Models for Automated Verilog RTL Code Generation" [2022-12] [DATE 2023] [paper]
-
[OCL] "On Codex Prompt Engineering for OCL Generation: An Empirical Study" [2023-03] [MSR 2023] [paper]
-
[Ansible-YAML] "Automated Code generation for Information Technology Tasks in YAML through Large Language Models" [2023-05] [DAC 2023] [paper]
-
[Hansl] "The potential of LLMs for coding with low-resource and domain-specific programming languages" [2023-07] [paper]
-
[Verilog] "VeriGen: A Large Language Model for Verilog Code Generation" [2023-07] [paper]
-
[Verilog] "RTLLM: An Open-Source Benchmark for Design RTL Generation with Large Language Model" [2023-08] [paper]
-
[Racket, OCaml, Lua, R, Julia] "Knowledge Transfer from High-Resource to Low-Resource Programming Languages for Code LLMs" [2023-08] [paper]
-
[Verilog] "VerilogEval: Evaluating Large Language Models for Verilog Code Generation" [2023-09] [ICCAD 2023] [paper]
-
[Verilog] "RTLFixer: Automatically Fixing RTL Syntax Errors with Large Language Models" [2023-11] [paper]
-
[Verilog] "Advanced Large Language Model (LLM)-Driven Verilog Development: Enhancing Power, Performance, and Area Optimization in Code Synthesis" [2023-12] [paper]
-
[Verilog] "RTLCoder: Outperforming GPT-3.5 in Design RTL Generation with Our Open-Source Dataset and Lightweight Solution" [2023-12] [paper]
-
[Verilog] "BetterV: Controlled Verilog Generation with Discriminative Guidance" [2024-02] [ICML 2024] [paper]
-
[R] "Empirical Studies of Parameter Efficient Methods for Large Language Models of Code and Knowledge Transfer to R" [2024-03] [paper]
-
[Haskell] "Investigating the Performance of Language Models for Completing Code in Functional Programming Languages: a Haskell Case Study" [2024-03] [paper]
-
[Verilog] "A Multi-Expert Large Language Model Architecture for Verilog Code Generation" [2024-04] [paper]
-
[Verilog] "CreativEval: Evaluating Creativity of LLM-Based Hardware Code Generation" [2024-04] [paper]
-
[Alloy] "An Empirical Evaluation of Pre-trained Large Language Models for Repairing Declarative Formal Specifications" [2024-04] [paper]
-
[Verilog] "Evaluating LLMs for Hardware Design and Test" [2024-04] [paper]
-
[Kotlin, Swift, and Rust] "Software Vulnerability Prediction in Low-Resource Languages: An Empirical Study of CodeBERT and ChatGPT" [2024-04] [paper]
-
[Verilog] "MEIC: Re-thinking RTL Debug Automation using LLMs" [2024-05] [paper]
-
[Bash] "Tackling Execution-Based Evaluation for NL2Bash" [2024-05] [paper]
-
[Fortran, Julia, Matlab, R, Rust] "Evaluating AI-generated code for C++, Fortran, Go, Java, Julia, Matlab, Python, R, and Rust" [2024-05] [paper]
-
[OpenAPI] "Optimizing Large Language Models for OpenAPI Code Completion" [2024-05] [paper]
-
[Kotlin] "Kotlin ML Pack: Technical Report" [2024-05] [paper]
-
[UCLID5] "Synthetic Programming Elicitation for Text-to-Code in Very Low-Resource Programming and Formal Languages" [2024-06] [NeurIPS 2024] [paper]
-
[Verilog] "VerilogReader: LLM-Aided Hardware Test Generation" [2024-06] [paper]
-
"Benchmarking Generative Models on Computational Thinking Tests in Elementary Visual Programming" [2024-06] [paper]
-
[Logo] "Program Synthesis Benchmark for Visual Programming in XLogoOnline Environment" [2024-06] [ACL 2025] [paper]
-
[Ansible YAML, Bash] "DocCGen: Document-based Controlled Code Generation" [2024-06] [EMNLP 2024] [paper]
-
[Qiskit] "Qiskit HumanEval: An Evaluation Benchmark For Quantum Code Generative Models" [2024-06] [paper]
-
[Perl, Golang, Swift] "DistiLRR: Transferring Code Repair for Low-Resource Programming Languages" [2024-06] [paper]
-
[Verilog] "AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion Generation" [2024-06] [paper]
-
"A Comparative Study of DSL Code Generation: Fine-Tuning vs. Optimized Retrieval Augmentation" [2024-07] [paper]
-
[Json, XLM, YAML] "ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages" [2024-07] [paper]
-
[Verilog] "AutoBench: Automatic Testbench Generation and Evaluation Using LLMs for HDL Design" [2024-07] [paper]
-
[Verilog] "CodeV: Empowering LLMs for Verilog Generation through Multi-Level Summarization" [2024-07] [paper]
-
[Verilog] "ITERTL: An Iterative Framework for Fine-tuning LLMs for RTL Code Generation" [2024-07] [paper]
-
[Verilog] "OriGen:Enhancing RTL Code Generation with Code-to-Code Augmentation and Self-Reflection" [2024-07] [paper]
-
[Verilog] "Large Language Model for Verilog Generation with Golden Code Feedback" [2024-07] [paper]
-
[Verilog] "AutoVCoder: A Systematic Framework for Automated Verilog Code Generation using LLMs" [2024-07] [paper]
-
[RPA] "Plan with Code: Comparing approaches for robust NL to DSL generation" [2024-08] [paper]
-
[Verilog] "VerilogCoder: Autonomous Verilog Coding Agents with Graph-based Planning and Abstract Syntax Tree (AST)-based Waveform Tracing Tool" [2024-08] [paper]
-
[Verilog] "Revisiting VerilogEval: Newer LLMs, In-Context Learning, and Specification-to-RTL Tasks" [2024-08] [paper]
-
[MaxMSP, Web Audio] "Benchmarking LLM Code Generation for Audio Programming with Visual Dataflow Languages" [2024-09] [paper]
-
[Verilog] "RTLRewriter: Methodologies for Large Models aided RTL Code Optimization" [2024-09] [paper]
-
[Verilog] "CraftRTL: High-quality Synthetic Data Generation for Verilog Code Models with Correct-by-Construction Non-Textual Representations and Targeted Code Repair" [2024-09] [ICLR 2025] [paper]
-
[Bash] "ScriptSmith: A Unified LLM Framework for Enhancing IT Operations via Automated Bash Script Generation, Assessment, and Refinement" [2024-09] [paper]
-
[Survey] "Survey on Code Generation for Low resource and Domain Specific Programming Languages" [2024-10] [paper]
-
[R] "Do Current Language Models Support Code Intelligence for R Programming Language?" [2024-10] [paper]
-
[PLC] "Agents4PLC: Automating Closed-loop PLC Code Generation and Verification in Industrial Control Systems using LLM-based Agents" [2024-10] [paper]
-
[Lua] "Evaluating Quantized Large Language Models for Code Generation on Low-Resource Language Benchmarks" [2024-10] [paper]
-
"Improving Parallel Program Performance Through DSL-Driven Code Generation with LLM Optimizers" [2024-10] [paper]
-
[R, D, Racket, Bash]: "Bridge-Coder: Unlocking LLMs' Potential to Overcome Language Gaps in Low-Resource Code" [2024-10] [ACL 2025 Findings] [paper]
-
[SPICE]: "SPICEPilot: Navigating SPICE Code Generation and Simulation with AI Guidance" [2024-10] [paper]
-
[IEC 61131-3 ST]: "Training LLMs for Generating IEC 61131-3 Structured Text with Online Feedback" [2024-10] [paper]
-
[Verilog] "MetRex: A Benchmark for Verilog Code Metric Reasoning Using LLMs" [2024-11] [paper]
-
[Verilog] "CorrectBench: Automatic Testbench Generation with Functional Self-Correction using LLMs for HDL Design" [2024-11] [paper]
-
[MUMPS, ALC] "Leveraging LLMs for Legacy Code Modernization: Challenges and Opportunities for LLM-Generated Documentation" [2024-11] [paper]
-
[Power Query M, OfficeScript, Excel formulas] "RAR: Retrieval-augmented retrieval for code generation in low resource languages" [2024-11] [EMNLP 2024] [paper]
-
[ST] "A Multi-Agent Framework for Extensible Structured Text Generation in PLCs" [2024-12] [paper]
-
[Verilog] "PromptV: Leveraging LLM-powered Multi-Agent Prompting for High-quality Verilog Generation" [2024-12] [paper]
-
[HPC] "HPC-Coder-V2: Studying Code LLMs Across Low-Resource Parallel Languages" [2024-12] [paper]
-
[Verilog] "RTLSquad: Multi-Agent Based Interpretable RTL Design" [2025-01] [paper]
-
[G] "GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback" [2025-01] [paper]
-
[Julia, Lua, R, Racket] "Enhancing Code Generation for Low-Resource Languages: No Silver Bullet" [2025-01] [paper]
-
[F*] "Building A Proof-Oriented Programmer That Is 64% Better Than GPT-4o Under Data Scarsity" [2025-02] [ACL 2025 Findings] [paper]
-
"Exploring Code Language Models for Automated HLS-based Hardware Generation: Benchmark, Infrastructure and Analysis" [2025-02] [ASP-DAC 2025] [paper]
-
[Alloy*] "On the Effectiveness of Large Language Models in Writing Alloy Formulas" [2025-02] [paper]
-
[Solidity] "SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation" [2025-02] [paper]
-
[PennyLane] "PennyLang: Pioneering LLM-Based Quantum Code Generation with a Novel PennyLane-Centric Dataset" [2025-03] [paper]
-
[Verilog] "VeriMind: Agentic LLM for Automated Verilog Generation with a Novel Evaluation Metric" [2025-03] [paper]
-
[Modelica] "ModiGen: A Large Language Model-Based Workflow for Multi-Task Modelica Code Generation" [2025-03] [paper]
-
[Excel] "Synthetic Function Demonstrations Improve Generation in Low-Resource Programming Languages" [2025-03] [paper]
-
"RTLRepoCoder: Repository-Level RTL Code Completion through the Combination of Fine-Tuning and Retrieval Augmentation" [2025-04] [paper]
-
[Verilog] "SymRTLO: Enhancing RTL Code Optimization with LLMs and Neuron-Inspired Symbolic Reasoning" [2025-04] [paper]
-
[Verilog] "ReasoningV: Efficient Verilog Code Generation with Adaptive Hybrid Reasoning Model" [2025-04] [paper]
-
[Verilog] "VeriCoder: Enhancing LLM-Based RTL Code Generation through Functional Correctness Validation" [2025-04] [paper]
-
[Chisel] "ChiseLLM: Unleashing the Power of Reasoning LLMs for Chisel Agile Hardware Development" [2025-04] [paper]
-
[Verilog] "ComplexVCoder: An LLM-Driven Framework for Systematic Generation of Complex Verilog Code" [2025-04] [paper]
-
[Lean] "CLEVER: A Curated Benchmark for Formally Verified Code Generation" [2025-05] [paper]
-
[*