Paper Search
Found 6 papers
-
Mutation-Guided Unit Test Generation with a Large Language Model
Qinghua Xu, Lionel Briand, Kui Liu, Guancheng Wang
June 03, 2025
cs.SE arXiv: 2506.02954Unit tests play a vital role in uncovering potential faults in software. While tools like EvoSuite focus on maximizing code coverage
unit test generation mutation testing large language models mutation score fault detection capability mutgen mutation feedback iterative generation code coverage prompt engineering evosuite pitest humaneval-java leetcode-java mutation operators code summarization test fixing assertion failures compilation errors software quality search-based software testing live mutants uncovered mutants llama-3.3 automated test generationcs.SE -
BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models
Yuanhao Li, Hongbo Wang, Xiaotang Shang, Xunzhu Tang, Yiming Cao, Xuhong Chen
May 09, 2026
cs.AI arXiv: 2605.09134Reinforcement learning for program repair is hindered by sparse execution feedback and coarse sequence-level rewards that obscure which edits actually fix bugs. We present
automated program repair reinforcement learning large language models proximal policy optimization dual reward models credit assignment execution-grounded learning supervised fine-tuning reasoning traces line-level credit allocator sequence-level assessor swe-bench verified defects4j humaneval-java quixbugs swe-gym code generation software engineering unified diff cross-language generalization reward shaping stack-trace supervision qwen2.5-coder error localization debuggingcs.AI cs.SE -
Smaller Models, Unexpected Costs: Trade-offs in LLM Quantization for Automated Program Repair
Fernando Vallecillos-Ruiz, Giordano d'Aloisio, Max Hort, Luca Traini, Antinisca Di Marco, Leon Moonen
June 25, 2026
cs.SE arXiv: 2606.27205Language Models (LLMs) are powerful toolsand have been increasingly adopted for complex software engineering tasks. As the number of parameters
automated program repair llm quantization large language models post-training quantization memory footprint energy consumption inference time software engineering humaneval-java defects4j jaccard consistency rate pareto dominance weight quantization kv cache quantization aqlm awq bitsandbytes hqq quanto llama-3 deepseek-coder mistral plausibility solved-set consistency empirical studycs.SE -
PAFT: Preservation Aware Fine-Tuning for Minimal-Edit Program Repair
Boyang Yang, Zijian Cai, Shunfu Jin, Haoye Tian
April 06, 2026
cs.SE arXiv: 2604.03113Large language models (LLMs) are effective for automated program repair, but plausible patches that pass the full test suite often rewrite more code than necessary
automated program repair large language models fine-tuning minimal-edit repair software maintenance preservation-aware fine-tuning qlora defects4j humaneval-java token-level alignment average edit distance code consistency rate supervised fine-tuning edit-difficulty curriculum full-sequence masking deepseek-coder qwen3 opencoder software engineering bug fixing patch minimality token weighting ratcliff-obershelp code llms plausible patchescs.SE -
DebugRepair: Enhancing LLM-Based Automated Program Repair via Self-Directed Debugging
Pengyu Xue, Kunwu Zheng, Zhen Yang, Yifei Pei, Linhao Wu, Xiran Lyu, Yizhou Chen, Jia Li, Kainan Li, Hao Tan, Dan Hao, Zhonghang Lu
April 21, 2026
cs.SE arXiv: 2604.19305Automated Program Repair (APR) has benefited from the code understanding and generation capabilities of Large Language Models
automated program repair large language models self-directed debugging test semantic purification simulated instrumentation debugging-driven conversational repair runtime traces feedback-based repair fault localization patch generation iterative refinement stack traces root cause analysis java python defects4j quixbugs humaneval-java gpt-3.5 deepseek-v3 ablation study state-of-the-art program slicing rule-based fallback patch augmentationcs.SE -
Large Language Models for Fault Localization: An Empirical Study
Hongwei Li, Boyang Yang, Yingjian Xiao, Weiwei Gong, Jianjun Huang, Rongqun Hu, Anquan Jie
July 29, 2026
cs.SE arXiv: 2510.20521Large Language Models (LLMs) have demonstrated strong performance on code-related tasks, particularly in automated program repair
large language models fault localization empirical study statement-level prompt engineering zero-shot few-shot chain-of-thought gpt-4.1 mini qwen2.5-coder-32b-instruct gemini-2.5-flash deepseek-v3 humaneval-java defects4j java software engineering automated debugging response time static analysis pmd linedef exact match partial match consistency rate api costcs.SE