LLM-асистоване виправлення коду в автоматизованих пайплайнах валідації з підвищенням успішності проходження прихованих тестів
DOI:
https://doi.org/10.31861/sisiot2026.1.01005Ключові слова:
великі мовні моделі, автоматизоване виправлення програм, приховані тести, пайплайн валідації програм, налагодження з підтримкою ШІАнотація
Останні досягнення у галузі великих мовних моделей (LLM) відкрили нові можливості для генерації програмного коду, налагодження та автоматизованого виправлення помилок. Проте їх надійне використання в пайплайнах програмної валідації залишається обмеженим ризиком прийняття правдоподібних, але некоректних виправлень, особливо в умовах, коли остаточна правильність визначається не лише видимими тестами, а й прихованими наборами перевірки. У цій роботі досліджується LLM-асистований механізм виправлення коду, інтегрований у пайплайн валідації з керованими етапами перевірки. Запропонована архітектура відокремлює ймовірнісну генерацію коду від детермінованого контролю, що є критичним для програмних систем інфокомунікацій та IoT. На відміну від підходів, у яких LLM розглядається як неконтрольований генератор коду, запропонована схема вводить етап виправлення у структурований робочий процес із послідовними перевірками (гейтами імпорту, публічних тестів, статичного аналізу якості та безпеки коду) та фінальним оцінюванням за прихованими тестами. Експериментальне дослідження виконано на наборі з 50 задач програмування у двох парних конфігураціях: базовому пайплайні без автоматичного виправлення та конфігурації LLM+gating, у якій кандидатне виправлення застосовується перед валідацією. Отримані результати показали суттєве підвищення підсумкової коректності: у базовій конфігурації приховані тести успішно пройдено лише для 5 із 50 задач (10% з 95% СІ [0.04; 0.22]), тоді як конфігурація LLM+gating забезпечила успішне проходження прихованих тестів для всіх 50 задач (100% з 95% СІ [0.93; 1.00]). Парний статистичний аналіз за точним тестом Мак-Немара підтвердив високу значущість виявленого ефекту (p=5.68×10-14), а аналіз часу виконання показав відсутність суттєвого обчислювального накладного навантаження порівняно з базовим пайплайном (середній час на задачу для LLM+gating склав 2.935 с, тоді як для Baseline – 3.001 с). Отримані результати свідчать, що LLM-асистоване виправлення коду може бути ефективним компонентом автоматизованих систем програмної валідації за умови його використання в межах явного repair-and-gating workflow. Дослідження супроводжується відтворюваним експериментальним протоколом та відкритим пакетом дослідницьких матеріалів, що забезпечує можливість незалежної перевірки отриманих результатів.
Завантажити
Посилання
J. Jiang, F. Wang, J. Shen, S. Kim, and S. Kim, “A Survey on Large Language Models for Code Generation,” ACM Transactions on Software Engineering and Methodology, 2024, doi: 10.1145/3747588.
N. Huynh and B. Lin, “Large Language Models for Code Generation: A Comprehensive Survey of Challenges, Techniques, Evaluation, and Applications,” arXiv, 2025, doi: 10.48550/arXiv.2503.01245.
Z. Rasheed, M. Waseem, K.-K. Kemell, A. Ahmad, M. A. Sami, J. Rasku, K. Systä, and P. Abrahamsson, “Large Language Models for Code Generation: The Practitioners Perspective,” arXiv, 2025, doi: 10.48550/arXiv.2501.16998.
N. Jain, K. Han, A. Gu, W.-D. Li, F. Yan, T. Zhang, S. Wang, A. Solar-Lezama, K. Sen, and I. Stoica, “LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code,” arXiv, 2024, doi: 10.48550/arXiv.2403.07974.
L. Yang, R. Jin, L. Shi, J. Peng, Y. Chen, and D. Xiong, “ProBench: Benchmarking Large Language Models in Competitive Programming,” arXiv, 2025, doi: 10.48550/arXiv.2502.20868.
F. Cassano, J. Gouwar, D. Nguyen, S. Nguyen, L. Phipps-Costin, D. Pinckney, M.-H. Yee, Y. Zi, C. J. Anderson, M. Q. Feldman, A. Guha, M. Greenberg, and A. Jangda, “MultiPL-E: A Scalable and Polyglot Approach to Benchmarking Neural Code Generation,” IEEE Transactions on Software Engineering, vol. 49, pp. 3675–3691, 2023, doi: 10.1109/TSE.2023.3267446.
D. G. Paul, H. Zhu, and I. Bayley, “Benchmarks and Metrics for Evaluations of Code Generation: A Critical Review,” in Proc. 2024 IEEE Int. Conf. on Artificial Intelligence Testing (AITest), 2024, pp. 87–94, doi: 10.1109/AITest62860.2024.00019.
J. Liu, S. Xie, J. Wang, Y. Wei, Y. Ding, and L. Zhang, “Evaluating Language Models for Efficient Code Generation,” arXiv, 2024, doi: 10.48550/arXiv.2408.06450.
J. Zheng, B. Cao, Z. Ma, R. Pan, H. Lin, Y. Lu, X. Han, and L. Sun, “Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models,” arXiv, 2024, doi: 10.48550/arXiv.2407.11470.
S. B. Hossain, N. Jiang, Q. Zhou, X. Li, W.-H. Chiang, Y. Lyu, H. Nguyen, and O. Tripp, “A Deep Dive into Large Language Models for Automated Bug Localization and Repair,” Proceedings of the ACM on Software Engineering, vol. 1, pp. 1471–1493, 2024, doi: 10.1145/3660773.
N. Jiang, K. Liu, T. Lutellier, and L. Tan, “Impact of Code Language Models on Automated Program Repair,” in Proc. 2023 IEEE/ACM 45th Int. Conf. on Software Engineering (ICSE), 2023, pp. 1430–1442, doi: 10.1109/ICSE48619.2023.00125.
C. Xia and L. Zhang, “Automated Program Repair in the Era of Large Pre-trained Language Models,” in Proc. 2023 IEEE/ACM 45th Int. Conf. on Software Engineering (ICSE), 2023, pp. 1482–1494, doi: 10.1109/ICSE48619.2023.00129.
K. Huang, Z. Xu, S. Yang, H. Sun, X. Li, Z. Yan, and Y. Zhang, “A Survey on Automated Program Repair Techniques,” arXiv, 2023, doi: 10.48550/arXiv.2303.18184.
J. Renzullo, P. Reiter, W. Weimer, and S. Forrest, “Automated Program Repair: Emerging Trends Pose and Expose Problems for Benchmarks,” ACM Computing Surveys, vol. 57, 2024, doi: 10.1145/3704997.
M. Monperrus, “Automatic Software Repair,” ACM Computing Surveys, vol. 51, 2018, doi: 10.1145/3105906.
Q. Zhang, C. Fang, Y. Xie, Y. Ma, W. Sun, Y. Yang, and Z. Chen, “A Systematic Literature Review on Large Language Models for Automated Program Repair,” arXiv, 2024, doi: 10.48550/arXiv.2405.01466.
K. H. Levin, N. van Kempen, E. D. Berger, and S. N. Freund, “ChatDBG: Augmenting Debugging with Large Language Models,” Proceedings of the ACM on Software Engineering, 2025, doi: 10.1145/3729355.
Z. Englhardt, R. Li, D. Nissanka, Z. Zhang, G. Narayanswamy, J. Breda, X. Liu, S. N. Patel, and V. Iyer, “Exploring and Characterizing Large Language Models for Embedded System Development and Debugging,” in Extended Abstracts of the CHI Conference on Human Factors in Computing Systems, 2023, doi: 10.1145/3613905.3650764.
Опубліковано
Номер
Розділ
Ліцензія
Авторське право (c) 2026 Безпека інфокомунікаційних систем та Інтернету речей

Ця робота ліцензується відповідно до ліцензії Creative Commons Attribution 4.0 International License.









