LLM-асистоване виправлення коду в автоматизованих пайплайнах валідації з підвищенням успішності проходження прихованих тестів

Автор(и)

DOI:

https://doi.org/10.31861/sisiot2026.1.01005

Ключові слова:

великі мовні моделі, автоматизоване виправлення програм, приховані тести, пайплайн валідації програм, налагодження з підтримкою ШІ

Анотація

Останні досягнення у галузі великих мовних моделей (LLM) відкрили нові можливості для генерації програмного коду, налагодження та автоматизованого виправлення помилок. Проте їх надійне використання в пайплайнах програмної валідації залишається обмеженим ризиком прийняття правдоподібних, але некоректних виправлень, особливо в умовах, коли остаточна правильність визначається не лише видимими тестами, а й прихованими наборами перевірки. У цій роботі досліджується LLM-асистований механізм виправлення коду, інтегрований у пайплайн валідації з керованими етапами перевірки. Запропонована архітектура відокремлює ймовірнісну генерацію коду від детермінованого контролю, що є критичним для програмних систем інфокомунікацій та IoT. На відміну від підходів, у яких LLM розглядається як неконтрольований генератор коду, запропонована схема вводить етап виправлення у структурований робочий процес із послідовними перевірками (гейтами імпорту, публічних тестів, статичного аналізу якості та безпеки коду) та фінальним оцінюванням за прихованими тестами. Експериментальне дослідження виконано на наборі з 50 задач програмування у двох парних конфігураціях: базовому пайплайні без автоматичного виправлення та конфігурації LLM+gating, у якій кандидатне виправлення застосовується перед валідацією. Отримані результати показали суттєве підвищення підсумкової коректності: у базовій конфігурації приховані тести успішно пройдено лише для 5 із 50 задач (10% з 95% СІ [0.04; 0.22]), тоді як конфігурація LLM+gating забезпечила успішне проходження прихованих тестів для всіх 50 задач (100% з 95% СІ [0.93; 1.00]). Парний статистичний аналіз за точним тестом Мак-Немара підтвердив високу значущість виявленого ефекту (p=5.68×10-14), а аналіз часу виконання показав відсутність суттєвого обчислювального накладного навантаження порівняно з базовим пайплайном (середній час на задачу для LLM+gating склав 2.935 с, тоді як для Baseline – 3.001 с). Отримані результати свідчать, що LLM-асистоване виправлення коду може бути ефективним компонентом автоматизованих систем програмної валідації за умови його використання в межах явного repair-and-gating workflow. Дослідження супроводжується відтворюваним експериментальним протоколом та відкритим пакетом дослідницьких матеріалів, що забезпечує можливість незалежної перевірки отриманих результатів.

Завантажити

Дані для завантаження поки недоступні.

Біографії авторів

  • Роман Заяц, Чернівецький національний університет імені Юрія Федьковича

    Роман Заяць є аспірантом останнього року навчання кафедри радіотехніки та інформаційної безпеки Чернівецького національного університету імені Юрія Федьковича, Україна. Його наукові інтереси зосереджені на застосуванні штучного інтелекту для оброблення даних.

  • Мирослав Стринадко, Чернівецький національний університет імені Юрія Федьковича

    Мирослав Стринадько є старшим науковим співробітником та доцентом кафедри кореляційної оптики Чернівецького національного університету імені Юрія Федьковича, м. Чернівці, Україна. Його наукові інтереси охоплюють системи ймовірнісних обчислень, квантову інтерферометрію, фотонні схеми, волоконно-оптичні системи, методи кодування сигналів, а також прикладні дослідження у сферах промислової автоматизації, фотоніки та робототехніки, систем кодування даних і мікропроцесорних технологій.

  • Галина Ластівка, Чернівецький національний університет імені Юрія Федьковича

    Здобула ступені бакалавра та магістра за спеціальністю «Радіотехніка» у Чернівецькому національному університеті імені Юрія Федьковича, Україна. Здобула ступінь кандидата фізико-математичних наук за спеціальністю «Фізика напівпровідників» у Чернівецькому національному університеті імені Юрія Федьковича. Наразі є доцентом кафедри радіотехніки Чернівецького національного університету імені Юрія Федьковича. Її наукові інтереси охоплюють кібербезпеку, радіоспектроскопію та матеріалознавство. Основна наукова діяльність зосереджена на проєктуванні та розробленні комплексних систем технічного захисту інформації, а також розробленні портативного цифрового багатoімпульсного спектрометра ядерного квадрупольного резонансу для аналізу структури та сенсорних властивостей напівпровідників.

Посилання

J. Jiang, F. Wang, J. Shen, S. Kim, and S. Kim, “A Survey on Large Language Models for Code Generation,” ACM Transactions on Software Engineering and Methodology, 2024, doi: 10.1145/3747588.

N. Huynh and B. Lin, “Large Language Models for Code Generation: A Comprehensive Survey of Challenges, Techniques, Evaluation, and Applications,” arXiv, 2025, doi: 10.48550/arXiv.2503.01245.

Z. Rasheed, M. Waseem, K.-K. Kemell, A. Ahmad, M. A. Sami, J. Rasku, K. Systä, and P. Abrahamsson, “Large Language Models for Code Generation: The Practitioners Perspective,” arXiv, 2025, doi: 10.48550/arXiv.2501.16998.

N. Jain, K. Han, A. Gu, W.-D. Li, F. Yan, T. Zhang, S. Wang, A. Solar-Lezama, K. Sen, and I. Stoica, “LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code,” arXiv, 2024, doi: 10.48550/arXiv.2403.07974.

L. Yang, R. Jin, L. Shi, J. Peng, Y. Chen, and D. Xiong, “ProBench: Benchmarking Large Language Models in Competitive Programming,” arXiv, 2025, doi: 10.48550/arXiv.2502.20868.

F. Cassano, J. Gouwar, D. Nguyen, S. Nguyen, L. Phipps-Costin, D. Pinckney, M.-H. Yee, Y. Zi, C. J. Anderson, M. Q. Feldman, A. Guha, M. Greenberg, and A. Jangda, “MultiPL-E: A Scalable and Polyglot Approach to Benchmarking Neural Code Generation,” IEEE Transactions on Software Engineering, vol. 49, pp. 3675–3691, 2023, doi: 10.1109/TSE.2023.3267446.

D. G. Paul, H. Zhu, and I. Bayley, “Benchmarks and Metrics for Evaluations of Code Generation: A Critical Review,” in Proc. 2024 IEEE Int. Conf. on Artificial Intelligence Testing (AITest), 2024, pp. 87–94, doi: 10.1109/AITest62860.2024.00019.

J. Liu, S. Xie, J. Wang, Y. Wei, Y. Ding, and L. Zhang, “Evaluating Language Models for Efficient Code Generation,” arXiv, 2024, doi: 10.48550/arXiv.2408.06450.

J. Zheng, B. Cao, Z. Ma, R. Pan, H. Lin, Y. Lu, X. Han, and L. Sun, “Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models,” arXiv, 2024, doi: 10.48550/arXiv.2407.11470.

S. B. Hossain, N. Jiang, Q. Zhou, X. Li, W.-H. Chiang, Y. Lyu, H. Nguyen, and O. Tripp, “A Deep Dive into Large Language Models for Automated Bug Localization and Repair,” Proceedings of the ACM on Software Engineering, vol. 1, pp. 1471–1493, 2024, doi: 10.1145/3660773.

N. Jiang, K. Liu, T. Lutellier, and L. Tan, “Impact of Code Language Models on Automated Program Repair,” in Proc. 2023 IEEE/ACM 45th Int. Conf. on Software Engineering (ICSE), 2023, pp. 1430–1442, doi: 10.1109/ICSE48619.2023.00125.

C. Xia and L. Zhang, “Automated Program Repair in the Era of Large Pre-trained Language Models,” in Proc. 2023 IEEE/ACM 45th Int. Conf. on Software Engineering (ICSE), 2023, pp. 1482–1494, doi: 10.1109/ICSE48619.2023.00129.

K. Huang, Z. Xu, S. Yang, H. Sun, X. Li, Z. Yan, and Y. Zhang, “A Survey on Automated Program Repair Techniques,” arXiv, 2023, doi: 10.48550/arXiv.2303.18184.

J. Renzullo, P. Reiter, W. Weimer, and S. Forrest, “Automated Program Repair: Emerging Trends Pose and Expose Problems for Benchmarks,” ACM Computing Surveys, vol. 57, 2024, doi: 10.1145/3704997.

M. Monperrus, “Automatic Software Repair,” ACM Computing Surveys, vol. 51, 2018, doi: 10.1145/3105906.

Q. Zhang, C. Fang, Y. Xie, Y. Ma, W. Sun, Y. Yang, and Z. Chen, “A Systematic Literature Review on Large Language Models for Automated Program Repair,” arXiv, 2024, doi: 10.48550/arXiv.2405.01466.

K. H. Levin, N. van Kempen, E. D. Berger, and S. N. Freund, “ChatDBG: Augmenting Debugging with Large Language Models,” Proceedings of the ACM on Software Engineering, 2025, doi: 10.1145/3729355.

Z. Englhardt, R. Li, D. Nissanka, Z. Zhang, G. Narayanswamy, J. Breda, X. Liu, S. N. Patel, and V. Iyer, “Exploring and Characterizing Large Language Models for Embedded System Development and Debugging,” in Extended Abstracts of the CHI Conference on Human Factors in Computing Systems, 2023, doi: 10.1145/3613905.3650764.

Завантаження


Переглядів анотації: 0

Опубліковано

2026-06-30

Номер

Розділ

Статті

Як цитувати

[1]
Р. Заяц, М. Стринадко, and Г. Ластівка, “LLM-асистоване виправлення коду в автоматизованих пайплайнах валідації з підвищенням успішності проходження прихованих тестів”, SISIOT, vol. 4, no. 1, p. 01005, Jun. 2026, doi: 10.31861/sisiot2026.1.01005.

Схожі статті

1-10 з 61

Ви також можете розпочати розширений пошук схожих статей для цієї статті.

Статті цього автора (цих авторів), які найбільше читають