Original title:
Vylepšení asistentů a automatizačích nástrojů založených na umělé inteligenci
Translated title:
Improvements of AI-Based Code Assistants and Automation Tools
Authors:
Budinský, Rastislav ; Olekšák, Samuel (referee) ; Homoliak, Ivan (advisor) Document type: Master’s theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Táto práca predstavuje návrh, implementáciu a vyhodnotenie multiagentového systému na automatizovanú revíziu kódu nasadeného v podnikovom prostredí. Systém rozdeľuje zodpovednosť za revíziu medzi osem špecializovaných agentov, z ktorých každý pracuje v kontexte tematicky súvisiacich pravidiel organizácie. Návrh sa sústreďuje na to, aby or- ganizácia mala plnú kontrolu nad tým, ktoré pravidlá sa uplatňujú, ako sú kategorizované a ako sa vyvíjajú v čase. Middleware vrstva štandardizuje definície pravidiel a integrá- ciu s Azure DevOps, zatiaľ čo služba znalostnej bázy poskytuje štrukturálny a sémantický kontext kódu prostredníctvom grafových dotazov a retrieval-augmented generation. Dedu- plikačný mechanizmus zabezpečuje, že vývojári dostávajú len neredundantnú spätnú väzbu. Hlavným evaluačným kritériom je miera zmien kódu, definovaná ako podiel komentárov, ktoré viedli k úprave cieľového kódu, z celkového počtu komentárov vyprodukovaných systé- mom. Vyhodnotenie na 436 pull requestoch za päť mesiacov ukazuje, že miera zmien kódu systému stúpla z 32 % v novembri 2025 na 50 % v marci 2026 a v priemere dosiahla 41,8 % na 1 104 revíznych vláknach. V poslednom mesiaci sa miera priblížila k hodnote komerčného nástroja CodeRabbit (51,2 % na 295 akčných vláknach), zatiaľ čo ľudskí recenzenti zostali najsilnejším signálom na úrovni 80,1 %. Celkové pokrytie revízie sa strojnásobilo oproti obdobiu pred nasadením, pričom úsilie ľudskej revízie zostalo stabilné, čo potvrdzuje, že AI revízia ľudský úsudok skôr dopĺňa než nahrádza. Vyhodnotenie tiež identifikuje deficit dôvery vývojárov spôsobený predčasným nasadením systému s nedokončenou dedupliká- ciou. Výsledky ukazujú, že vlastný multiagentový systém na revíziu kódu je v podnikovom prostredí životaschopný a môže dosiahnuť kvalitu porovnateľnú s komerčnými nástrojmi, avšak skúsenosť zdôrazňuje, že udržanie vysokej kvality komentárov od prvého nasadenia je nevyhnutné–predčasné nasadenie podkopáva dôveru vývojárov spôsobom, ktorý je ťažké zvrátiť.
This thesis presents the design, implementation, and evaluation of a multi-agent AI code review system deployed in an enterprise environment. The system distributes review re- sponsibilities across eight specialized agents, each operating within a focused context of thematically related organizational rules. The design centers on giving the organization full control over which rules apply, how they are categorized, and how they evolve over time. A middleware layer standardizes rule definitions and Azure DevOps integration, while a knowledge base service provides structural and semantic codebase context through graph queries and retrieval-augmented generation. A deduplication engine ensures that only non-redundant feedback reaches developers. The primary evaluation criterion is the code- change rate, defined as the proportion of review comments that triggered a modification of the targeted code relative to the total number of comments produced. Evaluation over 436 pull requests spanning five months shows that the system’s code change rate climbed from 32% in November 2025 to 50% in March 2026, averaging 41.8% across 1,104 review threads. By the final month the rate approached that of the commercial CodeRabbit tool (51.2% across 295 actionable threads), while human reviewers remained the strongest sig- nal at 80.1%. Total review coverage tripled relative to the pre-deployment baseline while human review effort remained stable, confirming that AI review augmented rather than displaced human judgment. The evaluation also identifies a developer trust deficit caused by premature deployment of a system with incomplete deduplication. The results demon- strate that custom multi-agent AI code review is viable in enterprise settings and can reach quality comparable to commercial tools, though the experience highlights that maintaining high comment quality from the first deployment is essential–premature deployment erodes developer trust in ways that are difficult to reverse.
Keywords:
automatizácia vývoja softvéru; detekcia duplicít; grafová databáza; kontextové inžinierstvo; multiagentový systém; retrieval-augmented generation; revízia kódu; veľký jazykový model; code review; context engineering; duplicate detection; graph database; large language model; multi-agent system; retrieval-augmented generation; software development automation
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/260323