Original title:
Posilované učení agentů s pamětí
Translated title:
Reinforcement Learning of Agents with Memory
Authors:
Kuchta, Samuel ; Španěl, Michal (referee) ; Hradiš, Michal (advisor) Document type: Master’s theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Táto diplomová práca predstavuje účelovo navrhnuté prostredie GridMazeWorld, vytvorené na konfrontáciu agentov posilňovaného učenia s viacerými vzájomne prepojenými pamäťovými nárokmi pri čiastočnej pozorovateľnosti. Prostredie kombinuje procedurálne generované bludiská, nelokálne závislosti medzi tlačidlami a dverami, periodickú dynamiku, obnovujúce sa zdroje a energetický rozpočet, čím si vyžaduje súčasné využívanie priestorovej, sekvenčnej a relačnej pamäte. Popri komplexnom prehľade benchmarkov a mechanizmov zameraných na pamäť implementujem a porovnávam rekurentné architektúry (LSTM) a architektúry založené na pozornosti (Transformer) v rámci kontrolovaného tréningu s riadením kurikula. Moja empirická štúdia skúma vplyv voľby hyperparametrov, škálovania sietí, veľkosti mriežky a návrhu kurikula na schopnosť agentov vytvárať a využívať internú pamäť, pričom ponúka systematickú analýzu pamäte v posilňovanom učení pri čiastočnej pozorovateľnosti.
This thesis contributes a purpose-built environment, GridMazeWorld, designed to confront reinforcement learning agents with multiple, interdependent memory demands under partial observability. The environment combines procedurally generated mazes, nonlocal button–door dependencies, periodic dynamics, regrowing resources, and an energy budget, requiring simultaneous spatial, sequential, and relational memory. Alongside a comprehensive survey of memoryfocused benchmarks and mechanisms, we implement and compare recurrent (LSTM), and attentionbased (Transformer) architectures under controlled training with curriculum management. Our empirical study examines the influence of hyperparameter choices, network scaling, grid size, and curriculum design on the agents’ ability to form and exploit internal memory, offering a systematic analysis of memory in reinforcement learning under partial observability.
Keywords:
GridMazeWorld; paměť; posilované učení; rekurentní neuronové sítě.; částečná pozorovatelnost; GridMazeWorld; memory; partial observability; recurrent neural networks.; reinforcement learning
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/260438