Original title:
Velké jazykové modely pro řešení matematických úloh
Translated title:
Large language models for solving mathematical problems
Authors:
Kachan, Rostyslav ; Šilling, Petr (referee) ; Kostelník, Martin (advisor) Document type: Bachelor's theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Tato práce se zabývá parametricky efektivním doladěním s cílem zlepšit matematické uvažování ve velkých jazykových modelech. Tři open-source modely s 7 miliardami parametrů — Llama-2-7b-hf, Llama-2-7b-chat-hf a Mistral-7B-Instruct-v0.1 — byly doladěny na datové sadě GSM8K pomocí Low-Rank Adaptation (LoRA), se systematickým prohledáváním rychlosti učení, LoRA ranku, alfy a efektivní velikosti dávky. Výkon byl hodnocen pomocí přesné shody a procesního modelu odměny Qwen2.5-Math-PRM-7B pro posouzení kvality dílčích kroků uvažování. Doladění přineslo podstatné zvýšení přesnosti: Llama-2-7b-hf se zlepšil z 10,77% na 33,36%, Llama-2-7b-chat-hf z 25,47% na 39,88% a Mistral-7B-Instruct-v0.1 z 42,23% na 57,01%. Výsledky ukazují, že LoRA s pečlivě vybranými hyperparametry účinně zlepšuje matematické uvažování, zatímco hodnocení PRM poskytuje další informace o kvalitě uvažování nad rámec pouhé přesnosti.
This thesis investigates parameter-efficient fine-tuning for improving mathematical reasoning in large language models. Three open-source 7-billion-parameter models — Llama-2-7b-hf, Llama-2-7b-chat-hf, and Mistral-7B-Instruct-v0.1 — were fine-tuned on the GSM8K dataset using Low-Rank Adaptation (LoRA), with a systematic search over learning rate, LoRA rank, alpha, and effective batch size. Performance was evaluated using exact-match accuracy and the Qwen2.5-Math-PRM-7B process reward model for assessing intermediate reasoning quality. Fine-tuning yielded substantial accuracy gains: Llama-2-7b-hf improved from 10.77% to 33.36%, Llama-2-7b-chat-hf from 25.47% to 39.88%, and Mistral-7B-Instruct-v0.1 from 42.23% to 57.01%. The results demonstrate that LoRA fine-tuning with carefully selected hyperparameters effectively enhances mathematical reasoning, while PRM evaluation provides additional insights into reasoning quality beyond accuracy alone.
Keywords:
datová sada GSM8K; LLM; LoRA; Low-Rank Adaptation; matematické uvažování; parametricky efektivní doladění; PEFT; PRM; procesní model odměny; prohledávání hyperparametrů.; Velké jazykové modely; GSM8K dataset; hyperparameter search.; Large language models; LLM; LoRA; Low-Rank Adaptation; mathematical reasoning; parameter-efficient fine-tuning; PEFT; PRM; process reward model
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/258872