Original title:
Interaktivní segmentace obrazu s použitím hlubokého učení a předtrénovaných základních modelů
Translated title:
Interactive Image Segmentation using Deep Learning and Foundation Models
Authors:
Charamza, Jiří ; Vaško, Marek (referee) ; Španěl, Michal (advisor) Document type: Bachelor's theses
Year:
2026
Language:
cze Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[cze][eng]
Anotace dat pro segmentaci obrazu je časově náročná úloha, zejména u video sekvencí, které se skládají z velkého množství snímků. Tato práce představuje systém pro poloautomatickou anotaci video sekvencí postavený na open-source anotační platformě Label Studio, který využívá předtrénované modely hlubokého učení pro interaktivní segmentaci a propagaci masek mezi snímky. Anotátor v systému označí objekt keypointem nebo bounding boxem, SAM2 vygeneruje masku objektu a ta je do dalších snímků v sekvenci propagována jako upravitelná anotace. V rámci práce byly implementovány čtyři propagační metody využívající logity modelu SAM2, optický tok z modelu RAFT, video segmentační model Cutie a video prediktor SAM2. Systém podporuje sekvenční i hromadnou propagaci přes zvolený počet následujících snímků a rozšiřuje uživatelské rozhraní Label Studia o vlastní ovládací prvky. Vyhodnocení na šestnácti laparoskopických sekvencích z datové sady CholecInstanceSeg ukázalo, že video prediktor SAM2 a Cutie dosahují průměrného mIoU přibližně 0,9 a zůstávají stabilní napříč různými hustotami vzorkování, zatímco propagace pomocí logitů a optického toku jsou pro delší sekvence nevhodné.
Annotating data for image segmentation is a time-consuming task, especially for long video sequences composed of a large number of frames. This thesis presents a semi-automatic annotation system built on the open-source Label Studio platform that uses pre-trained deep learning models for interactive image segmentation and mask propagation between frames. The annotator marks an object with a keypoint or bounding box, SAM2 generates a mask for the object, and this mask is propagated to subsequent frames as an editable annotation. Four propagation methods were implemented: propagation using SAM2 logits, optical flow with the RAFT model, the Cutie video segmentation model, and the SAM2 video predictor. The system supports sequential and batch propagation over a specified number of frames and extends the Label Studio UI with custom control elements. Evaluation on sixteen laparoscopic sequences from the CholecInstanceSeg dataset showed that the SAM2 video predictor and Cutie achieve an average mIoU of around 0.9 and remain stable across different sampling densities, while optical flow and logit-based propagation are not suitable for longer sequences.
Keywords:
annotation tools; CholecInstanceSeg; Cutie; image segmentation; interactive segmentation; Label Studio; mask propagation; optical flow; RAFT; SAM2; Segment Anything Model 2; video object segmentation; anotační nástroje; CholecInstanceSeg; Cutie; interaktivní segmentace; Label Studio; optický tok; propagace masek; RAFT; SAM2; Segment Anything Model 2; segmentace obrazu; video objektová segmentace
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/258812