Original title:
Doplnění chybějící části 3D modelu s využitím hlubokého učení
Translated title:
3D Shape Completion using Deep Learning
Authors:
Rajsigl, Tomáš ; Pukanec, Dávid (referee) ; Španěl, Michal (advisor) Document type: Master’s theses
Year:
2026
Language:
eng Publisher:
Vysoké učení technické v Brně. Fakulta informačních technologií Abstract:
[eng][cze]
Naskenované 3D modely v realitě často obsahují chyby a neúplnou geometrii, což vyžaduje doplňování jejich chybějících částí. Tato práce se zabývá využitím hlubokého učení k rekonstrukci takto neúplných vstupních dat. Zpracování 3D dat je však všeobecně paměťově náročné, což silně limituje dosažitelné rozlišení. Navrhovaná metoda tento problém řeší novým přístupem pomocí difuzní architektury založené na řídké reprezentaci TSDF. Síť je trénována pomocí self-supervised učení na základě dynamické simulace okluzí nad kompletními 3D modely. V porovnání s referenční metodou DiffComplete dosahuje srovnatelných výsledků napříč metrikami IoU, Chamfer Distance a F-Score, přičemž v závislosti na zvolené konfiguraci redukuje počet aktivních voxelů o 36 až 54 %. Tato efektivita ve výsledku umožňuje zdvojnásobit rozlišení na 64^3 a zachytit tak jemnější geometrické detaily při zachování stejných hardwarových nároků.
Real-world 3D scans often suffer from missing geometry, necessitating automated shape completion. This work investigates the application of deep learning methods for reconstructing such partial inputs. However, processing 3D data is generally memory-intensive, which imposes a severe bottleneck on the achievable resolution. To address this, the proposed method introduces a novel approach operating on a sparse TSDF representation within a diffusion-based framework. The model is trained entirely in a self-supervised manner by dynamically simulating occlusions on complete 3D shapes. The approach is validated against a dense state-of-the-art baseline, DiffComplete. All of the proposed sparse variants match the baseline across IoU, Chamfer Distance, and F-Score metrics, while reducing the active voxel count by 36 to 54% depending on the chosen configuration. Ultimately, this efficiency enables doubling the spatial resolution to 64^3, capturing finer details under the same hardware budget.
Keywords:
3D počítačové vidění; ControlNet; DiffComplete; difuzní modely; doplňování 3D modelů; EDM; efektivní volumetrické reprezentace; generativní hluboké učení; Signed Distance Function; sparse konvoluce; 3D computer vision; 3D shape completion; ControlNet; DiffComplete; diffusion models; EDM; generative deep learning; Signed Distance Function; sparse convolutions; sparse volumetric representations
Institution: Brno University of Technology
(web)
Document availability information: Fulltext is available in the Brno University of Technology Digital Library. Original record: http://hdl.handle.net/11012/260314