Deep learning-based computer vision systems for markerless human pose estimation represent a non-invasive alternative to traditional marker-based motion capture systems, enabling movement analysis outside the laboratory. This work proposes a critical review of these methods, with a particular focus on two application domains: motor ergonomics, where pose estimation allows for the automation of risk assessment checklists such as RULA and REBA, and functional rehabilitation, where it enables gait analysis, joint Range of Motion assessment, and tele-rehabilitation. The main technical tasks (2D and 3D Human Pose Estimation and Human Action Recognition), reference architectures, including Graph Convolutional Networks for action recognition, and available open-source frameworks are discussed, with an in-depth look at MediaPipe Pose, chosen for its real-time accuracy on non-dedicated hardware. Furthermore, the thesis includes an original case study: the analysis of a real video of my sports injury to the anterior cruciate ligament, conducted using MediaPipe to extract the knee flexion angle trend. The results show a collapse from 7° to 93° of flexion in 360 milliseconds, consistent with the injury mechanisms described in the literature. The case study simultaneously highlights the application potential of these tools and their current limitations (occlusions, multi-person scenes, movements outside the camera plane), which currently hinder their full readiness for clinical use.

I sistemi di computer vision basati su deep learning per la stima markerless della posa umana rappresentano un'alternativa non invasiva ai tradizionali sistemi di motion capture marker-based, permettendo l'analisi del movimento al di fuori del laboratorio. Il presente lavoro propone una revisione critica di questi metodi, con particolare attenzione a due domini applicativi: l'ergonomia motoria, dove la pose estimation consente l'automazione di checklist di valutazione del rischio come RULA e REBA, e la riabilitazione funzionale, dove abilita la gait analysis, la valutazione del Range of Motion articolare e la tele-riabilitazione. Sono discussi i principali task tecnici (2D e 3D Human Pose Estimation e Human Action Recognition) le architetture di riferimento, tra cui le Graph Convolutional Networks per il riconoscimento dell'azione, e i framework open-source disponibili, con un approfondimento su MediaPipe Pose, scelto per l'accuratezza in tempo reale su hardware non dedicato. La tesi include inoltre un caso studio originale: l'analisi di un video reale del mio infortunio sportivo al legamento crociato anteriore, condotta tramite MediaPipe per estrarre l'andamento dell'angolo di flessione del ginocchio. I risultati mostrano un collasso da 7° a 93° di flessione in 360 millisecondi, coerente con i meccanismi lesivi descritti in letteratura. Il caso studio evidenzia al contempo le potenzialità applicative di questi strumenti e i loro limiti attuali (occlusioni, scene multi-persona, movimenti fuori dal piano della camera) che ne condizionano la piena maturità per un utilizzo clinico.

Sistemi di Computer Vision basati su Deep Learning per l’analisi dell’ergonomia motoria e il monitoraggio della riabilitazione funzionale

VERZA, GIANLUCA
2025/2026

Abstract

Deep learning-based computer vision systems for markerless human pose estimation represent a non-invasive alternative to traditional marker-based motion capture systems, enabling movement analysis outside the laboratory. This work proposes a critical review of these methods, with a particular focus on two application domains: motor ergonomics, where pose estimation allows for the automation of risk assessment checklists such as RULA and REBA, and functional rehabilitation, where it enables gait analysis, joint Range of Motion assessment, and tele-rehabilitation. The main technical tasks (2D and 3D Human Pose Estimation and Human Action Recognition), reference architectures, including Graph Convolutional Networks for action recognition, and available open-source frameworks are discussed, with an in-depth look at MediaPipe Pose, chosen for its real-time accuracy on non-dedicated hardware. Furthermore, the thesis includes an original case study: the analysis of a real video of my sports injury to the anterior cruciate ligament, conducted using MediaPipe to extract the knee flexion angle trend. The results show a collapse from 7° to 93° of flexion in 360 milliseconds, consistent with the injury mechanisms described in the literature. The case study simultaneously highlights the application potential of these tools and their current limitations (occlusions, multi-person scenes, movements outside the camera plane), which currently hinder their full readiness for clinical use.
2025
Deep Learning-Based Computer Vision Systems for Motor Ergonomics Analysis and Functional Rehabilitation Monitoring
I sistemi di computer vision basati su deep learning per la stima markerless della posa umana rappresentano un'alternativa non invasiva ai tradizionali sistemi di motion capture marker-based, permettendo l'analisi del movimento al di fuori del laboratorio. Il presente lavoro propone una revisione critica di questi metodi, con particolare attenzione a due domini applicativi: l'ergonomia motoria, dove la pose estimation consente l'automazione di checklist di valutazione del rischio come RULA e REBA, e la riabilitazione funzionale, dove abilita la gait analysis, la valutazione del Range of Motion articolare e la tele-riabilitazione. Sono discussi i principali task tecnici (2D e 3D Human Pose Estimation e Human Action Recognition) le architetture di riferimento, tra cui le Graph Convolutional Networks per il riconoscimento dell'azione, e i framework open-source disponibili, con un approfondimento su MediaPipe Pose, scelto per l'accuratezza in tempo reale su hardware non dedicato. La tesi include inoltre un caso studio originale: l'analisi di un video reale del mio infortunio sportivo al legamento crociato anteriore, condotta tramite MediaPipe per estrarre l'andamento dell'angolo di flessione del ginocchio. I risultati mostrano un collasso da 7° a 93° di flessione in 360 millisecondi, coerente con i meccanismi lesivi descritti in letteratura. Il caso studio evidenzia al contempo le potenzialità applicative di questi strumenti e i loro limiti attuali (occlusioni, scene multi-persona, movimenti fuori dal piano della camera) che ne condizionano la piena maturità per un utilizzo clinico.
Deep Learning
Computer Vision
Ergonomia Motoria
Riabilitazione
Analisi
File in questo prodotto:
File Dimensione Formato  
Verza_Gianluca.pdf

accesso aperto

Dimensione 1.18 MB
Formato Adobe PDF
1.18 MB Adobe PDF Visualizza/Apri

The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.12608/114309