Background: The integration of clinical data is a highly relevant issue in research. At the Padua University Hospital, approximately 32,000 clinical records of patients with audiological and, in some cases, genetic conditions are distributed across systems that do not communicate with one another (HIMSA Noah System 4, genetic databases, PDF reports). Compounding this issue is the absence of specific informed consent for retrospective research. Objectives: This study aims to design, implement, and validate a compliance-aware healthcare data processing pipeline that combines the scientific exploitation of historical clinical data with full regulatory compliance, demonstrating technical and legal feasibility through a proof of concept using synthetic data. Materials and Methods: The pipeline, developed in Python 3.14.3, consists of five stages: (1–2) extraction, transformation, and loading (ETL); (3) pseudonymization using SHA-256 with a cryptographically secure salt and statistical generalization; (4) verification of k-anonymity (threshold k=3); (5) simulation of the transfer of the pseudonymized dataset to REDCap. Validation was conducted on 1,000 synthetic patients generated using the Faker library, without the use of real data, in accordance with the principle of data minimization (Art. 5(1)(c) GDPR). A Data Protection Impact Assessment (DPIA) was prepared in accordance with the EDPB Template 2026. Results: The k-anonymity test met the k=3 threshold at levels 1 and 2 of quasi-identifiers (minimum k: 34 and 8, respectively). Verification of the JSON payload confirmed the absence of direct identifiers in the data transferred to REDCap. The regulatory compliance table documented the correspondence between each legal requirement and the technical measure implemented, in accordance with the Privacy by Design principle. Conclusions: The results obtained indicate that a healthcare data processing pipeline can simultaneously meet the requirements of scientific utility and regulatory compliance. This work can serve as a methodological reference for clinical facilities intending to launch similar projects, subject to the requirement of a favorable opinion from the Ethics Committee for application to real-world data. Keywords: healthcare data pipeline, REDCap, GDPR compliance, Proof of Concept.

Background: L'integrazione dei dati clinici costituisce un problema molto attuale nella ricerca. Presso l'Azienda Ospedale-Università Padova, circa 32.000 dati clinici di pazienti con patologie audiologiche e, in parte, genetiche risultano distribuite tra sistemi non comunicanti (HIMSA Noah System 4, database genetici, referti PDF). A ciò si aggiunge l'assenza di un consenso informato specifico per la ricerca retrospettiva. Obiettivi: Il presente lavoro si propone di progettare, implementare e validare una pipeline di trattamento dati sanitari compliance-aware che coniughi la valorizzazione scientifica dei dati clinici storici con la piena conformità normativa, dimostrando la fattibilità tecnico-giuridica attraverso un Proof of Concept su dati sintetici. Materiali e Metodi: La pipeline, sviluppata in Python 3.14.3, si articola in cinque fasi: (1–2) estrazione, minimizzazione e validazione clinica (ETL); (3) pseudonimizzazione mediante SHA-256 con salt crittograficamente sicuro e generalizzazione statistica; (4) verifica della k-anonymity (soglia k=3); (5) simulazione del trasferimento del dataset pseudonimizzato verso REDCap. La validazione è stata condotta su 1.000 pazienti sintetici generati con la libreria Faker, senza utilizzo di dati reali, nel rispetto del principio di minimizzazione (Art. 5(1)(c) GDPR). Una Valutazione d'Impatto sulla Protezione dei Dati (DPIA) è stata redatta secondo il template EDPB 2026. Risultati: Il test di k-anonymity ha soddisfatto la soglia k=3 ai livelli 1 e 2 di quasi-identificatori (k minimo: 34 e 8, rispettivamente). La verifica del payload JSON ha confermato l'assenza di identificativi diretti nei dati trasferiti a REDCap. La tabella di conformità normativa ha documentato la corrispondenza tra ciascun requisito di legge e la misura tecnica implementata, in applicazione del principio di Privacy by Design. Conclusioni: I risultati ottenuti indicano che una pipeline di trattamento dati sanitari può soddisfare simultaneamente i requisiti di utilità scientifica e di conformità normativa. Il lavoro può costituire un riferimento metodologico per strutture cliniche che intendano avviare progetti analoghi, ferma restando la necessità del parere favorevole del Comitato Etico per l'applicazione su dati reali. Parole chiave: pipeline dati sanitari, REDCap, Compliance GDPR, Proof of Concept.

Pipeline di trattamento dati sanitari in ambito audiologico: progettazione, implementazione e validazione nel quadro del GDPR e del codice della Privacy italiano.

GALOFORO, NICOLE
2025/2026

Abstract

Background: The integration of clinical data is a highly relevant issue in research. At the Padua University Hospital, approximately 32,000 clinical records of patients with audiological and, in some cases, genetic conditions are distributed across systems that do not communicate with one another (HIMSA Noah System 4, genetic databases, PDF reports). Compounding this issue is the absence of specific informed consent for retrospective research. Objectives: This study aims to design, implement, and validate a compliance-aware healthcare data processing pipeline that combines the scientific exploitation of historical clinical data with full regulatory compliance, demonstrating technical and legal feasibility through a proof of concept using synthetic data. Materials and Methods: The pipeline, developed in Python 3.14.3, consists of five stages: (1–2) extraction, transformation, and loading (ETL); (3) pseudonymization using SHA-256 with a cryptographically secure salt and statistical generalization; (4) verification of k-anonymity (threshold k=3); (5) simulation of the transfer of the pseudonymized dataset to REDCap. Validation was conducted on 1,000 synthetic patients generated using the Faker library, without the use of real data, in accordance with the principle of data minimization (Art. 5(1)(c) GDPR). A Data Protection Impact Assessment (DPIA) was prepared in accordance with the EDPB Template 2026. Results: The k-anonymity test met the k=3 threshold at levels 1 and 2 of quasi-identifiers (minimum k: 34 and 8, respectively). Verification of the JSON payload confirmed the absence of direct identifiers in the data transferred to REDCap. The regulatory compliance table documented the correspondence between each legal requirement and the technical measure implemented, in accordance with the Privacy by Design principle. Conclusions: The results obtained indicate that a healthcare data processing pipeline can simultaneously meet the requirements of scientific utility and regulatory compliance. This work can serve as a methodological reference for clinical facilities intending to launch similar projects, subject to the requirement of a favorable opinion from the Ethics Committee for application to real-world data. Keywords: healthcare data pipeline, REDCap, GDPR compliance, Proof of Concept.
2025
Health data processisng pipelines in audiology: design, implementation and validation within the framework of the GDPR and the italian Data Protection Code.
Background: L'integrazione dei dati clinici costituisce un problema molto attuale nella ricerca. Presso l'Azienda Ospedale-Università Padova, circa 32.000 dati clinici di pazienti con patologie audiologiche e, in parte, genetiche risultano distribuite tra sistemi non comunicanti (HIMSA Noah System 4, database genetici, referti PDF). A ciò si aggiunge l'assenza di un consenso informato specifico per la ricerca retrospettiva. Obiettivi: Il presente lavoro si propone di progettare, implementare e validare una pipeline di trattamento dati sanitari compliance-aware che coniughi la valorizzazione scientifica dei dati clinici storici con la piena conformità normativa, dimostrando la fattibilità tecnico-giuridica attraverso un Proof of Concept su dati sintetici. Materiali e Metodi: La pipeline, sviluppata in Python 3.14.3, si articola in cinque fasi: (1–2) estrazione, minimizzazione e validazione clinica (ETL); (3) pseudonimizzazione mediante SHA-256 con salt crittograficamente sicuro e generalizzazione statistica; (4) verifica della k-anonymity (soglia k=3); (5) simulazione del trasferimento del dataset pseudonimizzato verso REDCap. La validazione è stata condotta su 1.000 pazienti sintetici generati con la libreria Faker, senza utilizzo di dati reali, nel rispetto del principio di minimizzazione (Art. 5(1)(c) GDPR). Una Valutazione d'Impatto sulla Protezione dei Dati (DPIA) è stata redatta secondo il template EDPB 2026. Risultati: Il test di k-anonymity ha soddisfatto la soglia k=3 ai livelli 1 e 2 di quasi-identificatori (k minimo: 34 e 8, rispettivamente). La verifica del payload JSON ha confermato l'assenza di identificativi diretti nei dati trasferiti a REDCap. La tabella di conformità normativa ha documentato la corrispondenza tra ciascun requisito di legge e la misura tecnica implementata, in applicazione del principio di Privacy by Design. Conclusioni: I risultati ottenuti indicano che una pipeline di trattamento dati sanitari può soddisfare simultaneamente i requisiti di utilità scientifica e di conformità normativa. Il lavoro può costituire un riferimento metodologico per strutture cliniche che intendano avviare progetti analoghi, ferma restando la necessità del parere favorevole del Comitato Etico per l'applicazione su dati reali. Parole chiave: pipeline dati sanitari, REDCap, Compliance GDPR, Proof of Concept.
Pipeline dati sanita
REDCap
Compliance GDPR
Proof of concept
File in questo prodotto:
File Dimensione Formato  
Galoforo_Nicole.pdf

Accesso riservato

Dimensione 10.6 MB
Formato Adobe PDF
10.6 MB Adobe PDF

The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.12608/112811