Background and objectives: The integration of Large Language Models (LLMs) into oncological practice represents an area of growing scientific interest. This study evaluates the role of AI as a decision-support tool within the Gynaecologic Oncology Multidisciplinary Tumor Board (MTB), analysing the concordance between the model's recommendations and the team's decisions, adherence to international guidelines and comparison of decision-making times. Materials and methods: Prospective observational study conducted at the Gynaecologic Oncology MTB of the University of Padova from 20 June 2025 to 25 May 2026. A total of 631 consecutive presentations from 337 patients with gynaecological malignancies were analysed. Anonymised clinical data were submitted to ChatGPT-4o via a standardised zero-shot prompt written in Italian. Concordance between the model's and the MTB's recommendations was assessed using Cohen's Kappa coefficient, with subgroup analyses by tumour type, FIGO stage, reason for presentation and recurrence status. Guideline adherence (ESGO, NCCN, ESMO, ESTRO, ESP, FIGO) was assessed in discordant cases. Decisional time was compared using the Wilcoxon signed-rank test. Results: Overall concordance was 69.57% (κ = 0.623, substantial agreement). Concordance was higher in non-recurrent cases (κ = 0.657 vs 0.469), pathology result presentations (κ = 0.636 vs 0.591), advanced-stage disease (κ = 0.680 vs 0.596) and ovarian carcinoma (κ = 0.649). Among the 192 discordant cases, the most frequent discordance categories were Further investigation required (43.2%) and Therapeutic strategy discordance (31.3%). In discordant cases, the MTB showed full guideline adherence in 78.6% of cases vs 66.1% for ChatGPT-4o. ChatGPT-4o response time (median 16.0 seconds) was approximately 22 times shorter than MTB discussion time (median 5.75 minutes; p < 0.001). Conclusions: ChatGPT-4o demonstrated substantial concordance with Gynaecologic Oncology MTB decisions, with variable performance depending on clinical complexity. The model emerges as a potential support, still not replacement, tool for multidisciplinary decision-making, showing greater reliability in highly standardised clinical scenarios and lower performance in complex, recurrent or imaging-dependent cases. The responsible integration of LLMs into MTB practice represents a promising avenue for improving decisional efficiency in gynaecological oncology.

Introduzione e obiettivi: L'integrazione dei Large Language Models (LLM) nella pratica oncologica rappresenta un ambito di crescente interesse scientifico. Il presente studio valuta il ruolo dei LLM come strumento di supporto decisionale all'interno del Tumor Board (MDT), analizzando la concordanza tra le indicazioni generate dal modello e le decisioni del gruppo, l'aderenza alle linee guida internazionali e il confronto dei tempi decisionali. Materiali e metodi: Studio osservazionale prospettico condotto presso il Gruppo Multidisciplinare Oncologico Ginecologico dell'Università di Padova dal 20 giugno 2025 al 25 maggio 2026. Sono state analizzate tutte le presentazioni consecutive di pazienti affette da neoplasie ginecologiche. I dati clinici anonimizzati sono stati sottoposti a ChatGPT-4o mediante un prompt standardizzato in lingua italiana. La concordanza tra le indicazioni del modello e quelle dell’MDT è stata valutata mediante il coefficiente Kappa di Cohen, con un’analisi per sottogruppi distinguendo tipo di tumore, stadio FIGO, motivo di presentazione e stato di recidiva. L'aderenza alle linee guida internazionali (ESGO, NCCN, ESMO, ESTRO, ESP, FIGO) è stata valutata nei casi non concordanti. Il tempo decisionale è stato confrontato mediante test di Wilcoxon. Risultati: La concordanza globale è risultata del 69,57% (κ = 0,623, substantial agreement). La concordanza è risultata superiore nei casi senza recidiva (κ = 0,657 vs 0,469), nei casi associati a esito anatomo-patologico (κ = 0,636 vs 0,591), negli stadi avanzati (κ = 0,680 vs 0,596) e nel carcinoma ovarico (κ = 0,649). Tra i 192 casi non concordanti, le categorie di discordanza più frequenti sono state Further investigation required (43,2%) e Therapeutic strategy discordance (31,3%). Nei casi non concordanti, il Tumor Board ha mostrato piena aderenza alle linee guida nel 78,6% dei casi contro il 66,1% di ChatGPT-4o. Il tempo di risposta di ChatGPT (mediana 16,0 secondi) è risultato circa 22 volte inferiore al tempo di discussione del Tumor Board (mediana 5,75 minuti; p < 0,001). Conclusioni: ChatGPT-4o ha dimostrato una concordanza sostanziale con le decisioni del Tumor Board Ginecologico Oncologico, con performance variabile in funzione della complessità clinica del caso. Il modello si configura come potenziale strumento di supporto, non sostitutivo, al processo decisionale multidisciplinare, con maggiore affidabilità nei casi standardizzati e minore nei casi complessi, in recidiva o imaging-dipendenti. L'integrazione responsabile di questi strumenti nella pratica del Tumor Board rappresenta una prospettiva per migliorare l'efficienza decisionale in oncologia ginecologica.

Intelligenza artificiale in ginecologia oncologica: i modelli generativi come alleati del Tumor Board, uno studio di concordanza

PRINCIPI, LAURA
2025/2026

Abstract

Background and objectives: The integration of Large Language Models (LLMs) into oncological practice represents an area of growing scientific interest. This study evaluates the role of AI as a decision-support tool within the Gynaecologic Oncology Multidisciplinary Tumor Board (MTB), analysing the concordance between the model's recommendations and the team's decisions, adherence to international guidelines and comparison of decision-making times. Materials and methods: Prospective observational study conducted at the Gynaecologic Oncology MTB of the University of Padova from 20 June 2025 to 25 May 2026. A total of 631 consecutive presentations from 337 patients with gynaecological malignancies were analysed. Anonymised clinical data were submitted to ChatGPT-4o via a standardised zero-shot prompt written in Italian. Concordance between the model's and the MTB's recommendations was assessed using Cohen's Kappa coefficient, with subgroup analyses by tumour type, FIGO stage, reason for presentation and recurrence status. Guideline adherence (ESGO, NCCN, ESMO, ESTRO, ESP, FIGO) was assessed in discordant cases. Decisional time was compared using the Wilcoxon signed-rank test. Results: Overall concordance was 69.57% (κ = 0.623, substantial agreement). Concordance was higher in non-recurrent cases (κ = 0.657 vs 0.469), pathology result presentations (κ = 0.636 vs 0.591), advanced-stage disease (κ = 0.680 vs 0.596) and ovarian carcinoma (κ = 0.649). Among the 192 discordant cases, the most frequent discordance categories were Further investigation required (43.2%) and Therapeutic strategy discordance (31.3%). In discordant cases, the MTB showed full guideline adherence in 78.6% of cases vs 66.1% for ChatGPT-4o. ChatGPT-4o response time (median 16.0 seconds) was approximately 22 times shorter than MTB discussion time (median 5.75 minutes; p < 0.001). Conclusions: ChatGPT-4o demonstrated substantial concordance with Gynaecologic Oncology MTB decisions, with variable performance depending on clinical complexity. The model emerges as a potential support, still not replacement, tool for multidisciplinary decision-making, showing greater reliability in highly standardised clinical scenarios and lower performance in complex, recurrent or imaging-dependent cases. The responsible integration of LLMs into MTB practice represents a promising avenue for improving decisional efficiency in gynaecological oncology.
2025
Artificial Intelligence in Gynecologic Oncology: Generative Models as Allies of the Tumor Board, a Concordance Study
Introduzione e obiettivi: L'integrazione dei Large Language Models (LLM) nella pratica oncologica rappresenta un ambito di crescente interesse scientifico. Il presente studio valuta il ruolo dei LLM come strumento di supporto decisionale all'interno del Tumor Board (MDT), analizzando la concordanza tra le indicazioni generate dal modello e le decisioni del gruppo, l'aderenza alle linee guida internazionali e il confronto dei tempi decisionali. Materiali e metodi: Studio osservazionale prospettico condotto presso il Gruppo Multidisciplinare Oncologico Ginecologico dell'Università di Padova dal 20 giugno 2025 al 25 maggio 2026. Sono state analizzate tutte le presentazioni consecutive di pazienti affette da neoplasie ginecologiche. I dati clinici anonimizzati sono stati sottoposti a ChatGPT-4o mediante un prompt standardizzato in lingua italiana. La concordanza tra le indicazioni del modello e quelle dell’MDT è stata valutata mediante il coefficiente Kappa di Cohen, con un’analisi per sottogruppi distinguendo tipo di tumore, stadio FIGO, motivo di presentazione e stato di recidiva. L'aderenza alle linee guida internazionali (ESGO, NCCN, ESMO, ESTRO, ESP, FIGO) è stata valutata nei casi non concordanti. Il tempo decisionale è stato confrontato mediante test di Wilcoxon. Risultati: La concordanza globale è risultata del 69,57% (κ = 0,623, substantial agreement). La concordanza è risultata superiore nei casi senza recidiva (κ = 0,657 vs 0,469), nei casi associati a esito anatomo-patologico (κ = 0,636 vs 0,591), negli stadi avanzati (κ = 0,680 vs 0,596) e nel carcinoma ovarico (κ = 0,649). Tra i 192 casi non concordanti, le categorie di discordanza più frequenti sono state Further investigation required (43,2%) e Therapeutic strategy discordance (31,3%). Nei casi non concordanti, il Tumor Board ha mostrato piena aderenza alle linee guida nel 78,6% dei casi contro il 66,1% di ChatGPT-4o. Il tempo di risposta di ChatGPT (mediana 16,0 secondi) è risultato circa 22 volte inferiore al tempo di discussione del Tumor Board (mediana 5,75 minuti; p < 0,001). Conclusioni: ChatGPT-4o ha dimostrato una concordanza sostanziale con le decisioni del Tumor Board Ginecologico Oncologico, con performance variabile in funzione della complessità clinica del caso. Il modello si configura come potenziale strumento di supporto, non sostitutivo, al processo decisionale multidisciplinare, con maggiore affidabilità nei casi standardizzati e minore nei casi complessi, in recidiva o imaging-dipendenti. L'integrazione responsabile di questi strumenti nella pratica del Tumor Board rappresenta una prospettiva per migliorare l'efficienza decisionale in oncologia ginecologica.
Large Language Model
Oncology
Tumor Board
Decision-making
AI
File in questo prodotto:
File Dimensione Formato  
Principi_Laura.pdf

Accesso riservato

Dimensione 803.44 kB
Formato Adobe PDF
803.44 kB Adobe PDF

The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.12608/109999