This thesis describes the work carried out during a curricular internship at Riskapp S.r.l. The main objective of the project was the development of an MCP (Model Context Protocol) server, a standard protocol for integrating external tools with artificial intelligence agents. The project covered the entire software development lifecycle, including requirements analysis, architecture design, implementation, and final testing. Several tools were developed to retrieve web page content, convert it into Markdown, HTML, and structured JSON formats, and implement an intelligent caching system to optimize performance by reducing redundant requests. To support the MCP server, a complete web application was also developed, consisting of a frontend providing authentication, a chatbot interface, profile management, and a user administration panel, as well as a backend organized into microservices. The entire application was containerized using Docker to ensure portability and scalability. The final outcome is a fully functional and documented MCP server, deployable through containers, that enables artificial intelligence models to access and query web resources in a standardized and real-time manner.

Il presente elaborato descrive il lavoro svolto durante il tirocinio curricolare presso l'azienda Riskapp S.r.l.. Il progetto ha avuto come obiettivo principale lo sviluppo di un server MCP (Model Context Protocol), protocollo standard per l'integrazione di strumenti esterni con agenti di intelligenza artificiale. Il lavoro ha compreso le fasi di analisi dei requisiti, progettazione dell'architettura, codifica e collaudo conclusivo. Sono stati sviluppati strumenti per il recupero del contenuto delle pagine web, la loro conversione in formato Markdown, HTML e JSON strutturato, e un sistema di caching intelligente per ottimizzare le prestazioni riducendo le richieste ridondanti. A supporto del server MCP è stata realizzata un'applicazione web completa, composta da un frontend (con funzionalità di autenticazione, interfaccia chatbot, gestione del profilo e pannello di amministrazione utenti) e un backend suddiviso in microservizi. L'intera applicazione è stata containerizzata tramite Docker per garantirne portabilità e scalabilità. Il risultato finale è dunque un server MCP funzionante e documentato, distribuibile tramite container e che consente ai modelli di intelligenza artificiale di interrogare fonti web in modo standardizzato e in tempo reale.

Server MCP per il crawling e l'estrazione strutturata di dati web

BALEANU, VALERIA
2025/2026

Abstract

This thesis describes the work carried out during a curricular internship at Riskapp S.r.l. The main objective of the project was the development of an MCP (Model Context Protocol) server, a standard protocol for integrating external tools with artificial intelligence agents. The project covered the entire software development lifecycle, including requirements analysis, architecture design, implementation, and final testing. Several tools were developed to retrieve web page content, convert it into Markdown, HTML, and structured JSON formats, and implement an intelligent caching system to optimize performance by reducing redundant requests. To support the MCP server, a complete web application was also developed, consisting of a frontend providing authentication, a chatbot interface, profile management, and a user administration panel, as well as a backend organized into microservices. The entire application was containerized using Docker to ensure portability and scalability. The final outcome is a fully functional and documented MCP server, deployable through containers, that enables artificial intelligence models to access and query web resources in a standardized and real-time manner.
2025
MCP Server for Web Crawling and Structured Data Extraction
Il presente elaborato descrive il lavoro svolto durante il tirocinio curricolare presso l'azienda Riskapp S.r.l.. Il progetto ha avuto come obiettivo principale lo sviluppo di un server MCP (Model Context Protocol), protocollo standard per l'integrazione di strumenti esterni con agenti di intelligenza artificiale. Il lavoro ha compreso le fasi di analisi dei requisiti, progettazione dell'architettura, codifica e collaudo conclusivo. Sono stati sviluppati strumenti per il recupero del contenuto delle pagine web, la loro conversione in formato Markdown, HTML e JSON strutturato, e un sistema di caching intelligente per ottimizzare le prestazioni riducendo le richieste ridondanti. A supporto del server MCP è stata realizzata un'applicazione web completa, composta da un frontend (con funzionalità di autenticazione, interfaccia chatbot, gestione del profilo e pannello di amministrazione utenti) e un backend suddiviso in microservizi. L'intera applicazione è stata containerizzata tramite Docker per garantirne portabilità e scalabilità. Il risultato finale è dunque un server MCP funzionante e documentato, distribuibile tramite container e che consente ai modelli di intelligenza artificiale di interrogare fonti web in modo standardizzato e in tempo reale.
MCP
crawling
server
Python
estrazione dati web
File in questo prodotto:
File Dimensione Formato  
thesis.pdf

accesso aperto

Dimensione 3.86 MB
Formato Adobe PDF
3.86 MB Adobe PDF Visualizza/Apri

The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.12608/111033