The bot traffic has witnessed a paradigm shift during the 2024-2026 cycle, from script-based automation to AI-powered agentic behavior. As the world is expected to suffer a loss of $12 trillion due to cybercrime by 2025, the conven- tional methods of protection, such as static fingerprinting and CAPTCHAs, have become outdated because of the emergence of evasive bots that can solve cognitive tasks. This thesis work presents a novel Continuous and Dynamic Trust framework using Log-Likelihood and Wald’s Sequential Probability Ratio Test (SPRT). By incorporating Behavioral Biometrics and Fractional Calculus to identify Neuromuscular Memory and using Multi-Modal Behav- ioral Transformers (MMBT) , the proposed system is able to distinguish between human and "Synthetic Respondents" with high accuracy. The pro- posed model is validated on the ReMouse dataset, which demonstrates its robustness against sophisticated session replay attacks.

L’ambiente digitale sta attraversando un cambiamento di paradigma nella natura del traffico Internet. Nel 2024, per la prima volta in un decennio, il traffico automatizzato ha superato quello umano, arrivando al 51% del totale secondo l’Imperva Bad Bot Report [1], mentre le misurazioni di Cloudflare indicano che i sistemi automatizzati generano circa il 57,5% delle richieste HTTP mondiali [2]. In questo scenario le difese statiche tradizionali — il fingerprinting del browser e i CAPTCHA — risultano sostanzialmente obsolete: i solver basati su reti neurali risolvono le sfide immagine con tassi di successo superiori all’83% [3], e gli agenti guidati da modelli linguistici di grandi dimensioni (LLM) sono ormai in grado di navigare, compilare form e interagire con le pagine in modo semanticamente coerente [4]. Questa tesi sostiene che il problema non possa essere risolto da un controllo binario e istantaneo (one-shot), ma richieda un modello di fiducia continua e dinamica: la probabilità che una sessione sia umana va stimata continuamente sul flusso dei dati comportamentali — movimenti del mouse e dinamica di digitazione. A tal fine si costruisce un percorso matematico completo che modella il comportamento come densità gaussiana multivariata e formula la distinzione umano/bot come test tra due ipotesi semplici. Il cuore metodolo- gico è il Sequential Probability Ratio Test (SPRT) di Wald [5]: accumulando il rapporto di log-verosimiglianza (Log-Likelihood Ratio, LLR) evento per evento, il sistema decide con un numero atteso di osservazioni minimo, sotto vincoli espliciti sui tassi di errore α e β [6]. Il contributo teorico consiste nella derivazione passo-passo delle relazioni che collegano la verosimiglianza, la distanza di Mahalanobis, il lemma di Neyman– Pearson, le soglie di Wald, la divergenza di Kullback–Leibler e l’estensione markoviana del modello, così da giustificare l’ottimalità e la complessità O(1) per evento del test. Il contributo empirico è una validazione tramite simulazione Monte Carlo in PyTorch, che verifica il controllo dei tassi di errore, la stima del tempo di arresto atteso e la robustezza del test in presenza di dati temporalmente correlati. Il risultato chiave è un meccanismo decisionale online adatto al monitoraggio in tempo reale, che chiude concettualmente il passaggio da una gate authentication istantanea a una continuous trust sequenziale. Parole chiave: biometria comportamentale, SPRT, rapporto di log-verosimiglianza, lemma di Neyman–Pearson, divergenza di Kullback–Leibler, distanza di Mahalanobis, rilevamento di bot, fiducia continua.

Rilevamento di bot attraverso la biometria comportamentale

MARTINELLI, MORRIS
2025/2026

Abstract

The bot traffic has witnessed a paradigm shift during the 2024-2026 cycle, from script-based automation to AI-powered agentic behavior. As the world is expected to suffer a loss of $12 trillion due to cybercrime by 2025, the conven- tional methods of protection, such as static fingerprinting and CAPTCHAs, have become outdated because of the emergence of evasive bots that can solve cognitive tasks. This thesis work presents a novel Continuous and Dynamic Trust framework using Log-Likelihood and Wald’s Sequential Probability Ratio Test (SPRT). By incorporating Behavioral Biometrics and Fractional Calculus to identify Neuromuscular Memory and using Multi-Modal Behav- ioral Transformers (MMBT) , the proposed system is able to distinguish between human and "Synthetic Respondents" with high accuracy. The pro- posed model is validated on the ReMouse dataset, which demonstrates its robustness against sophisticated session replay attacks.
2025
Advanced Web Bot Detection via Behavioral Biometrics: A Log-Likelihood Approach
L’ambiente digitale sta attraversando un cambiamento di paradigma nella natura del traffico Internet. Nel 2024, per la prima volta in un decennio, il traffico automatizzato ha superato quello umano, arrivando al 51% del totale secondo l’Imperva Bad Bot Report [1], mentre le misurazioni di Cloudflare indicano che i sistemi automatizzati generano circa il 57,5% delle richieste HTTP mondiali [2]. In questo scenario le difese statiche tradizionali — il fingerprinting del browser e i CAPTCHA — risultano sostanzialmente obsolete: i solver basati su reti neurali risolvono le sfide immagine con tassi di successo superiori all’83% [3], e gli agenti guidati da modelli linguistici di grandi dimensioni (LLM) sono ormai in grado di navigare, compilare form e interagire con le pagine in modo semanticamente coerente [4]. Questa tesi sostiene che il problema non possa essere risolto da un controllo binario e istantaneo (one-shot), ma richieda un modello di fiducia continua e dinamica: la probabilità che una sessione sia umana va stimata continuamente sul flusso dei dati comportamentali — movimenti del mouse e dinamica di digitazione. A tal fine si costruisce un percorso matematico completo che modella il comportamento come densità gaussiana multivariata e formula la distinzione umano/bot come test tra due ipotesi semplici. Il cuore metodolo- gico è il Sequential Probability Ratio Test (SPRT) di Wald [5]: accumulando il rapporto di log-verosimiglianza (Log-Likelihood Ratio, LLR) evento per evento, il sistema decide con un numero atteso di osservazioni minimo, sotto vincoli espliciti sui tassi di errore α e β [6]. Il contributo teorico consiste nella derivazione passo-passo delle relazioni che collegano la verosimiglianza, la distanza di Mahalanobis, il lemma di Neyman– Pearson, le soglie di Wald, la divergenza di Kullback–Leibler e l’estensione markoviana del modello, così da giustificare l’ottimalità e la complessità O(1) per evento del test. Il contributo empirico è una validazione tramite simulazione Monte Carlo in PyTorch, che verifica il controllo dei tassi di errore, la stima del tempo di arresto atteso e la robustezza del test in presenza di dati temporalmente correlati. Il risultato chiave è un meccanismo decisionale online adatto al monitoraggio in tempo reale, che chiude concettualmente il passaggio da una gate authentication istantanea a una continuous trust sequenziale. Parole chiave: biometria comportamentale, SPRT, rapporto di log-verosimiglianza, lemma di Neyman–Pearson, divergenza di Kullback–Leibler, distanza di Mahalanobis, rilevamento di bot, fiducia continua.
bot
log-likelihood
detezione
web
biometrici
File in questo prodotto:
File Dimensione Formato  
relazione (2).pdf

accesso aperto

Dimensione 3.24 MB
Formato Adobe PDF
3.24 MB Adobe PDF Visualizza/Apri

The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.12608/114222