L'avvento delle piattaforme di streaming digitale ha profondamente trasformato il mercato musicale, generando enormi volumi di dati che possono essere analizzati per stimare e comprendere la popolarità dei brani. Il presente studio si pone l'obiettivo di prevedere la popolarità delle tracce all'interno del mercato musicale italiano e di identificare le caratteristiche che ne determinano il successo. Per condurre l'analisi è stato costruito un dataset ad hoc, denominato "Spotify-Genius-Sanremo". Tale dataset è stato realizzato unendo i metadati e le caratteristiche audio estratte da Spotify, i testi delle canzoni provenienti da Genius (convertiti in embeddings a 768 dimensioni tramite il codificatore Italian-ModernBERT) e i dati storici dei piazzamenti al Festival di Sanremo. L'integrazione di queste tre fonti è avvenuta mediante tecniche di abbinamento probabilistico (probabilistic record linkage). A differenza della letteratura preesistente, focalizzata sull'adattamento di reti neurali profonde, in questo elaborato si è deciso di testare modelli ensemble di alberi integrati con effetti casuali assegnati sulla figura dell'artista. Questa scelta è stata motivata dalla necessità di catturare della variabilità non osservata dovuta all'assenza di esplicative potenzialmente rilevanti, come il budget per campagne di marketing o le strategie comunicative sui social media. Dopo aver testato una gamma di modelli senza effetti casuali (tra cui regressioni lineari penalizzate, MARS, Random Forest, reti neurali e varie forme di Boosting), si è passati alla modellazione con effetti misti. I risultati dimostrano che l'inclusione degli effetti casuali migliora in modo decisivo la capacità predittiva. Il modello GPBoost (Gaussian Process Boosting) si è affermato come il più accurato in assoluto. Infine, un'analisi di scenario condotta con il modello vincente ha permesso di estrarre indicazioni operative per l'industria discografica: per massimizzare la popolarità su Spotify in Italia, risulta oggi strategicamente vantaggioso produrre un brano ascrivibile al genere "trap italiana", inserire testi con contenuti espliciti e mantenere un tempo tra i 135 e i 150 battiti per minuto.
La popolarità di brani musicali italiani: Modelli di previsione
BERTIN, NICOLA
2025/2026
Abstract
L'avvento delle piattaforme di streaming digitale ha profondamente trasformato il mercato musicale, generando enormi volumi di dati che possono essere analizzati per stimare e comprendere la popolarità dei brani. Il presente studio si pone l'obiettivo di prevedere la popolarità delle tracce all'interno del mercato musicale italiano e di identificare le caratteristiche che ne determinano il successo. Per condurre l'analisi è stato costruito un dataset ad hoc, denominato "Spotify-Genius-Sanremo". Tale dataset è stato realizzato unendo i metadati e le caratteristiche audio estratte da Spotify, i testi delle canzoni provenienti da Genius (convertiti in embeddings a 768 dimensioni tramite il codificatore Italian-ModernBERT) e i dati storici dei piazzamenti al Festival di Sanremo. L'integrazione di queste tre fonti è avvenuta mediante tecniche di abbinamento probabilistico (probabilistic record linkage). A differenza della letteratura preesistente, focalizzata sull'adattamento di reti neurali profonde, in questo elaborato si è deciso di testare modelli ensemble di alberi integrati con effetti casuali assegnati sulla figura dell'artista. Questa scelta è stata motivata dalla necessità di catturare della variabilità non osservata dovuta all'assenza di esplicative potenzialmente rilevanti, come il budget per campagne di marketing o le strategie comunicative sui social media. Dopo aver testato una gamma di modelli senza effetti casuali (tra cui regressioni lineari penalizzate, MARS, Random Forest, reti neurali e varie forme di Boosting), si è passati alla modellazione con effetti misti. I risultati dimostrano che l'inclusione degli effetti casuali migliora in modo decisivo la capacità predittiva. Il modello GPBoost (Gaussian Process Boosting) si è affermato come il più accurato in assoluto. Infine, un'analisi di scenario condotta con il modello vincente ha permesso di estrarre indicazioni operative per l'industria discografica: per massimizzare la popolarità su Spotify in Italia, risulta oggi strategicamente vantaggioso produrre un brano ascrivibile al genere "trap italiana", inserire testi con contenuti espliciti e mantenere un tempo tra i 135 e i 150 battiti per minuto.| File | Dimensione | Formato | |
|---|---|---|---|
|
Bertin_Nicola.pdf
Accesso riservato
Dimensione
8.56 MB
Formato
Adobe PDF
|
8.56 MB | Adobe PDF |
The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License
https://hdl.handle.net/20.500.12608/112238