Network Based Big Data Analytics
Anno accademico 2026/2027 - Docente: ALFREDO PULVIRENTIRisultati di apprendimento attesi
Il corso introduce metodi e strumenti per l’analisi di dati (principalmente biomedici) su larga scala mediante modelli a rete, con particolare attenzione a interattomi, reti di co-espressione, reti farmaco–bersaglio, knowledge graph e reti di similarità tra pazienti. Integra aspetti metodologico-computazionali network science, algoritmi su grafi, machine learning, Graph Neural Networks e analisi di grafi su larga scala con applicazioni di Network Medicine, tra cui identificazione di disease module, studio delle comorbidità, drug repurposing e stratificazione dei pazienti. Le lezioni teoriche sono integrate da laboratori Python su dati biomedici reali.
Conoscenza e capacità di comprensione:
Lo studente conosce le proprietà strutturali delle reti reali e i modelli nulli appropriati; gli algoritmi di community detection, diffusione e link prediction; i principi dei metodi di rappresentazione su grafi (embedding, GNN, knowledge graph embedding); l'architettura dei sistemi per il calcolo su grafi di grandi dimensioni; i postulati e i limiti della Network Medicine.
Capacità di applicare conoscenza e comprensione:
Lo studente è in grado di costruire una pipeline riproducibile che, partendo da dati biomedici eterogenei, produce una rete integrata, ne valuta le proprietà, identifica moduli associati a un fenotipo, prioritizza geni o farmaci candidati e quantifica l'incertezza del risultato.
Autonomia di giudizio:
Lo studente sa riconoscere i bias delle risorse biomediche (bias di studio nell'interattoma, incompletezza, annotazione circolare), individuare le forme più comuni di leakage nella valutazione di modelli su grafi, e distinguere un'associazione topologica da un'evidenza causale o clinicamente utile.
Abilità comunicative:
Lo studente sa presentare risultati di analisi di rete a un pubblico misto informatico e clinico, con visualizzazioni appropriate e una descrizione onesta dei limiti.
Capacità di apprendimento:
Lo studente sa leggere criticamente la letteratura primaria di network biology e graph machine learning e riprodurre un risultato pubblicato a partire dai dati e dal codice disponibili.
Modalità di svolgimento dell'insegnamento
Lezioni frontali.
Qualora l'insegnamento venisse impartito in modalità mista o a distanza potranno essere introdotte le necessarie variazioni rispetto a quanto dichiarato in precedenza, al fine di rispettare il programma previsto e riportato nel syllabus.
Prerequisiti richiesti
- Programmazione in Python.
- Algoritmi e strutture dati: complessità, visite di grafi, cammini minimi, code di priorità.
- Probabilità e statistica: variabili aleatorie, test d'ipotesi, correzione per test multipli.
- Algebra lineare: matrici, autovalori/autovettori, decomposizioni.
Utili ma non indispensabili (richiami forniti a lezione)
- Fondamenti di machine learning (regolarizzazione, validazione, metriche per dati sbilanciati).
- Nozioni di base di biologia molecolare e genomica: gene, trascritto, proteina, pathway, variante genetica.
Frequenza lezioni
Frequenza obbligatoria.
Le risorse principali messe a disposizione dello studente sono le lezioni frontali.
Per seguire meglio le lezioni, vengono messe a disposizione le slide utilizzate per il corso. Le slide non costituiscono un mezzo di studio: forniscono un dettaglio puntuale sugli argomenti trattati a lezione.
Contenuti del corso
Fondamenti.
- Dai dati tabellari ai dati relazionali.
- Caratterizzazione dei big data biomedici: volume, eterogeneità, sparsità, incompletezza non casuale, dinamica temporale.
- Panoramica dei casi studio che attraversano il corso: interattoma umano, diseasome, grafo farmaco–bersaglio–malattia, rete di similarità fra pazienti.
- Tassonomia dei problemi: predizione a livello di nodo, di arco, di sottografo, di grafo.
- Etica e governance dei dati sanitari come vincolo di progetto, non come appendice: GDPR e dati particolari, pseudonimizzazione e re-identificazione da strutture di grafo, principi FAIR.
Network science: struttura e modelli
- Rappresentazioni e strutture dati: liste di adiacenza, formati per grafi sparsi; grafi diretti, pesati, bipartiti, multilayer, multiplex, temporali.
- Misure locali e globali: distribuzione del grado, coefficiente di clustering, assortatività, distanze e diametro.
- Centralità: grado, betweenness, closeness, autovettore, PageRank, k-core; interpretazione biologica (essenzialità, bottleneck, geni driver) e limiti.
- Reti scale-free e small-world: modelli di Erdős–Rényi, Watts–Strogatz, Kleinberg, Barabási–Albert, configuration model; stima corretta dell'esponente di potenza e il dibattito sulla reale ubiquità delle reti scale-free.
- Modelli nulli: randomizzazione che preserva il grado, switching algorithm, campionamento di grafi con vincoli.
- Robustezza, percolazione, attacchi mirati vs. casuali; cenni di controllabilità strutturale delle reti.
- Motivi e graphlet; conteggio approssimato di triangoli.
Comunità, moduli e processi di diffusione
- Modularità e limiti; Algoritmi di Louvain e Leiden.
- Clustering spettrale, Laplaciano normalizzato, conduttanza; Stochastic Block Model e sua versione degree-corrected.
- Comunità sovrapposte e gerarchiche (clique percolation, Infomap, dendrogrammi); consensus clustering e stabilità.
- Validazione: indici di concordanza, arricchimento funzionale (GO, Reactome, KEGG) con controllo del FDR.
- Diffusione e propagazione: random walk, random walk with restart, PageRank personalizzato, diffusion kernel, heat kernel; formulazione algebrica e soluzione iterativa vs. diretta; power iteration.
- Propagazione dell'informazione come strumento di prioritizzazione: da un insieme di geni seed al ranking dell'intera rete.
Scalabilità e apprendimento su grafi
- Modelli di dati per grafi: property graph vs. RDF; Cypher e SPARQL;
- graph database (Neo4j).
- Modelli di programmazione: Spark GraphX/GraphFrames, Pregel API, esecuzione di PageRank e connected components distribuiti.
- Partizionamento dei grafi (edge-cut vs. vertex-cut), sbilanciamento indotto dalle code pesanti della distribuzione del grado.
- Algoritmi approssimati e in streaming: sketching HyperLogLog per la stima della cardinalità, Count-Min, MinHash/LSH, campionamento di grafi (node/edge/forest fire, random walk sampling) e distorsioni introdotte.
- Distanze approssimate; conteggio approssimato di motivi.
- Machine learning su grafi
- Embedding di nodi: fattorizzazione di matrici di prossimità, DeepWalk e node2vec, LINE; metapath2vec per grafi eterogenei; proprietà e limiti (trasduttività, instabilità, bias di grado).
- Graph Neural Networks: schema di message passing; GCN, GraphSAGE, GAT, GIN; oversmoothing, profondità, normalizzazione; mini-batching e campionamento dei vicinati per grafi grandi.
- Grafi eterogenei e relazionali: R-GCN, HGT; knowledge graph embedding: TransE, DistMult, ComplEx, RotatE; scoring, negative sampling.
- Task: node classification, link prediction, graph classification, regressione su grafo.
- Valutazione: split trasduttivi vs. induttivi, leakage attraverso archi condivisi, split temporali e per entità (per farmaco, per malattia), scelta dei negativi, metriche appropriate per estremo sbilanciamento (AUPRC, recall@k).
- Interpretabilità: GNNExplainer, PGExplainer.
- Cenni ai graph foundation model e al pre-training su grafi biomedici.
Network Medicine: Interattoma e disease module
- Richiamo compatto di biologia molecolare per informatici: dal genoma al fenotipo, pathway, tipi di interazione.
- L'interattoma umano: sorgenti e loro natura (Y2H sistematico e HuRI, co-complex/AP-MS, letteratura curata, pathway database, predizioni computazionali); bias di studio, incompletezza e come cambia il risultato al variare della rete usata.
- I postulati della Network Medicine: ipotesi del modulo di malattia, ipotesi del pathway locale, ipotesi della malattia come sottorete perturbata.
- Localizzazione dei geni di malattia nell'interattoma; significatività della connettività osservata rispetto a modelli nulli degree-preserving.
- Identificazione dei moduli: metodi seed-and-extend (DIAMOnD), Steiner tree e alberi di connessione minimi, approcci basati su propagazione, metodi diffusion-based.
- Metriche di prossimità e separazione fra insiemi di geni: separazione di rete, prossimità più vicina/centro; interpretazione delle relazioni malattia–malattia e delle comorbidità osservate nei dati clinici.
- Il diseasome e le reti malattia–gene; integrazione con GWAS, rare varianti, espressione tessuto-specifica.
Network Medicine: Farmacologia di rete e drug repurposing
- Reti farmaco–bersaglio, polifarmacologia, il superamento del paradigma "un farmaco–un bersaglio".
- Repurposing basato sulla prossimità di rete: quantificare la distanza fra il modulo bersaglio del farmaco e il modulo di malattia; protocolli di validazione retrospettiva e controlli necessari.
- Approcci basati su firme trascrizionali e signature reversion (CMap/LINCS); integrazione con l'evidenza di rete.
- Combinazioni farmacologiche: teoria dell'esposizione complementare, sinergia e antagonismo in chiave topologica.
- Predizione degli effetti avversi e delle interazioni fra farmaci come link prediction su grafi multi-relazionali (approccio Decagon); risorse SIDER/OFFSIDES.
- Piattaforme e modelli attuali: NeDRex, Hetionet/Rephetio, TxGNN e i modelli fondazionali per il repurposing; letteratura 2025–2026 su knowledge graph e GNN per il repurposing e su modelli fondazionali di network medicine.
- Dall'ipotesi computazionale all'evidenza: cosa serve perché un candidato arrivi a una validazione sperimentale o a un trial; come si legge criticamente un claim di repurposing.
- Reti di co-espressione e WGCNA: soft thresholding, moduli, eigengene, correlazione con i tratti.
- Inferenza di reti regolative geniche: metodi basati su informazione mutua e su alberi (GENIE3/GRNBoost2), SCENIC, approcci causali; cosa dicono i benchmark (BEELINE e successivi) sull'affidabilità reale di questi metodi; sviluppi 2025–2026 basati su modelli fondazionali single-cell e graph contrastive learning.
- Single-cell: reti cellula-specifica, comunicazione cellula–cellula (ligando–recettore), reti su dati spaziali.
- Integrazione multi-omica come problema su reti multilayer: Similarity Network Fusion, approcci a fattori latenti, allineamento fra layer.
- Reti di similarità fra pazienti e stratificazione: costruzione della similarità, clustering, associazione con outcome clinici; validazione su coorte indipendente.
- Grafi derivati da dati clinici reali: EHR come grafo paziente–diagnosi–farmaco–procedura (MIMIC-IV), knowledge graph fenotipici (HPO, UMLS), reti di comorbidità a livello di popolazione.
- LLM e knowledge graph: GraphRAG e agenti su knowledge graph biomedici per question answering clinico e verifica della sicurezza farmacologica; punti di forza e rischi.
- Cenni alle reti del microbioma e alle reti di interazione ospite–patogeno.
Riproducibilità, privacy e valutazione critica
- Riproducibilità di una pipeline su grafi: versionamento dei dati e delle risorse (le release di STRING/DrugBank cambiano i risultati), seed, ambienti, tracciamento degli esperimenti.
- Privacy: re-identificazione a partire da strutture di grafo, anonimizzazione di grafi e sue debolezze, federated e privacy-preserving graph learning in contesto clinico.
- Bias ed equità: chi è rappresentato nelle coorti e nei database di interazione, e come il bias si propaga in un ranking.
- Regolamentazione: GDPR e spazio europeo dei dati sanitari, cenni all'AI Act per i sistemi di supporto alle decisioni cliniche.
- Sessione di lettura critica: analisi collettiva di due articoli, uno metodologico e uno applicativo.
Testi di riferimento
- A.-L. Barabási, Network Science, Cambridge University Press, 2016. disponibile gratuitamente online.
- J. Loscalzo, A.-L. Barabási, E. K. Silverman (eds.), Network Medicine: Complex Systems in Human Disease and Therapeutics, Harvard University Press, 2017
- W. L. Hamilton, Graph Representation Learning, Morgan & Claypool, 2020 disponibile gratuitamente online.
- J. Leskovec, A. Rajaraman, J. D. Ullman, Mining of Massive Datasets, 3ª ed., Cambridge University Press disponibile gratuitamente online. Capitoli su sketching, LSH e link analysis.
- M. Newman, Networks, 2ª ed., Oxford University Press, 2018. Testo di Approfondimento.
Programmazione del corso
| Argomenti | Riferimenti testi | |
|---|---|---|
| 1 | Network science: struttura e modelli | |
| 2 | Comunità, moduli e processi di diffusione | |
| 3 | Scalabilità e apprendimento su grafi | |
| 4 | Machine learning su grafi | |
| 5 | · Network Medicine: Interattoma e disease module | |
| 6 | Network Medicine: Farmacologia di rete e drug repurposing | |
| 7 | Network Medicine: Multi-omica, single-cell e reti cliniche |
Verifica dell'apprendimento
Modalità di verifica dell'apprendimento
Valutazione
- Progetto finale (codice + relazione): 65%
- Discussione orale del progetto e domande sul programma 30%
- Due consegne intermedie di laboratorio (Lab 4 e Lab 5) 5%
Lo studente (individualmente o in coppia, su richiesta) sviluppa una pipeline completa su un problema concreto, scelto da un elenco proposto dal docente o proposto autonomamente e approvato.
Requisiti minimi
- Costruzione o integrazione di almeno due sorgenti dati eterogenee in un'unica struttura a grafo, con documentazione delle scelte di mapping degli identificatori.
- Una domanda scientifica o clinica formulata in modo verificabile.
- Applicazione di almeno un metodo topologico e almeno un metodo di apprendimento su grafi, con confronto.
- Un modello nullo o baseline esplicito e una valutazione con protocollo giustificato (split, metriche, incertezza).
- Analisi di sensibilità ad almeno una scelta arbitraria della pipeline (versione della rete, soglia, risoluzione, seed)
- Repository riproducibile (codice, ambiente, istruzioni) e relazione di 6–10 pagine.
La verifica dell’apprendimento potrà essere effettuata anche per via telematica, qualora le condizioni lo dovessero richiedere.
Il voto è espresso su una scala di trenta, fino a un massimo di 30/30 e lode.
Per l'assegnazione del voto finale si terrà conto dei seguenti parametri:
- Punteggio 29-30 e lode: Lo studente dimostra una conoscenza approfondita degli argomenti, integra prontamente e correttamente e analizza criticamente le situazioni presentate, risolvendo autonomamente problemi anche molto complessi. Possiede ottime capacità comunicative e padroneggia con competenza il linguaggio medico-scientifico.
- Punteggio 26-28: Lo studente ha una buona comprensione degli argomenti, è in grado di integrare e analizzare criticamente e logicamente le situazioni presentate, è in grado di risolvere in modo abbastanza indipendente problemi complessi e presenta gli argomenti in modo chiaro utilizzando un linguaggio medico-scientifico appropriato.
- Punteggio 22-25: Lo studente ha una discreta comprensione degli argomenti, anche se limitata alle aree principali. È in grado di integrare e analizzare criticamente le situazioni presentate, anche se non sempre in modo lineare, e presenta gli argomenti in modo abbastanza chiaro con una moderata competenza linguistica.
- Punteggio 18-21: Lo studente ha una conoscenza minima degli argomenti, possiede una modesta capacità di integrare e analizzare criticamente le situazioni presentate e presenta gli argomenti in modo sufficientemente chiaro, sebbene la sua competenza linguistica possa essere poco sviluppata.
- Esame non superato:Lo studente non ha la conoscenza minima richiesta dei contenuti fondamentali del corso. La capacità di usare un linguaggio specifico è minima o inesistente e lo studente non è in grado di applicare autonomamente le conoscenze acquisite.
Gli studenti con disabilità e/o DSA dovranno contattare con sufficiente anticipo rispetto alla data dell'esame il docente e il referente CInAP DMI per comunicare che intendono sostenere l'esame fruendo delle opportune misure compensative.
Esempi di domande e/o esercizi frequenti
Esempi:
- Prioritizzazione di geni candidati per una malattia rara mediante propagazione su interattoma , con validazione associazioni scoperte dopo una data di cutoff.
- Stratificazione di una coorte TCGA con integrazione multi-omica su rete multilayer e associazione con la sopravvivenza.
- Valutazione di un approccio GraphRAG su un knowledge graph biomedico per un insieme di domande cliniche, con misura della fedeltà alla provenienza.