DATA SCIENCE NOTES
Stai vedendo l'anteprima delle prime pagine. Registrati per sbloccare le pagine restanti.
Di cosa parla
- La Data Science è un campo interdisciplinare che utilizza metodi scientifici e algoritmi per estrarre conoscenza da grandi dataset, distinguendosi dalla statistica tradizionale focalizzandosi sulla predizione e sull'azione piuttosto che solo sulla descrizione dei dati.
- I dati possono essere rappresentati come attributi numerici discreti o continui (intervallo o rapporto) oppure categoriali nominali o ordinali, richiedendo tecniche di codifica specifiche come l'one-hot encoding per gestire le variabili non numeriche nei modelli predittivi.
- La gestione dei valori mancanti richiede una distinzione tra casi Missing Completely at Random e altri tipi più complessi, permettendo strategie diverse che spaziano dalla semplice eliminazione delle righe a metodi avanzati di imputazione basati su regressione o massima verosimiglianza.
- L'esplorazione visiva dei dati attraverso grafici come istogrammi, box plot e scatter plot, unita a tecniche di riduzione della dimensionalità lineare (PCA) e non lineare (t-SNE), consente di analizzare distribuzioni complesse e proiettare spazi ad alta dimensione in 2D o 3D.
- Il processo di regressione lineare mira a minimizzare la somma dei residui quadratici per trovare i pesi ottimali, valutando le prestazioni del modello tramite metriche come il coefficiente di determinazione R² e utilizzando dataset separati di training e test per evitare l'overfitting.
- Le tecniche di normalizzazione sono essenziali quando gli attributi hanno scale diverse, poiché influenzano direttamente la convergenza degli algoritmi iterativi e i risultati dei clustering, mentre metodi come Winsorizing o trimming aiutano a gestire le anomalie estreme nei dataset.
Registrati e sblocca subito 3 appunti gratis, questo incluso.