Report Regression
Stai vedendo l'anteprima delle prime pagine. Il file completo è gratis: registrati per leggerlo tutto.
Di cosa parla
- Il progetto affronta un problema di regressione per prevedere la qualità del vino analizzando un dataset con oltre 120 mila campioni descritti da variabili categoriche ad alta cardinalità e testo naturale.
- A causa dell'elevata dimensionalità delle categorie, sono state adottate tecniche avanzate come l'embedding Poincaré per le gerarchie geografiche e FastText per elaborare la descrizione testuale del vino.
- Per gestire i valori mancanti nelle variabili regionali e vinicole senza perdere informazioni strutturali, è stato sostituito il set di dati incompleto con una rappresentazione vettoriale aggregata basata sulla tassonomia gerarchica disponibile.
- Dopo aver valutato diversi algoritmi tra cui Random Forest ed Elastic Net, i modelli ensemble hanno dimostrato le migliori prestazioni raggiungendo un punteggio R2 superiore a 0.85 su dataset non visti durante l'addestramento.
- Il processo di ottimizzazione tramite grid search ha confermato che la combinazione di embedding geografici, encoding medio per categorie e previsioni testuali offre il miglior equilibrio tra accuratezza e generalizzazione del modello finale.
Questo appunto è gratis. Registrati in 30 secondi per leggere tutte le pagine e scaricarlo.