Report
Stai vedendo l'anteprima delle prime pagine. Il file completo è gratis: registrati per leggerlo tutto.
Di cosa parla
- Il progetto affronta un problema di regressione per prevedere la qualità dei vini basandosi su attributi geografici e commerciali estratti da recensioni esperte, utilizzando un dataset diviso in set di sviluppo e valutazione con una proporzione del 25%.
- Nella fase di preelaborazione sono stati gestiti i valori mancanti preservando le informazioni geolocalizzate, eliminati duplicati nel set di addestramento e create nuove feature binarie per termini specifici come "sparkling" o "vintage".
- Per gestire l'alta cardinalità delle variabili categoriche è stato introdotto un valore artificiale "Other" basato su intervalli statistici, mentre le descrizioni testuali sono state elaborate tramite tecniche TF-IDF con n-grammi e parametri min/max di frequenza.
- Sono stati valutati diversi modelli di regressione tra cui Random Forest per la sua capacità di gestire dati complessi, Linear Regression come baseline semplice e metodi regolarizzati come Ridge e Lasso per ridurre l'overfitting.
- Il tuning degli iperparametri è stato eseguito tramite grid search ottimizzando prima le fasi di preelaborazione con un modello Random Forest e successivamente i parametri specifici dei vari algoritmi selezionati.
Questo appunto è gratis. Registrati in 30 secondi per leggere tutte le pagine e scaricarlo.