Alberi di Decisione & Titanic Survival Predictor in Python

Introduzione al Progetto

Il notebook analizza una parte (6 variabili) del dataset “Titanic – Machine Learning from Disaster” (891 record, 12 variabili) e mostra come trasformare un dataset “classico” in un case study moderno:

  • Exploratory Data Analysis

    • Missing value map, distribuzioni per sesso, classe, età.

    • Verifica sbilanciamento (62 % non sopravvissuti).

  • Data Prep & Feature Engineering

    • Pipeline Scikit-learn con SimpleImputer, One-Hot e StandardScaler gestita da ColumnTransformer.

    • Tre strategie: A) drop columns, B) drop rows, C) imputazione mirata.

  • Model Selection & Tuning

    • Logistic Regression come baseline (CV stratificata 5 fold, acc ≈ 0,80).

    • Grid Search sui parametri di un Decision Tree Classifier bilanciato → best model con accuracy test = 0,764 e F1 = 0,699.

  • Interpretabilità

    • Permutation Importance per misurare l’impatto di età, titolo, classe e sesso sulla probabilità di salvezza.

Sommario

La mia analisi dati

CORRETTO_2_ML_Advanced_StefanoNocco

Il mio Portfolio