Motivazione e contesto
Contesto di riferimento
- Transizione del settore automotive verso la riduzione delle emissioni
- Normative ambientali e incentivi in aumento
Obiettivo della ricerca
- Fattori socio-demografici che influenzano l'acquisto di veicoli elettrici
- Variabili chiave nelle decisioni di acquisto
Implicazioni
- Strategie di marketing per la mobilità elettrica
- Politiche pubbliche a favore della sostenibilità
Il dataset
Fonte: Sociodemographic data for BEV owning households in California dell'UC Davis, derivato dalla ricerca Understanding the Early Adopters of Fuel Cell Vehicles di Scott Hardman. Dai 27.021 casi e 27 variabili originali, con molti valori mancanti, la pulizia (OpenRefine e Python) ha portato a casi e 16 variabili, divise in 5 gruppi.
Tutti i rispondenti guidano già un veicolo a basse emissioni: il un BEV, gli altri soprattutto PHEV. La variabile dipendente (BEV dummy) distingue quindi chi è passato all'elettrico puro da chi ha scelto un'alimentazione intermedia.
- Genere
- Classe d'età
- Classe di reddito
- Livello di istruzione
- Casa di proprietà
- Casa indipendente
- Persone in famiglia
- Auto in famiglia
- Importanza di ridurre le emissioni di gas serra
- Tipologia di auto attuale
- Tipologia di auto precedente
- Viaggio più lungo (12 mesi)
- Viaggi oltre 200 miglia
- Distanza casa-lavoro
- VMT annuo
Metodologia
L'analisi si articola in due parti: le analisi statistiche, per comprendere i dati e le relazioni tra le variabili, e le analisi predittive, per identificare il profilo del consumatore di un veicolo elettrico.
I. Analisi statistiche
- Statistiche descrittive e analisi bivariata
- Regressione logistica e ipotesi di ricerca
- Analisi esplorative: PCA, MCA, FAMD
- Cluster: K-Mode, verificato con K-Means e gerarchico
II. Analisi predittive
- Machine learning: 15 algoritmi, ottimizzazione degli iperparametri
- Interpretabilità con SHAP
- Deep learning: reti neurali artificiali
- Dashboard di predizione
1. Analisi statistica
1.1Statistiche descrittive
Le variabili di percorrenza sono molto asimmetriche: pochi rispondenti percorrono distanze molto superiori alla mediana. Per questo nei confronti tra gruppi si usano test non parametrici.
1.2Analisi bivariata
Quota di possessori di BEV nelle diverse categorie. Il reddito ha il gradiente più netto; l'auto precedente separa nettamente chi aveva già un BEV.
La linea tratteggiata è la quota media del campione ().
1.3Regressione logistica
Il modello include tutte le variabili, con le categorie di riferimento indicate tra parentesi. Il VIF massimo è , quindi non c'è multicollinearità rilevante. Lo pseudo-R² di McFadden è : le variabili spiegano solo una parte della scelta.
Gli effetti marginali medi traducono gli odds ratio in punti percentuali di probabilità: ad esempio, a parità di altre caratteristiche, chi aveva già un BEV ha una probabilità di possederne un altro più alta di circa punti rispetto a chi aveva una PHEV.
1.4Ipotesi di ricerca
H2.2 è esplorativa: non c'è una direzione attesa. Rispetto alla PHEV, aver avuto un'auto ICE aumenta le odds di BEV ( volte); HEV e GNC non hanno un effetto significativo.
2. Analisi esplorativa
Le analisi multivariate sono svolte sui possessori di BEV, per sintetizzare le loro caratteristiche in pochi indici da usare nel clustering. Sono state eseguite sia in R (FactoMineR) sia in Python, con risultati coincidenti.
2.1PCA sulle variabili di mobilità
Le prime due componenti spiegano il % della varianza. PC1 cresce con tutte le percorrenze (indice Viaggi PCA); PC2 oppone i viaggi lunghi agli spostamenti quotidiani (Mobilità quotidiana PCA). L'alpha di Cronbach () indica che le quattro variabili misurano aspetti diversi della mobilità.
2.2MCA tematiche
Tre analisi delle corrispondenze multiple, una per gruppo di variabili categoriali. Le prime due dimensioni di ciascuna diventano indici sintetici. I grafici mostrano le categorie che contribuiscono di più a ogni dimensione.
2.3FAMD
L'analisi fattoriale per dati misti considera insieme variabili quantitative e categoriali. La varianza è molto distribuita: le prime due dimensioni ne spiegano solo il %.
3. Cluster
Il clustering cerca gruppi omogenei di possessori di BEV. Come nella tesi, la segmentazione finale usa il K-Mode sulle variabili categoriali; il K-Means sugli indici compositi e il clustering gerarchico servono da verifica.
3.1K-Mode: la segmentazione finale
Il K-Mode raggruppa i rispondenti in base alla distanza di Hamming (il numero di caratteristiche diverse) e rappresenta ogni cluster con la modalità più frequente di ciascuna variabile. Con k = 4 emergono quattro profili, tutti dominati da uomini laureati, proprietari di casa indipendente, che arrivano da un'auto tradizionale e hanno una sensibilità ambientale molto alta: si distinguono per composizione familiare, reddito, età e mobilità.
Profili descrittivi, non gruppi naturali. Molte partizioni hanno un costo quasi uguale (qui ): ripetendo il K-Mode con semi diversi i gruppi cambiano (ARI medio , dove 1 indica partizioni identiche). Per questo si tiene la soluzione a costo minimo su 50 inizializzazioni, e i profili vanno letti come segmenti di mercato tipici.
Confronto R / Python. Questa instabilità spiega le differenze tra R e Python già notate nella tesi. Con le stesse 14 variabili:
- R (klaR, migliore di 20 avvii): costo , cluster di persone;
- Python (kmodes, 50 inizializzazioni): costo , cluster di ;
- tesi: cluster di 1.438 / 1.270 / 1.473 / 1.615.
Costi quasi uguali, gruppi diversi. Alcuni tratti però tornano sia in R sia in Python: un gruppo di coppie con VMT basso e uno di famiglie con 2 figli, 3 auto e pendolarismo lungo. Cambia invece la suddivisione per reddito, età e numero di viaggi.
Il costo cala in modo regolare, senza un gomito evidente: k = 4 è stato scelto, come nella tesi, per avere profili ancora interpretabili.
3.2Verifica con il K-Means
Il K-Means lavora su età, indici compositi (stile di vita, dimensione familiare, mobilità) e tipo di auto precedente. Il gomito si colloca a k = 4, dove la silhouette supera 0,40.
Silhouette e stabilità molto alta (ARI medio su campioni bootstrap ). La composizione mostra però che i cluster coincidono quasi perfettamente con il tipo di auto precedente (Adjusted Rand Index , dove 1 è coincidenza totale): le variabili binarie sull'auto precedente dominano la distanza. È il motivo per cui nella tesi il K-Means è stato scartato a favore del K-Mode, con cui non ha nulla in comune (ARI ).
3.3K-Means senza l'auto precedente
Ripetendo il K-Means senza le variabili sull'auto precedente, aggiungendo status socioeconomico e sensibilità ambientale, la silhouette scende a (stabilità ). Anche così non emerge una struttura a gruppi netta, coerentemente con quanto mostra il K-Mode.
3.4Clustering gerarchico
Il clustering gerarchico (metodo di Ward) sulle variabili del K-Means conferma la stessa partizione (ARI con il K-Means , correlazione cofenetica ).
4. Machine learning
Obiettivo: prevedere se il veicolo di un rispondente è un BEV. I dati sono divisi una sola volta in training () e test (), con la stessa quota di BEV. Ogni modello è una pipeline (standardizzazione + algoritmo) addestrata solo sul training; il test è usato una sola volta, alla fine.
4.1Screening degli algoritmi
15 algoritmi con iperparametri di default, valutati in cross-validation a 10 fold sul training. Gli ensemble ad alberi sono in testa.
4.2Ottimizzazione degli iperparametri
I modelli migliori sono ottimizzati con una ricerca casuale degli iperparametri (RandomizedSearchCV, 5 fold, metrica ROC-AUC). Una variante del Gradient Boosting sceglie anche il numero di variabili (ne tiene ). Il Voting Classifier combina i tre modelli migliori.
4.3Risultati sul test set
Il migliore è , con ROC-AUC (IC 95% ) e accuracy . Gli intervalli dei primi sei modelli si sovrappongono e il test di McNemar non trova differenze significative tra loro: sono di fatto equivalenti. La regressione logistica è nettamente inferiore.
4.4Curve ROC e calibrazione
4.5Le migliori feature
Il numero di viaggi oltre 200 miglia è la variabile più importante, seguita da miglia annue, reddito, esperienza precedente con un BEV e sensibilità ambientale: un quadro coerente con le ipotesi H1, H2.3, H3 e H4. Due misure diverse (SHAP e permutation importance) danno un ordine simile.
5. Deep learning
Reti neurali artificiali (Keras) addestrate sullo stesso split dei modelli di machine learning. L'addestramento si ferma quando la metrica su un set di validazione, estratto dal training, smette di migliorare (early stopping), e il learning rate si riduce quando la loss si stabilizza (ReduceLROnPlateau).
La ANN avanzata riproduce il modello finale della tesi: feature polinomiali di grado 2, attivazione LeakyReLU, regolarizzazione L1 + L2 (ElasticNet), BatchNormalization sull'ultimo strato nascosto e ottimizzatore AdamW. Nella tesi il set di validazione coincideva con il test set; qui è estratto dal training, quindi le metriche sul test sono una stima corretta: accuracy , ROC-AUC .
5.1Architetture
5.2Addestramento
5.3Confronto con il machine learning
La rete migliore raggiunge una ROC-AUC di , sotto gli ensemble ad alberi (). Su dati tabellari di questa dimensione le reti neurali non portano vantaggi: la rete avanzata, con quasi 30 volte i parametri della rete regolarizzata, non migliora la ROC-AUC. Le feature polinomiali aumentano la complessità senza aggiungere informazione.
Limiti e conclusioni
Limiti della ricerca
Contesto geografico
Il campione riguarda solo la California e solo chi possiede già un veicolo a basse emissioni.
Capacità esplicativa contenuta
Pseudo-R² di McFadden e ROC-AUC massima : le variabili disponibili spiegano solo una parte della scelta.
Variabili mancanti
Mancano variabili psicologiche e culturali e misure concrete dell'attitudine verso la sostenibilità.
Segmentazione debole
I profili del K-Mode cambiano con il seed e il K-Means, senza l'auto precedente, non trova gruppi netti: i segmenti sono descrittivi. Anche gli indici di mobilità hanno bassa coerenza interna.
Conclusioni
Fattori influenti
Reddito, miglia percorse in un anno e numero di viaggi lunghi influenzano in modo significativo la scelta di un BEV; conta anche la sensibilità ambientale.
Il passaggio non è graduale
Chi arriva da un'auto tradizionale sceglie il BEV più spesso di chi aveva una PHEV: l'ibrido plug-in non fa da ponte.
Transizione culturale, non solo tecnologica
L'autonomia pesa (i viaggi lunghi frenano il BEV), ma l'adozione richiede anche un cambiamento culturale sostenuto da politiche mirate.
Dashboard predittiva
Uno strumento pratico per stimare la propensione al BEV di un profilo e spiegare quali caratteristiche la spostano.