Adozione dei veicoli elettrici

Analisi data-driven per l'adozione di veicoli elettrici

Analisi statistiche e predittive sugli acquirenti di auto elettriche

Laureando
Gamberini Federico
mat. 178147

Università degli Studi di Modena e Reggio Emilia
Dipartimento di Comunicazione ed Economia

Corso di Laurea Magistrale in Management
e Comunicazione d'Impresa
A.A. 2023/2024
Relatore:
Prof. Cavicchioli Roberto

Motivazione e contesto

Contesto di riferimento

  • Transizione del settore automotive verso la riduzione delle emissioni
  • Normative ambientali e incentivi in aumento

Obiettivo della ricerca

  • Fattori socio-demografici che influenzano l'acquisto di veicoli elettrici
  • Variabili chiave nelle decisioni di acquisto

Implicazioni

  • Strategie di marketing per la mobilità elettrica
  • Politiche pubbliche a favore della sostenibilità

Il dataset

Fonte: Sociodemographic data for BEV owning households in California dell'UC Davis, derivato dalla ricerca Understanding the Early Adopters of Fuel Cell Vehicles di Scott Hardman. Dai 27.021 casi e 27 variabili originali, con molti valori mancanti, la pulizia (OpenRefine e Python) ha portato a casi e 16 variabili, divise in 5 gruppi.

Tutti i rispondenti guidano già un veicolo a basse emissioni: il un BEV, gli altri soprattutto PHEV. La variabile dipendente (BEV dummy) distingue quindi chi è passato all'elettrico puro da chi ha scelto un'alimentazione intermedia.

Socio-demografiche
  • Genere
  • Classe d'età
  • Classe di reddito
  • Livello di istruzione
Abitative
  • Casa di proprietà
  • Casa indipendente
  • Persone in famiglia
  • Auto in famiglia
Sensibilità ambientale
  • Importanza di ridurre le emissioni di gas serra
Classe veicolare
  • Tipologia di auto attuale
  • Tipologia di auto precedente
Mobilità e percorrenza
  • Viaggio più lungo (12 mesi)
  • Viaggi oltre 200 miglia
  • Distanza casa-lavoro
  • VMT annuo

Metodologia

L'analisi si articola in due parti: le analisi statistiche, per comprendere i dati e le relazioni tra le variabili, e le analisi predittive, per identificare il profilo del consumatore di un veicolo elettrico.

I. Analisi statistiche

  • Statistiche descrittive e analisi bivariata
  • Regressione logistica e ipotesi di ricerca
  • Analisi esplorative: PCA, MCA, FAMD
  • Cluster: K-Mode, verificato con K-Means e gerarchico

II. Analisi predittive

  • Machine learning: 15 algoritmi, ottimizzazione degli iperparametri
  • Interpretabilità con SHAP
  • Deep learning: reti neurali artificiali
  • Dashboard di predizione
I. Analisi statistiche

1. Analisi statistica

1.1Statistiche descrittive

Le variabili di percorrenza sono molto asimmetriche: pochi rispondenti percorrono distanze molto superiori alla mediana. Per questo nei confronti tra gruppi si usano test non parametrici.

1.2Analisi bivariata

Quota di possessori di BEV nelle diverse categorie. Il reddito ha il gradiente più netto; l'auto precedente separa nettamente chi aveva già un BEV.

Per classe di reddito
Per auto precedente
Per classe d'età
Per livello di istruzione

La linea tratteggiata è la quota media del campione ().

Forza dell'associazione con il possesso di un BEV
categoriale (V di Cramér)numerica (r rank-biserial, valore assoluto)
Chi-quadro per le variabili categoriali, Mann-Whitney per le numeriche: tutte le associazioni sono significative, ma deboli (sotto 0,2).

1.3Regressione logistica

Il modello include tutte le variabili, con le categorie di riferimento indicate tra parentesi. Il VIF massimo è , quindi non c'è multicollinearità rilevante. Lo pseudo-R² di McFadden è : le variabili spiegano solo una parte della scelta.

Odds ratio con intervallo di confidenza al 95%
significativo (p < 0,05)non significativo
Scala logaritmica: a destra di 1 la caratteristica aumenta le probabilità di possedere un BEV, a sinistra le riduce.

Gli effetti marginali medi traducono gli odds ratio in punti percentuali di probabilità: ad esempio, a parità di altre caratteristiche, chi aveva già un BEV ha una probabilità di possederne un altro più alta di circa punti rispetto a chi aveva una PHEV.

Effetti marginali medi (punti percentuali)
Variazione media della probabilità di possedere un BEV, con IC 95%. Sono mostrati solo gli effetti significativi.

1.4Ipotesi di ricerca

H2.1 non è supportata. Si ipotizzava che la PHEV facesse da "ponte" verso l'elettrico puro. A parità di altre caratteristiche, chi aveva una PHEV ha invece odds di possedere un BEV volte quelle di chi aveva un'auto tradizionale (ICE).
H2.2 è esplorativa: non c'è una direzione attesa. Rispetto alla PHEV, aver avuto un'auto ICE aumenta le odds di BEV ( volte); HEV e GNC non hanno un effetto significativo.
I. Analisi statistiche

2. Analisi esplorativa

Le analisi multivariate sono svolte sui possessori di BEV, per sintetizzare le loro caratteristiche in pochi indici da usare nel clustering. Sono state eseguite sia in R (FactoMineR) sia in Python, con risultati coincidenti.

2.1PCA sulle variabili di mobilità

Le prime due componenti spiegano il % della varianza. PC1 cresce con tutte le percorrenze (indice Viaggi PCA); PC2 oppone i viaggi lunghi agli spostamenti quotidiani (Mobilità quotidiana PCA). L'alpha di Cronbach () indica che le quattro variabili misurano aspetti diversi della mobilità.

Varianza spiegata
per componentecumulata
Loadings

2.2MCA tematiche

Tre analisi delle corrispondenze multiple, una per gruppo di variabili categoriali. Le prime due dimensioni di ciascuna diventano indici sintetici. I grafici mostrano le categorie che contribuiscono di più a ogni dimensione.

2.3FAMD

L'analisi fattoriale per dati misti considera insieme variabili quantitative e categoriali. La varianza è molto distribuita: le prime due dimensioni ne spiegano solo il %.

Varianza spiegata dalle prime 10 dimensioni
per dimensionecumulata
Contributi alla dimensione 1 (%)
Contributi alla dimensione 2 (%)
I. Analisi statistiche

3. Cluster

Il clustering cerca gruppi omogenei di possessori di BEV. Come nella tesi, la segmentazione finale usa il K-Mode sulle variabili categoriali; il K-Means sugli indici compositi e il clustering gerarchico servono da verifica.

3.1K-Mode: la segmentazione finale

Il K-Mode raggruppa i rispondenti in base alla distanza di Hamming (il numero di caratteristiche diverse) e rappresenta ogni cluster con la modalità più frequente di ciascuna variabile. Con k = 4 emergono quattro profili, tutti dominati da uomini laureati, proprietari di casa indipendente, che arrivano da un'auto tradizionale e hanno una sensibilità ambientale molto alta: si distinguono per composizione familiare, reddito, età e mobilità.

Modalità più frequenti per cluster (k = 4)

Profili descrittivi, non gruppi naturali. Molte partizioni hanno un costo quasi uguale (qui ): ripetendo il K-Mode con semi diversi i gruppi cambiano (ARI medio , dove 1 indica partizioni identiche). Per questo si tiene la soluzione a costo minimo su 50 inizializzazioni, e i profili vanno letti come segmenti di mercato tipici.

Confronto R / Python. Questa instabilità spiega le differenze tra R e Python già notate nella tesi. Con le stesse 14 variabili:

  • R (klaR, migliore di 20 avvii): costo , cluster di persone;
  • Python (kmodes, 50 inizializzazioni): costo , cluster di ;
  • tesi: cluster di 1.438 / 1.270 / 1.473 / 1.615.

Costi quasi uguali, gruppi diversi. Alcuni tratti però tornano sia in R sia in Python: un gruppo di coppie con VMT basso e uno di famiglie con 2 figli, 3 auto e pendolarismo lungo. Cambia invece la suddivisione per reddito, età e numero di viaggi.

K-Mode: costo per numero di cluster

Il costo cala in modo regolare, senza un gomito evidente: k = 4 è stato scelto, come nella tesi, per avere profili ancora interpretabili.

3.2Verifica con il K-Means

Il K-Means lavora su età, indici compositi (stile di vita, dimensione familiare, mobilità) e tipo di auto precedente. Il gomito si colloca a k = 4, dove la silhouette supera 0,40.

Metodo del gomito (WSS)
Silhouette media

Silhouette e stabilità molto alta (ARI medio su campioni bootstrap ). La composizione mostra però che i cluster coincidono quasi perfettamente con il tipo di auto precedente (Adjusted Rand Index , dove 1 è coincidenza totale): le variabili binarie sull'auto precedente dominano la distanza. È il motivo per cui nella tesi il K-Means è stato scartato a favore del K-Mode, con cui non ha nulla in comune (ARI ).

Composizione dei cluster per auto precedente

3.3K-Means senza l'auto precedente

Ripetendo il K-Means senza le variabili sull'auto precedente, aggiungendo status socioeconomico e sensibilità ambientale, la silhouette scende a (stabilità ). Anche così non emerge una struttura a gruppi netta, coerentemente con quanto mostra il K-Mode.

3.4Clustering gerarchico

Il clustering gerarchico (metodo di Ward) sulle variabili del K-Means conferma la stessa partizione (ARI con il K-Means , correlazione cofenetica ).

II. Analisi predittive

4. Machine learning

Obiettivo: prevedere se il veicolo di un rispondente è un BEV. I dati sono divisi una sola volta in training () e test (), con la stessa quota di BEV. Ogni modello è una pipeline (standardizzazione + algoritmo) addestrata solo sul training; il test è usato una sola volta, alla fine.

4.1Screening degli algoritmi

15 algoritmi con iperparametri di default, valutati in cross-validation a 10 fold sul training. Gli ensemble ad alberi sono in testa.

ROC-AUC media in cross-validation (± 1 deviazione standard)

4.2Ottimizzazione degli iperparametri

I modelli migliori sono ottimizzati con una ricerca casuale degli iperparametri (RandomizedSearchCV, 5 fold, metrica ROC-AUC). Una variante del Gradient Boosting sceglie anche il numero di variabili (ne tiene ). Il Voting Classifier combina i tre modelli migliori.

4.3Risultati sul test set

Il migliore è , con ROC-AUC (IC 95% ) e accuracy . Gli intervalli dei primi sei modelli si sovrappongono e il test di McNemar non trova differenze significative tra loro: sono di fatto equivalenti. La regressione logistica è nettamente inferiore.

ROC-AUC sul test set con IC 95%
ensemble ad alberialtri modelli
Intervalli bootstrap con 1.000 ricampionamenti del test set.
Matrice di confusione:
Soglia 0,5. Il modello riconosce bene i BEV (recall alta) ma confonde una parte dei non BEV.
Test di McNemar rispetto al migliore

4.4Curve ROC e calibrazione

Curve ROC
Calibrazione delle probabilità
Punti vicini alla diagonale indicano probabilità affidabili.

4.5Le migliori feature

Il numero di viaggi oltre 200 miglia è la variabile più importante, seguita da miglia annue, reddito, esperienza precedente con un BEV e sensibilità ambientale: un quadro coerente con le ipotesi H1, H2.3, H3 e H4. Due misure diverse (SHAP e permutation importance) danno un ordine simile.

SHAP ()
Contributo assoluto medio alla predizione, in log-odds.
Permutation importance ()
Calo di ROC-AUC sul test quando la variabile viene rimescolata.
Togliendo la variabile "auto precedente BEV" la ROC-AUC passa da a : il modello non si limita a riconoscere chi ricompra un BEV.
II. Analisi predittive

5. Deep learning

Reti neurali artificiali (Keras) addestrate sullo stesso split dei modelli di machine learning. L'addestramento si ferma quando la metrica su un set di validazione, estratto dal training, smette di migliorare (early stopping), e il learning rate si riduce quando la loss si stabilizza (ReduceLROnPlateau).

La ANN avanzata riproduce il modello finale della tesi: feature polinomiali di grado 2, attivazione LeakyReLU, regolarizzazione L1 + L2 (ElasticNet), BatchNormalization sull'ultimo strato nascosto e ottimizzatore AdamW. Nella tesi il set di validazione coincideva con il test set; qui è estratto dal training, quindi le metriche sul test sono una stima corretta: accuracy , ROC-AUC .

5.1Architetture

5.2Addestramento

trainingvalidazione (tratteggiata)

5.3Confronto con il machine learning

La rete migliore raggiunge una ROC-AUC di , sotto gli ensemble ad alberi (). Su dati tabellari di questa dimensione le reti neurali non portano vantaggi: la rete avanzata, con quasi 30 volte i parametri della rete regolarizzata, non migliora la ROC-AUC. Le feature polinomiali aumentano la complessità senza aggiungere informazione.

Curve ROC
Metriche sul test set

Limiti e conclusioni

Limiti della ricerca

Contesto geografico

Il campione riguarda solo la California e solo chi possiede già un veicolo a basse emissioni.

Capacità esplicativa contenuta

Pseudo-R² di McFadden e ROC-AUC massima : le variabili disponibili spiegano solo una parte della scelta.

Variabili mancanti

Mancano variabili psicologiche e culturali e misure concrete dell'attitudine verso la sostenibilità.

Segmentazione debole

I profili del K-Mode cambiano con il seed e il K-Means, senza l'auto precedente, non trova gruppi netti: i segmenti sono descrittivi. Anche gli indici di mobilità hanno bassa coerenza interna.

Conclusioni

Fattori influenti

Reddito, miglia percorse in un anno e numero di viaggi lunghi influenzano in modo significativo la scelta di un BEV; conta anche la sensibilità ambientale.

Il passaggio non è graduale

Chi arriva da un'auto tradizionale sceglie il BEV più spesso di chi aveva una PHEV: l'ibrido plug-in non fa da ponte.

Transizione culturale, non solo tecnologica

L'autonomia pesa (i viaggi lunghi frenano il BEV), ma l'adozione richiede anche un cambiamento culturale sostenuto da politiche mirate.

Dashboard predittiva

Uno strumento pratico per stimare la propensione al BEV di un profilo e spiegare quali caratteristiche la spostano.