Le tabelle di contingenza, o crosstab, sono strumenti essenziali nell’analisi statistica e di ricerca. Utilizzate in sondaggi, studi di mercato e analisi aziendali, permettono di esplorare le relazioni tra due o più variabili, offrendo una visione chiara e immediata dei dati.

Nel dettaglio, una  tabella di contingenza (o tabella incrociata) è una matrice che mostra la distribuzione delle frequenze di due o più variabili con almeno una variabile categoriale. Ogni cella dell’incrocio tra colonne e righe (Banner e Stubs) riporta il numero di osservazioni che rientrano in quella combinazione o la frequenza espressa in percentuale.

Ad esempio incrociando le variabili fascia d’età e titolo di studio potremmo osservare quante sono le persone del campione che nella fascia d’età 30-49 che hanno conseguito una laurea.

Esempio di tabella di contingenza:

In un’indagine abbiamo chiesto il grado di istruzione e la frequenza di utilizzo dei social media. È stata formulata l’ipotesi “il livello di istruzione è correlato alla frequenza d’uso dei social media”. Abbiamo quindi svolto l’indagine e raccolto i dati per conoscere il grado di istruzione e la frequenza di utilizzo dei social media. Dopo aver raccolto i dati possiamo quindi creare la tabella di contingenza impostando la variabile Grado di istruzione come Banner (Colonne) e la variabile Frequenza di utilizzo dei social media come Stubs (Righe). La tabella di contingenza mostrerà la distribuzione dei casi nelle varie categorie delle due variabili.

Tabella di contingenza

A seconda dello strumento utilizzato attiviamo l’opzione per eseguire lo Z-Test a coppie, un classico test statistico per evidenziare o verificare la correlazione fra più categorie di variabili categoriali.

Come interpretare i risultati del test?

Nell’esempio di seguito vediamo che nella colonna Scuole dell’obbligo, alla riga Poco, sono indicate le lettere B e C.
Questo significa che per chi ha un grado di istruzione delle scuole dell’obbligo, la probabilità che dichiari di passare poco tempo nei social è nettamente maggiore di chi ha un grado di istruzione “Superiori” (B) o un grado “Università” (C).
In questo esempio, emerge quindi una correlazione fra il grado di istruzione e il tempo dichiarato.

Intepretare i dati della tabella di contingenza

Come utilizzare il Chi-Quadro e p-value

Tuttavia per semplificare l’esempio precedente, abbiamo saltato il test di significatività statistica Chi-Quadro. Con questo test preliminare possiamo verificare ste la numerosità del campione e i risultati ottenuti possono darci risultati attribuibili al caso oppure ad una correlazione fra le variabili. In base al livello di confidenza della ricerca, generalmente impostata a 95% o 99%, è necessario verificare che il p-value risultante dal test Chi-Quadro sia rispettivamente inferiore a 0,05 (livello di confidenza al 95%) o 0,01 (livello di confidenza al 99%).

Ad esempio, se il p-value è superiore allo 0,05 significa che la differenza fra le categorie può essere data dal caso con una probabilità superiore al 5%, quindi superiore a quanto prestabilito dalla ricerca. Se invece il valore è inferiore a 0,05 la probabilità che la differenza fra le categorie sia determinata dal caso rientra nel margine di tolleranza della ricerca. Solo in questo caso potremmo considerare l’ipotesi iniziale “il livello di istruzione è correlato alla frequenza d’uso dei social media” come vera”.

Nel nostro esempio abbiamo un p-value ben al di sopra dello 0,05 e quindi l’ipotesi non può essere confermata.

Chi-Quadro e p-value

Quando usare le tabelle di contingenza?

Le tabelle incrociate sono utili in diversi contesti, specialmente quando si vuole:

  • Confrontare sottogruppi: analizzare come diverse categorie (es. età, genere, area geografica) influenzano le risposte o i comportamenti.
  • Individuare pattern nascosti: scoprire correlazioni o differenze significative tra variabili o categorie delle variabili. 
  • Semplificare dati complessi: rappresentare grandi insiemi di dati in modo comprensibile e visivo.
  • Effettuare analisi inferenziali: valutare l’associazione statistica tra variabili attraverso test come il Chi-Quadro, Z-test o Anova.


Esempi di utilizzo pratico:

  • Ricerche di mercato: capire se le preferenze di acquisto sono correlate al genere o alla fascia d’età. 
  • Sondaggi politici: analizzare la correlazione fra l’intenzione di voto e regione di residenza.
  • Customer satisfaction: verificare se la soddisfazione dei clienti è correlata al prodotto o al servizio acquistato.

Usare le Crosstab per l’analisi dei dati

Per ottenere il massimo dalle tabelle incrociate, è fondamentale seguire alcune buone pratiche che rendano i dati più chiari, leggibili e significativi. Il primo passo è scegliere con cura le variabili da analizzare, privilegiando quelle che potrebbero mostrare una relazione significativa. Selezionare variabili irrilevanti o troppo generiche potrebbe rendere la tabella poco utile o addirittura fuorviante, impedendo di individuare pattern interessanti.

Un altro aspetto cruciale è la chiarezza della tabella. È importante limitare il numero di categorie per evitare che la rappresentazione diventi troppo complessa e difficile da interpretare. Una tabella eccessivamente densa di informazioni rischia di confondere anziché chiarire i dati. Per agevolare la lettura, è essenziale considerare le frequenze assolute, ovvero il numero di risposte o osservazioni presenti in ogni cella. Tuttavia, i soli numeri assoluti potrebbero non essere sufficienti a individuare tendenze o differenze significative tra i gruppi. Per questo motivo, è utile includere percentuali di riga o colonna, che permettono di normalizzare i dati e confrontare facilmente le categorie tra loro. Ad esempio, se in un sondaggio il 60% dei rispondenti maschi ha preferito un determinato prodotto rispetto al 40% delle rispondenti femmine, questa informazione diventa molto più chiara espressa in termini percentuali piuttosto che con semplici numeri assoluti. Oltre a questo, i totali di riga e colonna forniscono il quadro complessivo delle osservazioni, aiutando a capire il peso di ciascun sottogruppo rispetto al totale dell’analisi.

Un altro passaggio essenziale nell’interpretazione delle tabelle incrociate è la verifica della significatività statistica dei risultati. Per farlo, come si è visto nell’esempio precedente, si possono utilizzare test statistici come il Chi-Quadro, stabilendo se le differenze osservate tra le categorie siano statisticamente rilevanti o semplicemente frutto del caso. Questo passaggio è cruciale per garantire che le conclusioni tratte dall’analisi abbiano una base solida.

Pro e contro delle tabelle di contingenza

PRO

Semplicità: sono facili da costruire e interpretare.
Chiarezza: presentano dati complessi in un formato visuale immediato.
Flessibilità: possono essere utilizzate in vari contesti e settori.
Strumenti di analisi avanzati: consentono di eseguire test statistici per validare le osservazioni.

CONTRO

Riduzione della complessità: rappresentano solo una parte del dataset e potrebbero semplificare eccessivamente relazioni complesse.
Problemi con variabili continue: funzionano meglio con variabili categoriali e richiedono il raggruppamento di variabili numeriche.
Sovraccarico di informazioni: se si usano troppe categorie, le tabelle possono diventare difficili da leggere.

Quali caratteristiche deve avere un buon strumento per l’analisi con tabelle di contingenza?

Le caratteristiche indispensabili per l’analisi con le Crosstab sono:

Bucket: consente di creare panieri ossia dei raggruppamenti di più categorie di una variabile. Ad esempio raggruppare le numerose regioni di una nazione in poche zone (nord, centro, sud) in modo da facilitare l’interpretazione e la lettura dei dati.
Questa funzionalità può essere utilizzata anche per creare categorie di variabili continue, cioè suddividere dati numerici in intervalli specifici per semplificarne l’analisi e la comprensione. Ad esempio, si può raggruppare l’età dei rispondenti in fasce, come 18-25 anni, 26-35 anni, 36-50 anni e oltre 50, invece di analizzare ogni singola età separatamente. Questo approccio permette di evidenziare trend generali e di rendere più chiara l’interpretazione dei dati, evitando una frammentazione eccessiva delle informazioni.

Variabili annidate: questa funzionalità permette di strutturare il Banner (colonne) in modo gerarchico, annidando due o più variabili all’interno di un’unica tabella incrociata. In pratica, ogni categoria della prima variabile viene suddivisa ulteriormente in base alle categorie della seconda variabile, e così via, creando un’analisi più dettagliata e stratificata.

Ad esempio, si può analizzare la variabile Grado di istruzione suddividendola per zone geografiche di una nazione. In questo modo, invece di vedere i livelli di istruzione aggregati per tutto il paese, si potrà osservare come si distribuiscono all’interno di ogni area geografica (Nord, Centro, Sud).

Variabili annidate in una tabella di contingenza

Test statistici: per garantire un’analisi approfondita e affidabile, è essenziale che lo strumento utilizzato offra la possibilità di eseguire diversi test statistici, tra cui Chi-Quadro, Z-Test e ANOVA. Questi test permettono di verificare se le relazioni osservate tra le variabili siano realmente significative o semplicemente dovute al caso, fornendo basi più solide per l’interpretazione dei dati.

L’ANOVA (Analisi della Varianza), di cui non abbiamo parlato in questo articolo, è particolarmente importante quando si vuole confrontare la media di una variabile numerica (continua) tra più gruppi distinti definiti da una variabile categoriale. Ad esempio, può essere utilizzata per analizzare se il livello di soddisfazione di un servizio varia in base alla fascia d’età o se il reddito medio differisce tra diverse regioni geografiche. Grazie all’ANOVA, è possibile determinare se esistono differenze statisticamente significative tra i gruppi e, in caso affermativo, approfondire quali gruppi si distinguono maggiormente.

Altre metriche statistiche: per un’analisi completa e approfondita, è fondamentale che lo strumento utilizzato fornisca una vasta gamma di statistiche descrittive, tra cui media, mediana, varianza e deviazione standard. Questi indicatori permettono di comprendere meglio la distribuzione dei dati e di individuare pattern significativi che potrebbero non emergere da una semplice lettura delle frequenze.

Gestione di stubs multipli: per condurre un’analisi approfondita dei dati raccolti in un’indagine, può essere necessario creare tabelle di contingenza per diverse variabili. Lo strumento ideale dovrebbe quindi offrire una gestione semplificata, consentendo di impostare più righe di variabili (stubs) da confrontare con lo stesso banner e di passare facilmente da una all’altra, mantenendo inalterate le impostazioni delle metriche.

Salvataggio intelligente e automatico: alcuni strumenti di ultima generazione gestiscono in modo automatico ed efficace i salvataggi, una caratteristica essenziale quando si lavora con molte crosstab, poiché garantisce un flusso di lavoro più flessibile e dinamico. Al contrario, i software più datati, richiedono continui salvataggi manuali su file esterni, la creazione preventiva di preset di impostazioni e metriche, e l’importazione manuale di dataset, rallentando notevolmente il flusso di lavoro e riducendo l’efficienza nell’analisi dei dati.

Esportazione avanzata delle tabelle di contingenza in Excel: la maggior parte dei software consente l’esportazione delle tabelle di contingenza in formato Excel, ma solo alcuni offrono una formattazione chiara e strutturata delle crosstab all’interno del file. Inoltre, solo gli strumenti più avanzati permettono l’esportazione simultanea di più crosstab, generando un file Excel composto da più fogli, contenente un numero virtualmente illimitato di tabelle di contingenza. Questi strumenti consentono quindi di esportare in un unico file l’analisi completa di tutte le tabelle di contingenza del progetto, ottimizzando la gestione e l’organizzazione dei dati.

Conclusioni sulle tabelle di contingenza

Le tabelle incrociate sono uno strumento potente e versatile nell’analisi dei dati, fondamentali per ricercatori, analisti e chiunque debba trarre insight da un sondaggio o un dataset complesso. Se usate correttamente, consentono di scoprire relazioni significative e facilitano decisioni strategiche basate su dati concreti.