Audit Qualità Dataset
Carica un file CSV o JSON (max 5MB) e ottieni metriche di qualita' per colonna: valori mancanti, duplicati, outlier IQR, cardinalita', score 0-100 e raccomandazioni. 100% client-side, nessun dato inviato al server.
Carica Dataset
Trascina qui il tuo file CSV o JSON
oppure clicca per sfogliare - max 5MB
Come funziona
Carica il file
Trascina o seleziona un file CSV (con header) o JSON (array di oggetti). Max 5MB, elaborazione 100% nel browser.
Analisi automatica
Il tool inferisce il tipo di ogni colonna, rileva valori mancanti, duplicati, outlier IQR e calcola il rapporto di cardinalità.
Score e remediation
Ricevi uno score 0-100, i problemi critici prioritizzati e i passi correttivi da seguire prima di caricare il dataset in produzione.
Come utilizzare Dataset Quality Audit
Carica il file CSV o JSON
Trascina o seleziona un file .csv (con header) o .json (array di oggetti), fino a 5MB. Il file resta nel browser: nessun upload verso un server.
Analisi automatica per colonna
Il tool inferisce il tipo di ogni colonna e calcola valori mancanti, duplicati, outlier con metodo IQR e cardinality ratio.
Leggi lo score e i problemi critici
Ricevi uno score complessivo 0-100, la lista dei problemi critici prioritizzati e le statistiche di riepilogo (righe, colonne, duplicati, tempo di elaborazione).
Applica le raccomandazioni
Segui i passi correttivi suggeriti (es. gestione missing values, rimozione duplicati) prima di caricare il dataset in produzione o in una pipeline ML.
Suggerimenti
- Esegui l'audit prima di ogni training ML: un dataset con troppi missing values o outlier non gestiti può falsare le metriche del modello.
- Se una colonna ha cardinality ratio vicino a 1, verifica se è un identificativo da escludere dalle feature invece che dal training.
- I problemi critici (etichettati "CRITICO") vanno risolti per primi: incidono di più sullo score complessivo rispetto agli avvisi.
Domande frequenti
Come vengono rilevati gli outlier?
Per le colonne numeriche viene applicato il metodo IQR (Interquartile Range): un valore è considerato outlier se cade sotto Q1 - 1.5×IQR o sopra Q3 + 1.5×IQR, dove IQR = Q3 - Q1.
Cosa significa cardinality ratio?
È il rapporto tra valori unici e totale righe di una colonna. Un rapporto vicino a 1 (≥0.95) indica una colonna quasi-identificativa (es. ID, email), utile per capire se una colonna può fare da chiave primaria o va esclusa da feature ML.
Come viene calcolato lo score complessivo 0-100?
Lo score combina penalità per missing values (% per colonna), duplicati di riga, outlier rilevati e cardinalità anomala. Punteggi alti indicano un dataset pronto per l'uso, punteggi bassi segnalano problemi da correggere prima dell'analisi o del training.
I miei dati vengono caricati su un server esterno?
No. Tutta l'analisi (parsing, statistica, scoring) avviene 100% client-side tramite FileReader API: il file non lascia mai il tuo browser.
Che dimensione massima di file posso analizzare?
Il limite è 5MB per garantire un'analisi rapida direttamente nel browser. Per dataset più grandi, valuta un campionamento preliminare o strumenti Python (pandas-profiling, ydata-profiling).