Salta al contenuto principale

Carica Dataset

Trascina qui il tuo file CSV o JSON

oppure clicca per sfogliare - max 5MB

Come funziona

Carica il file

Trascina o seleziona un file CSV (con header) o JSON (array di oggetti). Max 5MB, elaborazione 100% nel browser.

Analisi automatica

Il tool inferisce il tipo di ogni colonna, rileva valori mancanti, duplicati, outlier IQR e calcola il rapporto di cardinalità.

Score e remediation

Ricevi uno score 0-100, i problemi critici prioritizzati e i passi correttivi da seguire prima di caricare il dataset in produzione.

Come utilizzare Dataset Quality Audit

Carica il file CSV o JSON

Trascina o seleziona un file .csv (con header) o .json (array di oggetti), fino a 5MB. Il file resta nel browser: nessun upload verso un server.

Analisi automatica per colonna

Il tool inferisce il tipo di ogni colonna e calcola valori mancanti, duplicati, outlier con metodo IQR e cardinality ratio.

Leggi lo score e i problemi critici

Ricevi uno score complessivo 0-100, la lista dei problemi critici prioritizzati e le statistiche di riepilogo (righe, colonne, duplicati, tempo di elaborazione).

Applica le raccomandazioni

Segui i passi correttivi suggeriti (es. gestione missing values, rimozione duplicati) prima di caricare il dataset in produzione o in una pipeline ML.

Suggerimenti

  • Esegui l'audit prima di ogni training ML: un dataset con troppi missing values o outlier non gestiti può falsare le metriche del modello.
  • Se una colonna ha cardinality ratio vicino a 1, verifica se è un identificativo da escludere dalle feature invece che dal training.
  • I problemi critici (etichettati "CRITICO") vanno risolti per primi: incidono di più sullo score complessivo rispetto agli avvisi.

Domande frequenti

Come vengono rilevati gli outlier?

Per le colonne numeriche viene applicato il metodo IQR (Interquartile Range): un valore è considerato outlier se cade sotto Q1 - 1.5×IQR o sopra Q3 + 1.5×IQR, dove IQR = Q3 - Q1.

Cosa significa cardinality ratio?

È il rapporto tra valori unici e totale righe di una colonna. Un rapporto vicino a 1 (≥0.95) indica una colonna quasi-identificativa (es. ID, email), utile per capire se una colonna può fare da chiave primaria o va esclusa da feature ML.

Come viene calcolato lo score complessivo 0-100?

Lo score combina penalità per missing values (% per colonna), duplicati di riga, outlier rilevati e cardinalità anomala. Punteggi alti indicano un dataset pronto per l'uso, punteggi bassi segnalano problemi da correggere prima dell'analisi o del training.

I miei dati vengono caricati su un server esterno?

No. Tutta l'analisi (parsing, statistica, scoring) avviene 100% client-side tramite FileReader API: il file non lascia mai il tuo browser.

Che dimensione massima di file posso analizzare?

Il limite è 5MB per garantire un'analisi rapida direttamente nel browser. Per dataset più grandi, valuta un campionamento preliminare o strumenti Python (pandas-profiling, ydata-profiling).