Ti trovi qui:
Soluzione dei problemi più comuni dei dati
Gestire i problemi più comuni che si potrebbero verificare durante la preparazione dei dati per Einstein Discovery.
La tabella riportata di seguito descrive alcuni approcci per gestire i problemi più comuni dei dati durante la loro preparazione per l'analisi.
| Problema | Approccio | Vedere anche |
|---|---|---|
| Valori estremi | Gli algoritmi di Einstein Discovery sono sensibili ai valori estremi poiché tali valori influenzano le medie le deviazioni standard nei calcoli della significatività statistica. Se si rilevano valori insoliti o estremi, verificare se questi punti dati sono pertinenti e reali. Spesso i valori insoliti sono errori. Se i punti dati estremi sono precisi, prevedibili e ripetuti, non rimuoverli a meno che non siano poco importanti. à possibile ridurre l'influenza dei valori estremi utilizzando le trasformazioni o convertendo la variabile numerica in un valore categoriale mediante binning. | |
| Valori mancanti | Il metodo di riparazione più comune per i valori mancanti è l'imputazione di un valore probabile o previsto utilizzando un valore medio o calcolato da una distribuzione. Se si utilizza un valore medio, è possibile ridurre la deviazione standard. In questo modo, l'approccio all'imputazione della distribuzione è più affidabile. Un altro approccio è rimuovere i record con valori mancanti. Cercare di non esagerare quando si filtrano i record per escludere quelli con valori mancanti. A volte lo schema è proprio nei valori mancanti. Inoltre, se si eliminano troppi record, si pregiudicano gli aspetti reali nell'analisi. Einstein Discovery orienta la propria analisi su un risultato particolare. Se il valore del risultato a cui si tende manca da una determinata riga, Einstein Discovery esclude quella riga dall'analisi. |
|
| Valori errati | Gli algoritmi predittivi presumono che le informazioni immesse siano corrette. Se solo alcune righe contengono valori errati, decidere se rimuovere quelle righe dall'analisi o sostituire i valori non accurati con valori medi o più corretti. Se sono presenti molti valori imprecisi, determinare quali sono le cause dell'imprecisione e se è possibile correggere i valori. Talvolta è preferibile rimuovere una variabile che causa spesso un errore piuttosto che includerla nell'analisi. | |
| Standardizzazione dei valori categoriali | Per i valori categoriali, assicurarsi che i nomi categoria siano coerenti. Rimuovere variazioni dell'ortografia (ad esempio plurali o abbreviazioni). Correggere gli errori di ortografia e di altro tipo. Utilizzare etichette significative, riconoscibili e facili da interpretare. | |
| Dati non allineati | Per le variabili continue, esaminare le distribuzioni, la tendenza centrale e la diffusione della variabile. Queste variabili vengono misurate utilizzando vari metodi di visualizzazione statistica. Verificare che le variabili continue siano distribuite normalmente. In caso contrario, provare a ridurre la distorsione per ottimizzare la previsione. Per le variabili categoriali, utilizzare una tabella di frequenza, insieme a un grafico a barre, per comprendere le distribuzioni di ogni categoria. Se i valori delle variabili non sono allineati, Einstein Discovery potrebbe generare modelli distorti. Quando ĆØ necessario correggere una distribuzione asimmetrica, trasformare la variabile usando una funzione, ad esempio la trasformazione Box-Cox. Dopo aver eseguito la correzione, si ottiene una distribuzione normale per la variabile. La nuova variabile trasformata appena preparata funziona molto meglio per le operazioni di modellazione predittiva. | |
| Campi con cardinalità elevata | I campi con cardinalità elevata sono attributi categoriali che contengono molti valori distinti. Alcuni esempi sono i nomi, i CAP e i numeri di conto. Benché queste variabili possano contenere un gran numero di informazioni, gli attributi con cardinalità elevata vengono utilizzati raramente nella modellazione predittiva. Includere questi attributi aumenta enormemente la dimensionalità della serie di dati, rendendo difficile per la maggior parte degli algoritmi creare modelli di predizione accurati. | |
| Risultati binari e variabili booleane | Se una variabile ha un risultato binario (solo due valori possibili) e i valori sono rappresentati da numeri (ad esempio, 1 e 0), convertire tali valori numerici in valori di testo (ad esempio, "TRUE" e "FALSE" o "NOTCHURNED" e "CHURNED"). Per le soluzioni che implementano il caso d'uso di classificazione (risultati binari), Einstein Discovery richiede che i valori del risultato siano rappresentati come valori di testo. Per le altre variabili della serie di dati, la conversione di questi valori in testo può facilitare l'interpretazione dei grafici e delle spiegazioni negli approfondimenti risultanti. | |
| Variabili ordinali | Le variabili ordinali sono problematiche per i modelli predittivi. I dati ordinali sono costituiti da punteggi numerici su una scala arbitraria progettata per visualizzare la classificazione in una serie di punti dati. Ad esempio, Basso, Medio e Alto sono ordinali. Gli algoritmi predittivi presumono che la variabile sia una variabile di intervallo o rapporto e vengono quindi ingannati o confusi dalla scala. Le variabili ordinali vengono trattate come valori categoriali. Se si dispone di valori ordinali, trasformarli in valori continui o categoriali. | |
| Variabili duplicate, ridondanti o strettamente correlate | Ridurre al minimo le variabili duplicate, ridondanti o strettamente correlate che contengono le stesse informazioni. Gli algoritmi di Einstein Discovery funzionano meglio senza questi tipi di variabili collineari. La collinearità si verifica quando due o più variabili predittive sono strettamente correlate, con il risultato che una può essere dedotta in modo lineare dalle altre con un notevole grado di precisione. Per evitare la collinearità , non includere più variabili strettamente correlate o dati che provengono dalla stessa gerarchia di rapporti. Ad esempio, i clienti che vivono nella città di Tampa vivono anche nello stato della Florida. Per identificare la stretta correlazione tra due variabili continue, esaminare i grafici a dispersione. Lo schema di un grafico a dispersione indica la relazione tra le variabili. La relazione può essere lineare o non lineare. Per determinare la forza della relazione, calcolare la correlazione. La correlazione varia da -1 a +1. |
