Loading
CRM Analytics
Solucionar de problemas de datos comunes

Solucionar de problemas de datos comunes

Gestione problemas comunes que podría encontrar durante la preparación de datos para Einstein Discovery.

Nota
Nota Las historias de Einstein Discovery son ahora modelos. Nos gustaría chasquear nuestros dedos para actualizar el nombre en todas partes, pero puede esperar que aparezca el nombre anterior en algunos puntos hasta que lo sustituyamos.

La siguiente tabla describe algunos enfoques para la gestión de problemas de datos comunes al preparar datos para análisis.

Nota
Nota Einstein Discovery detecta algunos de estos problemas para usted durante el análisis. Si se encuentran, Einstein le solicita solucionar un problema en el modelo de modo que no se requiera solucionarlo en el conjunto de datos. Para obtener más información, consulte Gestionar alertas de calidad.
Problema Enfoque Consulte también
Valores extremos y valores atípicos Los algoritmos de Einstein Discovery son sensibles a valores atípicos porque esos valores afectan a medias (significado) y desviaciones estándar en cálculos de importancia estadística. Si encuentra valores no habituales o valores atípicos, confirme si esos puntos de datos son relevantes y reales. Los valores inusuales son a menudo errores. Si los puntos de datos extremos son precisos, predecibles y recurrentes, no los elimine a menos que esos puntos no sean importantes. Puede reducir la influencia de los valores atípicos utilizando transformaciones o convirtiendo la variable numérica en un valor categórico con discretización.
Valores que faltan

La reparación más común para valores que faltan es imputar un valor probable o esperado utilizando un significado o valor calculado desde una distribución. Si utiliza un valor de significado, podría reducir su desviación estándar. Por lo tanto, la fórmula de imputación de la distribución es más fiable. Otra fórmula es eliminar registros con valores que faltan. No sea muy ambicioso con el filtrado de valores que faltan. En ocasiones, el patrón está en los datos que faltan. Además, si elimina demasiados registros, perjudica los aspectos reales en su análisis.

Einstein Discovery orienta su análisis alrededor de su resultado concreto. Si el valor del resultado de destino falta en una fila concreta, Einstein Discovery excluye esa fila del análisis.

Valores incorrectos Los algoritmos predictivos asumen que la información de entrada es correcta. Si solo algunas filas tienen valores incorrectos, decida qué hacer. Eliminar esas filas del análisis o sustituir los valores incorrectos con valores medios o más correctos. Si hay numerosos valores no precisos, determine por qué se producen las imprecisiones y si es posible repararlas. A veces es mejor eliminar una variable altamente susceptible a errores que incluirla en el análisis.  
Estandarizar valores categóricos Para valores de categoría, garantice nombres de categoría coherentes. Elimine variaciones de ortografía (como plurales o abreviaciones). Corrija errores tipográficos y otros errores. Utilice etiquetas significativas, reconocibles y fáciles de interpretar.
Datos sesgados Para variables continuas, revise las distribuciones, la tendencia central y la separación de la variable. Estas variables se miden utilizando varios métodos de visualización estadística. Confirme que las variables continuas se distribuyen normalmente. Si no es así, intente reducir la asimetría para una predicción óptima. Para variables categóricas, utilice una tabla de frecuencia, junto con un gráfico de barras, para comprender las distribuciones de cada categoría. Si los valores de la variables están sesgadas, Einstein Discovery podría producir modelos parciales. Cuando se debe corregir una distribución sesgada, transforme la variable utilizando una función, como la transformación Box-Cox. Tras aplicar la solución, se alcanza una distribución normal para la variable. La variable transformada recién preparada funciona mucho mejor para fines de modelos predictivos.  
Campos de alta cardinalidad Los campos de alta cardinalidad son atributos categóricos que contienen varios valores distintos. Los ejemplos incluyen nombres, códigos postales o números de cuenta. Aunque estas variables pueden ser altamente informativas, los atributos de alta cardinalidad son raramente utilizados en modelos predictivos. Incluir estos valores aumenta considerablemente la dimensionalidad del conjunto de datos, haciendo difícil que la mayoría de algoritmos crean modelos de predicción precisos.
Resultados binarios y variables booleanas Si una variable tiene un resultado binario (solo dos valores posibles), y esos valores están representados por números (por ejemplo, 1 y 0), convierta esos valores numéricos a valores de texto (por ejemplo, "TRUE" y "FALSE" o "NOTCHURNED" y "CHURNED"). Para soluciones que implementan el caso de uso de clasificación (resultados binarios), Einstein Discovery requiere que se representen los valores de resultado como valores de texto. Para otras variables en el conjunto de datos, la conversión de estos valores en texto puede mejorar la interpretabilidad de los gráficos y las explicaciones en las perspectivas resultantes.  
Variables ordinales Las variables ordinales son problemáticas para los modelos predictivos. Los datos ordinales constan de puntuaciones numéricas en una escala arbitraria diseñada para mostrar la clasificación en puntos de un conjunto de datos. Por ejemplo, Bajo, Medio Y Alto son ordinales. Los algoritmos predictivos asumen que la variables es una variable de intervalo o relación y por lo tanto se podría confundir por la escala. La variables ordinales se tratan como categóricas. Si tiene valores ordinales, transfórmelas en valores continuos o categóricos.  
Variables duplicadas, redundantes o altamente correlacionadas Minimice variables duplicadas, redundantes u otras variables altamente correlacionadas que transmiten la misma información. Los algoritmos de Einstein Discovery tienen un mejor rendimiento sin estos tipos de variables colineales. La colinealidad se produce cuando dos o más variables de predictor están altamente correlacionadas. Como resultado, se puede predecir una de forma lineal desde las otras con un grado de precisión sustancial. Para evitar la colinealidad, no incluya múltiples valores altamente correlacionadas o datos procedentes de la misma jerarquía de creación de informes. Por ejemplo, los clientes que viven en la ciudad de Tampa también viven en el estado de Florida. Para identificar la alta correlación entre dos variables continuas, revise gráficos de dispersión. El patrón de un gráfico de dispersión indica la relación entre variables. La relación puede ser lineal o no lineal. Para buscar la solidez de la relación, calcule la correlación. La correlación varía entre –1 y +1.
 
Cargando
Salesforce Help | Article