Loading
CRM Analytics
Determinar requisitos de datos

Determinar requisitos de datos

La preparación de datos es un proceso de perfeccionamiento iterativo. A medida que indaga en sus datos, emergen nuevas pistas. Los descubrimientos pueden hacer que vuelva a evaluar presunciones previas y ajuste su implementación de preparación de datos en consecuencia.

Nota
Nota Las historias de Einstein Discovery son ahora modelos. Nos gustaría chasquear nuestros dedos para actualizar el nombre en todas partes, pero puede esperar que aparezca el nombre anterior en algunos puntos hasta que lo sustituyamos.

Requisitos de datos de Einstein Discovery

Einstein Discovery requiere un conjunto de datos de CRM Analytics con al menos 3 columnas: una variable de resultado más dos variables explicativas o predictivas. Einstein Discovery admite conjuntos de datos con hasta 50 variables, pero las soluciones normalmente tienen éxito con mucho menos.

Para construir modelos, Einstein Discovery requiere un conjunto de datos de CRM Analytics que tenga al menos 400 observaciones con un resultado conocido (al menos 400 observaciones tienen valores para la variable de resultados). Einstein Discovery admite conjuntos de datos con hasta 20 millones de observaciones. Para obtener más información, consulte Capacidades y requisitos de Einstein Discovery

Considerar estados de registro anteriores

Si desea capturar cambios en datos a los largo de un periodo de tiempo, determine si su fuente de datos mantiene solo los valores de estado actual de un registro. Las fuentes de datos de aplicación transaccionales (Salesforce, por ejemplo) contienen solo los valores más recientes para un registro. Otras fuentes de datos capturan datos de transacciones en un registro cronológica. Cada nueva versión del registro se agrega al registro, y las versiones anteriores del registro se mantienen en entradas de registro anteriores. Obtener un valor anterior requiere almacenar una instantánea de los datos históricos o mantener los datos del valor anterior en campos personalizados en el registro actual.

Determinar el nivel apropiado de granularidad para las perspectivas que desea

¿Qué nivel de perspectivas es de su interés para alcanzar el objetivo? Por ejemplo, las perspectivas a nivel de cliente son de interés cuando se buscan los ingresos del cliente. En el Gestor de datos, utilice la agrupación para ajustar la granularidad de los datos. Seleccione una granularidad procesable, comprensible y útil de modo que pueda incorporar los resultados en su proceso comercial o aplicación.

Un error habitual es agregar datos en exceso. Tenga en cuenta los resultados que desee y utilice datos recopilados en filas a ese nivel de granularidad. Los datos analizados en Excel pueden estar a un nivel diferente al que desea para Einstein Discovery. Por ejemplo, para comprender los efectos del día de la semana, proporcione datos a nivel del día. No puede predecir un resultado a nivel de día desde un conjunto de datos de nivel mensual agregado.

Determinar divisiones de tiempo relevantes

Los conjuntos de datos de análisis estadístico pueden resumir una duración de valores en una sola fila exclusiva con varias columnas que describen diferentes puntos en el tiempo. No recopile un tiempo de vida de campos si una ventana de tiempo específica refleja con mayor precisión la variable de resultado que desea analizar y predecir. Habitualmente, los eventos más cercanos al resultado son predictores más sólidos que los eventos que sucedían hace tiempo. Considere una hora límite razonable para asegurarse de que sus datos son lo suficientemente recientes para ser relevantes.

Para utilizar Einstein Discovery para predicciones, sus variables deben estar en el punto de tiempo en que se basa la predicción. Por ejemplo, supongamos que su objetivo es disminuir valores predeterminados en préstamos no aprobando préstamos que podrían recaer en valores predeterminados. En este caso, captura variables, como una puntuación de crédito en el momento de aplicación del préstamo o antes. Si la persona se atrasa en dos pagos tras el otorgamiento del préstamo, es posible que no se utilice en el análisis de aprobación previa porque ya se han aprobado.

Decidir cuántos datos obtener

Para crear modelos predictivos fiables, proporcione a Einstein Discovery el máximo de datos posible para reunir distribuciones reales de variables. El número actual de registros no es siempre fácil de determinar porque depende de patrones encontrados en sus datos. Si tiene más ruido en sus datos, necesita más datos para solucionarlo. El ruido en este contexto significa relaciones que pasan desapercibidas en los datos que las variables de predictor de entrada no capturan. En general, más filas de datos son mejores para la precisión del análisis. Las columnas con más valores posibles dan como resultado una mayor segmentación de los datos, pero pueden requerir más filas de datos para un análisis de sonido estadísticamente. Por ejemplo, 10.000 filas con un resultado binario de género (masculino o femenino) da como resultado 5.000 posibles observaciones por género. Pero 10.000 filas con una variable indicando 50 estados dan como resultados 200 posibles observaciones por estado.

Considerar la serie de tiempo

Los datos que cambian a lo largo del tiempo deben reflejarse en su modelo y también en su conjunto de datos asociado. Cuando las secuencias de tiempo (Candidato recibido > Presupuesto proporcionado > Negociación cerrada) son importantes en predicciones, recopile datos proporcionalmente desde esos diferentes periodos de tiempo. El principio clave es proporcionar datos que reflejan lo que sucede actualmente en el mundo real al nivel correcto de granularidad de mediciones de resultados.

Pensar proporcionalmente

Al recopilar datos, piense acerca del equilibrio de valores para variables en sus datos de fila. Por ejemplo, ¿cuántos registros de sectores verticales hay allí por periodo de tiempo? Al extraer un subconjunto de datos, incluya aproximadamente la misma proporción de variables en su conjunto de datos de entrada. Si proporciona más registros de una variable, vertical en nuestro ejemplo, podría introducir involuntariamente sesgos en su análisis. Si tiene conjuntos de datos con millones de filas, es menos probable encontrar sesgos accidentales.

Proporcionar resultados conocidos en sus datos

Einstein Discovery orienta su análisis alrededor de su resultado concreto, habitualmente un indicador de rendimiento clave (KPI), como margen de ventas o ganancia de oportunidad. Proporcionar datos con valores de resultados conocidos proporciona a Einstein Discovery algo con que trabajar. Por ejemplo, si está dirigiendo índices de ganancia de negociaciones, sus datos deben reflejar negociaciones que están definitivamente ganadas o perdidas. Si la negociación no está completada (no está ni ganada ni perdida), Einstein omite la negociación del análisis porque falta el valor de resultado.

Considerar sesgos y equidad en sus datos

¿Los datos que desea utilizar reflejan prácticas comerciales que posiblemente sen sesgadas o imparciales? Para ayudarle a producir perspectivas y modelos éticos y responsables, Einstein Discovery detecta variables de proxy e impacto dispar en su conjunto de datos. También puede marcar y filtrar variables confidenciales (como género o edad) para ver dónde se muestran en sus perspectivas. Si Einstein Discovery expone sesgos en sus datos, puede simplemente excluir los datos sesgados desde su historia. Para obtener más información, consulte Detectar y eliminar sesgos de un modelo. Además, considere excluir datos sesgados durante la preparación de datos. Para una descripción general de IA responsable y ética, realice el módulo Creación responsable de inteligencia artificial de Trailhead.

Analizar sin sobreajuste o infraajuste

Einstein Discovery determina qué variables y combinaciones de variables explican mejor el comportamiento de su medición seleccionada sin sobreajustar o infraajustar.

ProblemaEnfoque
Sobreajuste Se produce al utilizar demasiados campos de variable en un modelo predictivo. El sobreajuste captura el ruido en sus datos con una forma muy complejo y poco fiable de modo que el modelo memoriza detalles innecesarios. Cuando llegan nuevos datos, el modelo falla. Para evitar el sobreajuste, excluya variables demasiado detalladas.
Infraajuste A menudo el resultado de un modelo excesivamente sencillo. El algoritmo estadístico no puede capturar los patrones subyacentes en los datos.

Por lo tanto, existe un delicado equilibrio entre ser demasiado específico con demasiadas variables y demasiado ambiguo sin suficientes variables seleccionadas.

 
Cargando
Salesforce Help | Article