breadcrumbDescription
Bestem datakrav
Dataforberedelse er en proces med interaktiv justering. Når du går i detaljer med dine data, viser der sig nye oplysninger. Opdagelser kan forårsage, at du genvurderer antagelser og justerer din implementering af dataforberedelse tilsvarende.
Krav til Einstein Discovery-data
Einstein Discovery kræver et CRM Analytics-datasæt med mindst 3 kolonner: en resultatvariabel plus to forklarende eller forudsigende variabler. Einstein Discovery understøtter datasæt med op til 50 variabler, men løsninger lykkes sædvanligvis med meget færre.
Til at opbygge modeller kræver Einstein Discovery et CRM Analytics-datasæt, der har mindst 400 observationer med et kendt resultat (mindst 400 observationer har værdier for resultatvariablen). Einstein Discovery understøtter datasæt med op til 20 millioner observationer. Hvis du vil vide mere, kan du se Einstein Discovery-kapaciteter og -krav.
Tag hensyn til tidligere registreringstilstande
Hvis du ønsker at registrere ændringer i data i en tidsperiode, skal du afgøre, om din datakilde kun bevarer den aktuelle tilstand af værdier for en registrering. Transaktionelle programdatakilder, som f.eks. Salesforce, indeholder kun de nyeste værdier for en registrering. Andre datakilder registrerer transaktionelle data i en kronologisk logfil. Hver ny version af registreringen føjes til logfilen, og tidligere versioner af registreringen bevares i tidligere logfiloplysninger. Det at kunne hente en tidligere værdi kræver lagring af et øjebliksbillede af de historiske data eller bevarelse af tidligere dataværdier i tilpassede felter i den aktuelle registrering.
Bestem det rette niveau af detaljer for de ønskede indsigter.
Hvilket niveau af indsigter er af interesse for at nå målet? F.eks. er kundeniveauindsigter af interesse, når der kigges på kundeindtjening. I Datamanager skal du bruge gruppering til at justere detaljegraden af data. Vælg et detaljeniveau, der kan reageres på, der er forståeligt og nyttigt, så du kan indarbejde resultaterne i din forretningsproces eller anvendelse.
Det er en almindelig fejltagelse at overdrive aggregering af data. Husk på det ønskede resultat, og brug data, der er indsamlet i rækker på det pågældende detaljeniveau. Data, der er analyseret i Excel, kan være på et andet niveau, end det du ønsker for Einstein Discovery. Hvis du f.eks. vil forstå effekterne af ugedagen, skal du angive data på dagsniveau. Du kan ikke forudsige et resultat på dagsniveau fra et aggregeret datasæt på månedligt niveau.
Fastsæt relevante tidsrammer
Statistiske analysedatasæt kan opsummere en livstid med værdier på blot en enkelt række med mange kolonner, der beskriver de forskellige punkter i tid. Indsaml ikke en livstid af felter, hvis et bestemt tidsvindue mere nøjagtigt afspejler den resultatvariabel, du vil analysere og forudsige. Normalt vil de begivenheder, der er tættest på resultatet, være stærkere forudsigende variabler end begivenheder, der er sket for lang tid siden. Overvej en rimelig afslutningstid for at sikre, at dine data er tilstrækkelig nye til at være relevante.
Hvis du vil bruge Einstein Discovery til forudsigelser, skal dine variabler være til stede på det tidspunkt, som forudsigelsen er baseret på. Antag f.eks. sige, at dit mål er at reducere misligholdelse af lån ved ikke at forhåndsgodkende lån, der sandsynligvis vil blive misligholdt. I denne situation skal du opfange variabler, f.eks. en kreditscore på tidspunktet for låneansøgningen og inden. Hvis personen har været forsinket med to betalinger efter lånets oprettelse, vil det ikke blive brugt i forhåndsgodkendelsesanalysen, da de allerede er blevet godkendt.
Fastsæt, hvor mange data skal der hentes
Hvis du vil opbygge pålidelige forudsigelsesmodeller, skal du give Einstein Discovery så mange data som muligt for at tilsvare virkelige distributioner af variabler. Det faktiske antal registreringer er ikke altid nemt at bestemme, fordi det afhænger af, hvilke mønstre der findes i dine data. Hvis du har mere støj i dine data, skal du have flere data for at få bugt med det. Støj i denne kontekst betyder ikke-observerede relationer i data, som ikke opfanges af inputforudsigelsesvariabler. Generelt er det bedre at have flere rækker med data af hensyn til analysens nøjagtighed. Kolonner med flere mulige værdier resulterer i finere segmentering af data, men det kan kræve flere rækker med data at få en statistisk sund analyse. F.eks. 10.000 rækker med binært resultat for køn (enten mand eller kvinde) resulterer potentielt i 5.000 observationer pr. køn. Men 10.000 rækker med en variabel, der angiver 50 stater, resulterer i potentielt 200 observationer pr. stat.
Overvej tidsrammen
Data, der ændres over tid, skal afspejles i din model og også i dit tilknyttede datasæt. Når tidssekvenser (Emne modtaget > Tilbud leveret > Handel lukket) er vigtige i forudsigelser, skal der proportionelt indsamles data fra disse forskellige tidsperioder. Nøgleprincippet er at levere data, der afspejler, hvad der faktisk sker i den virkelige verden, ved det rigtige detaljeniveau for resultatmetrik.
Tænk proportionelt
Når der indsamles data, bør du tænke over balancen mellem værdier for variabler i dine rå data. F.eks. hvor mange vertikale brancheregistreringer der er pr. tidsperiode? Hvis du udtrækker et delsæt af data, skal du inkludere ca. den samme andel af variabler i dit inputdatasæt. Hvis du leverer flere registreringer af en variabel (vertikal i vores eksempel), kan du utilsigtet introducere partiskhed i din analyse. Hvis du har datasæt med flere millioner rækker, er det mindre sandsynligt at støde på utilsigtet partiskhed.
Angiv kendte resultater i dine data
Einstein Discovery indstiller sine analyser omkring et bestemt resultat, typisk en KPI (key performance indicator – nøgletalsindikator), f.eks. en salgsmargen eller en vundet salgsmulighed. Data med kendte resultatværdier giver Einstein Discovery noget at arbejde med. Hvis du f.eks. målretter mod frekvenser for vundne handler, skal dine data afspejle handler, der er vundet fuldstændigt eller tabt. Hvis handlen ikke er fuldført – den er hverken vundet eller tabt – udelader Einstein handlen fra analysen, da resultatværdien mangler.
Overvej bias og rimelighed i dine data
Reflekterer de data, du ønsker at bruge, forretningspraksisser, der måske er tendentiøse eller urimelige? For at hjælpe dig med at oprette etiske og pålidelige indsigter og modeller registrerer Einstein Discovery proxyvariabler og uensartet påvirkning i dit datasæt. Du kan også markere og filtrere følsomme variabler (f.eks. køn eller alder) for at se, hvor de vises i dine indsigter. Hvis Einstein Discovery viser bias i dine data, kan du ganske enkelt ekskludere de tendentiøse data fra din historie. Hvis du vil vide mere, kan du se Registrer og fjern binding fra en model. Desuden kan du overveje at ekskludere tendentiøse data under dataforberedelse. Hvis du ønsker en oversigt, kan du gennemføre Trailhead-modulet Responsible Creation of Artificial Intelligence (Ansvarlig oprettelse af kunstig intelligens).
Analyser uden overfitting eller underfitting
Einstein Discovery finder ud af hvilke variabler og kombinationer af variabler, der bedst forklarer adfærden af din valgte metrik uden overfitting eller underfitting.
| Problem | Tilgang |
|---|---|
| Overfitting | Forekommer, når der bruges for mange variabelfelter i en forudsigende model. Overfitting opfanger støjen i dine data på en overdrevent kompleks, upålidelig måde, hvor modellen husker unødvendige detaljer. Når der kommer nye data ind, mislykkes modellen. Hvis du vil undgå overfitting, skal du ekskludere variabler, der er for detaljerede. |
| Underfitting | Ofte resultatet af en overdrevent enkel model. Den statistiske algoritme kan ikke opfange de underliggende mønstre i data. |
Der er således en fin balance mellem at være for specifik med for mange variabler og for upræcis med for få valgte variabler.
