Olet tässä:
Ristiintarkastus-välilehti binääriluokitukseen
Einstein Discovery testaa mallin kykyä tehdä ennusteita käyttämällä k-kertaista ristiinvalidointia. Se on prosessi, joka vähentää näytteiden puolueellisuutta, kun mallia vahvistetaan. Tämä välilehti näyttää yhteenvedon tämän mallin ristiinvalidointiprosessin tuloksista sekä lisätietoja sen perustana olevista laskutoimista.
Ristiinvahvistus-välilehteen siirtyminen
Napsauta Suorituskyky-osiosta Mallin arviointi ja valitse Ristiintarkastus.
Ristiinvahvistus-välilehden sarakkeet
Seuraavassa taulukossa esitellään Ristiintarkastus-välilehden sarakkeet.
| Sarakkeen nimi | Kuvaus |
|---|---|
| Mittataulukon nimi | Tilaston nimi. |
| Koulutusjoukko | Tilastot CRM Analytics -datajoukon observaatioiden joukolle, jota Einstein Discovery käyttää mallin koulutukseen. |
| Vahvistusjoukko | Tilastot CRM Analytics -datajoukon observaatioiden joukolle, jota Einstein Discovery käyttää vahvistaakseen koulutetun mallin luomat ennusteet. |
| Ositus #1 | Testien ensimmäisen suorituskerran tilastot. |
| Ositus #2 | Testien toisen suorituskerran tilastot. |
| Ositus #3 | Testien kolmannen suorituskerran tilastot. |
| Ositus #4 | Testien neljännen suorituskerran tilastot. |
Ristiinvahvistus-välilehden tilastot
Seuraava taulukko kuvaa Cross Validation -välilehden tilastot.
| Mittataulukon nimi | Kuvaus |
|---|---|
| Rivien määrä | Observaatioiden kokonaismäärä. Arvon tarkoitus vaihtelee sarakkeen mukaan.
|
| AUC | Käyrän alle jäävä alue. Edustaa logistiikkamallin luokittelun onnistumissuhdetta. AUC on järkevin mitta luokitteluun. Arvoalue:
|
| GINI | GINI-indeksi. Osoittaa, kuinka hyvin määritetty malli toimii verrattaessa teoreettisesti parhaaseen mahdolliseen malliin. Arvoalue:
|
| Logaritminen virhefunktio | Logaritminen virhefunktio. Mittaa mallin suorituskykyä asteikolla 0–1, jossa 0 tarkoittaa täydellistä mallia (ennustettu todennäköisyys vastaa todellisia observaatioita 100 %:sti). Mitä vähemmän ennustettu todennäköisyys vastaa todellisia observaatioita oikein (matala suorituskyky), sitä merkittävämpi logaritminen virhefunktio on. Logaritminen virhefunktio ottaa epävarmuuden huomioon mallin suorituskyvyssä. |
| Keskiarvoinen luokkavirhe | Mittaa, kuinka usein ennusteet ovat väärässä. Alhainen arvo tarkoittaa, että ennusteet ovat harvemmin väärässä, eli malli tekee parempia ennusteita. |
Mallin validoinnin metodologia
Einstein Discovery suorittaa mallillesi k-kertaisen ristiinvalidoinnin (k=4). Tämä prosessi kattaa seuraavat vaiheet:
- CRM Analytics -datajoukon kaikki observaatiot jaetaan satunnaisesti neljään erilliseen yhtä suureen osioon.
- Suoritetaan neljä testiä (fold), joissa kolme osiota toimivat koulutusjoukkona ja yksi osio toimii testijoukkona.Huomautus Kun testit on suoritettu neljä kertaa, jokainen osio on toiminut kerran vahvistusjoukkona ja kolme kertaa osana koulutusjoukkoa.
- Mallin tilastot kerätään yhteen jokaiselta suorituskerralta.
- Neljän testikerran keskiarvo kerätään kokonaispisteitä varten.
