breadcrumbDescription
Binær klassificering
Metrikker for binær klassificering hjælper med at evaluere ydeevnen af en model, der kategoriserer data i to klasser.
Accuracy (Nøjagtighed)
Udover den generelle nøjagtighedsscore ved brug af AUC er der to yderligere metrikker til at forstå nøjagtigheden af en binær klassificeringsmodel.
Se, hvor ofte modellen foretager korrekte og ukorrekte forudsigelser (1). Se afslutningspunktet for tærskel for, hvordan forudsigelser klassificeres mellem klasser (2).
Confusion Matrix (Usikkerhedsmatrix)
Bruges til at evaluere afvejningen mellem forskellige fejltyper baseret på tærskelværdien. Diagrammet viser, hvor mange gange modellen korrekt og forkert klassificerer observationer ved den tilhørende tærskel.
ROC Curve (ROC-kurve)
Kurven ROC (Receiver Operating Characteristic) viser ydeevnemåling ved forskellige tærskelindstillinger. ROC er en sandsynlighedskurve og AUC (Area Under te Curve - Område under kurve) repræsenterer graden eller målet for adskillelighed. Brug diagrammet til at se, hvor effektivt modellen kan skelne mellem klasser.
Gain og Lift
Gain- og Lift-diagrammer viser fordelene ved modellen. Ved at bruge en del af de data, der scores og rangeres til analyse, måler diagrammerne de resultater, der blev opnået med modellen, sammenlignet med tilfældigt gætteri uden en model. Jo større gain, og jo højere opløftning, desto mere effektiv er modellen.
| Diagram | Beskrivelse |
|---|---|
| Gain (Resultat) | Gain-diagrammet afbilder den samlede positive sats eller gain efter procentdel af dataene. Jo tættere modellinjen er på teoretisk nøjagtighed (perfekt model), og jo længere væk den er fra tilfældigt gætteri (ingen model), desto større er gevinsten. Gain kan bruges til at prioritere din organisations ressourcer. Hvis f.eks. en model har en 80 % gevinst ved 20 % af dataene, kan 80 % af målet nås med de øverste 20 % af dataene. |
| Lift | Lift-diagrammet afbilder forbedringsforholdet eller lift efter procentdel af dataene. Bedre modeller har højere elevatorer. Hvis din model f.eks. har 2,5 stigning på 20 af dataene, er resultaterne af modellen 2,5 gange bedre i de øverste 20 % af dataene end uden en model. |
4-fold krydsvalidering
Den 4-foldede krydsvalideringstilgang reducerer prøvebias under modelvalideringsprocessen. I denne metode opdeles dataene tilfældigt i fire separate partitioner af samme størrelse, og modellen gennemgår fire testgange (fold). Under hvert pass fungerer tre partitioner som træningsdata, mens den resterende fungerer som testdata. Ved at udføre fire testgennemgange bruges hver partition en gang som valideringsdata og tre gange som en del af træningsdataene, hvilket sikrer en omfattende evaluering. Se i tabellen over valideringsresultater for at undersøge metrikker, der svarer til hver fold af data.
| Metrisk | Beskrivelse |
|---|---|
| Antal registreringer | Samlet antal observationer. Betydningen af værdi varierer pr. kolonne.
|
| AUC | AUC (Area Under te Curve) repræsenterer frekvensen for den korrekte klassificering efter en logistisk model.
|
| GINI | Gini-indekset kvantificerer, hvor tæt denne logistiske model klarer sig i forhold til en teoretisk bedst mulig model. |
Andre metrikker
Overvej andre metrikker, der almindeligvis bruges til at evaluere modelkvalitet.
| Metrisk | Beskrivelse |
|---|---|
| Nøjagtighed | Nøjagtighed måler andelen af resultater, som modellen forudsagde korrekt (sande positive og sande negative).
|
| F1-score | F1-score er det harmoniske gennemsnit af den positive forudsigende værdi (præcision) og den sande positive sats (tilbagekaldelse).
|
| Falske negativer | Antallet af forudsagte negativer, der faktisk er positive. |
| Falsk negativ sats: | Falsk negativ sats (FNR, også kaldet type II-fejl eller misfrekvens) er andelen af forudsagte falske negativer blandt alle de faktiske positive.
|
| Falske positive | Antallet af forudsagte positive, der faktisk er negative. |
| Falsk positiv sats | Falsk positiv sats (FPR, også kaldet type I-fejl, falsk alarm-forhold eller udløb) er antallet af forudsagte falske positive blandt alle de faktiske negative.
|
| Informedness (Informerbarhed) | Informedness (også kaldet Youden's J-statistik) måler, hvor godt modellen forudsiger både positive og negative.
|
| Markedness (Markerbarhed) | Markerbarhed måler pålideligheden af positive og negative forudsigelser efter modellen.
|
| MCC | Matthews-korrelationskoefficienten (MCC) giver en mere jævn repræsentation af de fire dele af usikkerhedsmatrixen end andre klassificeringsmetrikker.
|
| Negative Predictive Value (NPV - negativ forudsigelsesværdi) | Negativ forudsigelsesværdi (NPV) er andelen af faktiske negativer blandt alle forudsagte negativer.
|
| Positiv forudsigelsesværdi (præcision) | Positiv forudsigelsesværdi (PPV, også kaldet præcision) er andelen af faktiske positive blandt alle forudsagte positive.
|
| Sande negativer | Antallet af forudsagte negativer, der faktisk er negative. |
| Ægte negativ sats (specifikation) | Sand negativ sats (TNR, også kaldet specificitet) er andelen af forudsagte negativer blandt alle de faktiske negativer.
|
| Sande positive | Antallet af forudsagte positive, der faktisk er positive. |
| Ægte positiv sats (følsomhed, tilbagekaldelse) | Ægte positiv sats (TPR, også kaldet følsomhed eller tilbagekaldelse) er andelen af forudsagte positive blandt alle de faktiske positive.
|

