您位於此處:
交叉驗證失敗警示
交叉驗證會透過將資料集分割成多個部分、對某些部分訓練模型,以及對其他部分驗證模型,來評估模型廣義至未見資料的程度。當訓練資料不夠大、使用過少的範例、格式無效、遺漏值或極端值時會發生失敗。
考慮採取的動作
K 折交叉驗證中其中一折的執行方式與其他折不同。調查您的訓練資料以尋找極端值或異常資料,並據此篩選。
偵測方法
當模型產生器偵測到其中一個折中的顯著效能差異時,會顯示警示。
範例
零售品牌想要預測各種商店中產品的每週需求,以最佳化庫存並改善重新進貨。若要達成此目標,零售商會使用這些輸入變數建立並訓練迴歸模型。
- 商店識別碼
- 產品識別碼
- price
- 促銷
- 庫存數
- 季度
- 每週銷售額
模型訓練後,會顯示警示,因為交叉驗證失敗。資料集或資料分割中缺少產品、商店或歷史銷售資料以進行交叉驗證可能會造成失敗。若要解決問題,請考量下列事項。
- 使用屬性豐富的輸入變數重新訓練模型,例如「產品類型」或「商店類型」。避免使用「產品識別碼」或「商店識別碼」。
- 移除如「週結束庫存計數」等可洩露未來資訊的變數,使模型較不可靠。
- 如果資料集太小 (列、欄或兩者數量太少) 以供交叉驗證,請使用更多資料。
