詳細情報:
交差検証失敗アラート
交差検証では、データセットを複数の部分に分割し、ある部分でモデルをトレーニングし、別の部分で検証することで、モデルがどの程度目に見えないデータに一般化されるかを評価します。失敗は、トレーニングデータが十分に大きくない場合、使用する例が少なすぎる場合、無効な形式、欠損値、異常値がある場合に発生します。
考慮すべきアクション
K 分割交差検証の 1 つの分割のパフォーマンスが他の分割とは大きく異なっています。トレーニングデータで異常値または異常データを調査し、それに応じて絞り込んでください。
検出方法
モデルビルダーでは、いずれかの分割でパフォーマンスの大きな違いが検出されるとアラートが表示されます。
例
ある小売ブランドは、在庫を最適化して在庫の補充を改善できるように、さまざまな店舗での商品の週次需要を予測したいと考えています。これを実現するために、小売業者は次の入力変数を使用して回帰モデルを作成してトレーニングします。
- ストア ID
- 商品 ID
- price
- 昇格
- 在庫数
- 季節
- 週次売上
モデルのトレーニング後、交差検証に失敗したためアラートが表示されます。データセットに商品データ、店舗データ、または販売履歴データがない場合や、交差検証用のデータ分割が失敗する可能性があります。この問題を解決するには、次の点を考慮してください。
- 「商品種別」や「店舗種別」など、属性が豊富な入力変数を使用してモデルを再トレーニングします。「商品 ID」や「ストア ID」は使用しないでください。
- 将来の情報が漏洩する可能性がある「週末在庫数」などの変数を削除すると、モデルの信頼性が低下します。
- データセットが小さすぎる (行数、列数、またはその両方が少なすぎる) 場合は、より多くのデータを使用します。

