【要約】なぜ、あなたの時系列LightGBMモデルはトレンドに追従しないのか [Qiita_Trend] | Summary by TechDistill
> Source: Qiita_Trend
Execute Primary Source
// Problem
時系列予測を行うデータサイエンティストが、トレンドを持つ非定常なデータをLightGBMで扱おうとする際、予測値が頭打ちになる問題に直面する。決定木モデルの性質上、学習データの範囲外を予測できないため、成長する市場の予測に適さない。具体的には以下の課題がある。
- ・決定木は学習データの範囲内でのみ予測が可能である(外挿不可)。
- ・売上が右肩上がりの場合、予測値が学習期間の最大値付近で停滞する。
- ・水準が変化すると、学習時の絶対値に基づく分岐ルールが機能しなくなる。
// Approach
モデルが扱いやすい形にするため、データの水準を相対的な指標に変換するアプローチを採用する。これにより、データの絶対的な大きさに依存しない学習を実現する。
- ・目的変数を「変化率」に変換し、トレンドによる平均の上昇を緩和する。
- ・予測後に
pred = y_last * (1 + pred_ratio)の式で元のスケールへ復元する。 - ・特徴量も、ラグ特徴量とローリング統計量の比率などに変換し、相対的な位置を示す。
- ・
df["lag_1_ratio"] = df["lag_1"] / df["rolling_mean_28"]のように実装する。 - ・z-score等のローリング窓を用いた統計量も、相対化の手法として活用する。
// Result
目的変数と特徴量の両面で相対化を行うことで、決定木モデルでもトレンドを追従できる。これにより、学習データの範囲を超えた未来の予測が可能になる。
- ・売上が成長し続ける状況でも、予測値が頭打ちにならず追従できる。
- ・売上規模が異なる店舗や期間に対しても、共通の学習ルールを適用できる。
- ・ただし、ゼロ除算への対策や、不均一分散への理解といった注意点も明確化されている。
Senior Engineer Insight
> 実務において、モデル選定以上に「データの定常化」という前処理の設計が重要であることを示している。決定木の構造的限界を理解した上での特徴量エンジニアリングは、スケーラビリティの確保に直結する。ただし、間欠需要におけるゼロ除算や、構造変化への対応など、運用フェーズでのエッジケースへの考慮が不可欠である。単にモデルを回すのではなく、データの統計的性質を制御する視点が求められる。