【要約】外れ値を1点外すと相関係数は0.82。でも層別すると両群とも逆を向く [Zenn_Python] | Summary by TechDistill
> Source: Zenn_Python
Execute Primary Source
// Problem
製造現場のエンジニアが、少数のデータから誤った相関関係を導き出すリスクについて述べている。
- ・外れ値1点の存在により、相関係数が「弱い相関」から「強い相関」へ劇的に変化する。
- ・層別変数を無視すると、群の傾向と逆の結論を導く「シンプソンのパラドックス」が発生する。
- ・小規模データにおいて、残差標準誤差の自由度を誤ると、外れ値の検出精度が低下する。
// Approach
著者は、統計的な誤謬を防ぐための具体的な検知手法と、計算上の注意点を提示している。
- ・回帰直線からの残差に基づき、2.0σを超える点を外れ値として検出する。
- ・単回帰のパラメータ推定に伴う自由度を考慮し、分母を n-2 として残差標準誤差を算出する。
- ・可視化ツールを用い、外れ値の有無による回帰直線の変化や、層別による傾向の違いを明示する。
// Result
本記事の分析により、データ分析における「見かけの相関」の正体が明らかになった。
- ・外れ値の除去により、相関係数が0.4974から0.8225へ変化する具体例を示した。
- ・自由度を n-2 とすることで、小規模データにおける標準誤差の過小評価を防止できる。
- ・外れ値が複数存在すると閾値が上昇し、検出不能になる「マスキング現象」の限界も示した。
Senior Engineer Insight
> 製造現場のような小規模データ(n < 20)を扱う環境では、統計的厳密さが意思決定を左右する。特に自由度の扱いや層別の有無は、致命的な判断ミスを招く。ただし、本手法の「マスキング」という弱点は、異常検知の実装において致命的になり得る。実運用では、残差ベースの検知だけでなく、MAD等の堅牢な統計量との併用、あるいはドメイン知識による検証が不可欠である。