【要約】化合物の水溶解度を機械学習で予測してみる⑤:SHAP による解釈と文献との比較 [Qiita_Trend] | Summary by TechDistill
> Source: Qiita_Trend
Execute Primary Source
// Problem
化学分野のデータサイエンティストが、機械学習を用いた物性予測を行う際、モデルの予測根拠が不明確になるブラックボックス問題に直面する。モデルがなぜその値を算出したのかが分からなければ、化学的な妥当性の検証が困難である。具体的には以下の課題がある。
- ・モデルの予測根拠が不明で、化学的な知見と照らし合わせられない。
- ・特徴量の重要度が「全体的な傾向」に留まり、個別の予測理由が特定できない。
- ・構築したモデルが、既存の物理化学的な文献モデルに対してどの程度優位か判断しにくい。
// Approach
著者は、LightGBMで構築した水溶解度予測モデルに対し、SHAP(SHapley Additive exPlanations)を導入して解釈性を高めるアプローチを採用した。これにより、モデルの挙動を定量的に説明可能にしている。具体的な手順は以下の通りである。
- ・SHAPを用いて、各記述子が個々の予測値に与える貢献度を数値化する。
- ・Summary Plotにより、記述子の値の大小が予測に与える方向性を可視化する。
- ・LightGBMの
feature_importances_(gain)とSHAP値を比較し、重要度の妥当性を検証する。 - ・Delaney (2004) のESOLモデルとR²値を比較し、モデルの性能を評価する。
// Result
構築したLightGBMモデルは、既存の文献モデル(ESOL)のR² = 0.811を上回るCV R² = 0.889を達成した。モデルの解釈においても、化学的に妥当な結果が得られている。主な成果は以下の通りである。
- ・MolLogPが最も重要な記述子であり、疎水性が高いほど溶解度が下がる傾向をSHAPで確認した。
- ・Polar Surface AreaやMolecular Weightの寄与も可視化し、モデルの信頼性を裏付けた。
- ・精度改善において、特徴量設計が最も効果的であることを定量的に示した。
Senior Engineer Insight
> 精度向上において、ハイパーパラメータ調整よりも特徴量設計が圧倒的に寄与するという結論は、実務的にも極めて重要だ。XAI(SHAP)の導入は、単なる精度追求に留まらず、モデルの化学的妥当性を担保するために不可欠である。ただし、文献比較における検証条件(データ数や検証手法)の差異には注意が必要だ。現場では、モデルの精度だけでなく、その根拠がドメイン知識と整合しているかを常に検証すべきである。