【要約】バッチサイズ4倍→学習率4倍は正解?Linear Scaling RuleをAdamで検証したら [Zenn_Python] | Summary by TechDistill
> Source: Zenn_Python
Execute Primary Source
// Problem
分散学習で計算効率を高めるため、バッチサイズを拡大する際の学習率調整が課題となる。バッチサイズを増やすと1エポックあたりの更新回数が減るため、適切な調整が必要である。特に、既存の経験則がAdamでも通用するかは不明であった。
// Approach
筆者はAdamを用い、CIFAR-10でバッチサイズと学習率の相関を検証した。Linear Scaling Ruleの有効性を定量的に評価することが目的である。実験では、バッチサイズと学習率の組み合わせを系統的に変更した。
// Result
実験の結果、AdamにおけるLinear Scaling Ruleの適用には限界があることが示された。バッチサイズ拡大に伴う精度の変化を定量的に明らかにした。検証結果は以下の通りである。
Senior Engineer Insight
> 大規模な分散学習を運用する際、Adamへの安易な線形スケーリングは避けるべきだ。Adamは勾配を正規化するため、SGDとは挙動が異なる。バッチサイズを大きくする場合は、平方根スケーリング等の控えめな調整を検討せよ。また、検証時はエポック数ではなく総ステップ数で評価を行うことが鉄則である。