【要約】言語モデルの推論時空間計算量をO(log n)にする(その2) [Qiita_Trend] | Summary by TechDistill
> Source: Qiita_Trend
Execute Primary Source
// Problem
著者は、従来の再帰的チャンク圧縮モデルを用いた長文推論において、モデルの挙動が不安定になる問題に直面した。具体的には以下の課題が挙げられる。
- ・長期推論時に、学習した言語(日本語)から別の言語(英語)へ意図せず切り替わる現象。
- ・対話ファインチューニングにおいて、話題が変わっても初期の質問に固執する傾向。
- ・コンテキスト長 n の増大に伴う、計算リソースの消費増大。
// Approach
著者は、アーキテクチャの構造変更によって、計算効率の維持とモデルの安定化を同時に図った。採用された手法は以下の通りである。
- ・FFN層を再帰構造から分離し、言語の切り替わり等の不安定性を解消。
- ・高階クエリの接続方式を変更し、初段のみ直前レベルチャンクの最終クエリを使用する構造を採用。
- ・チャンクサイズ4を用いた再帰的処理により、空間計算量をO(log n)に抑制。
// Result
アーキテクチャの改善により、長文生成における言語の安定性と対話の柔軟性が向上した。得られた成果は以下の通りである。
- ・数万トークンの生成においても、日本語の出力を安定して維持することに成功。
- ・対話において、話題の変更に対して適切に追従できる能力を獲得。
- ・チャンクサイズ4、コンテキスト長2048の条件下で、日本語文法を維持した生成を確認。
Senior Engineer Insight
> 本手法は、メモリ制約の厳しい環境での長文処理において極めて有望である。O(log n)という計算量は、コンテキスト長が増大するほど従来のTransformerに対して圧倒的な優位性を持つ。ただし、再帰構造による情報の欠落や、チャンクサイズ選定による汎化性能のトレードオフが実運用上の懸念点となる。チャンクサイズ2での検証結果が、スケーラビリティの鍵を握るだろう。