【要約】DeepSeek V4 Flash 0731 のロスレスMXFP4版をSSDストリーミングで動かしてみた [Qiita_Trend] | Summary by TechDistill
> Source: Qiita_Trend
Execute Primary Source
// Problem
ローカルLLMの運用者が、巨大なMoEモデルを扱う際に直面するメモリ不足の問題がある。
- ・DeepSeek V4 Flash 0731は145.3 GiBの容量を持つ。
- ・128 GiBのメモリを搭載したMacBook Proでは、モデル全体を常駐できない。
- ・従来の量子化手法では、メモリには収まるが推論精度が低下する。
- ・高精度なMXFP4形式を維持しつつ、メモリ制約を回避する手段が不足していた。
- ・モデルの巨大化に伴い、単一のメモリ空間に収めることが困難になっている。
// Approach
著者は、DwarfStarエンジンのSSDストリーミング機能を用いて、メモリ制約の解決を試みた。
- ・非ルーテッド重みをメモリに常駐させる。
- ・ルーテッドエキスパートのみをSSDからLRUキャッシュ経由で供給する。
- ・エキスパートの局所性を活用し、3段階のキャッシュ戦略を適用する。
- ・静的ホットリスト、LRU、プレフィルシードによりキャッシュ効率を高める。
- ・Metal環境に最適化されたMXFP4推論カーネルを利用する。
// Result
著者は、M5 Max 128GB環境において、精度を維持したまま実用的な推論速度を実現した。
- ・生成速度(ウォーム状態)で平均18.02 t/sを記録した。
- ・バルクプレフィルでは約194.19 t/sという高速な処理を実現した。
- ・512Kのコンテキスト運用時でも、メモリ内に収まることを確認した。
- ・量子化誤差ゼロのMXFP4形式での動作に成功した。
- ・SSDストリーミングが実用域にあることを実証した。
Senior Engineer Insight
> 精度とメモリ容量のトレードオフを、ストリーミング技術で解決する手法は極めて実践的だ。特にエキスパートのルーティング分布の偏りを利用したキャッシュ戦略は、特定ドメインの運用において高速化の鍵となる。ただし、DSparkとの排他制約やMetal依存といった実装上の制約は、汎用的なデプロイメントにおいては無視できない。