[STATUS: ONLINE] 当サイトは要約付きのエンジニア向けFeedです。

TechDistill.dev

[DISCLAIMER] 当サイトの要約は正確性を保証しません。気になる記事は必ず原文を確認してください。
cd ..

【要約】DeepSeek V4 Flash 0731 のロスレスMXFP4版をSSDストリーミングで動かしてみた [Qiita_Trend] | Summary by TechDistill

> Source: Qiita_Trend
Execute Primary Source

// Problem

ローカルLLMの運用者が、巨大なMoEモデルを扱う際に直面するメモリ不足の問題がある。
  • DeepSeek V4 Flash 0731は145.3 GiBの容量を持つ。
  • 128 GiBのメモリを搭載したMacBook Proでは、モデル全体を常駐できない。
  • 従来の量子化手法では、メモリには収まるが推論精度が低下する。
  • 高精度なMXFP4形式を維持しつつ、メモリ制約を回避する手段が不足していた。
  • モデルの巨大化に伴い、単一のメモリ空間に収めることが困難になっている。

// Approach

著者は、DwarfStarエンジンのSSDストリーミング機能を用いて、メモリ制約の解決を試みた。
  • 非ルーテッド重みをメモリに常駐させる。
  • ルーテッドエキスパートのみをSSDからLRUキャッシュ経由で供給する。
  • エキスパートの局所性を活用し、3段階のキャッシュ戦略を適用する。
  • 静的ホットリスト、LRU、プレフィルシードによりキャッシュ効率を高める。
  • Metal環境に最適化されたMXFP4推論カーネルを利用する。

// Result

著者は、M5 Max 128GB環境において、精度を維持したまま実用的な推論速度を実現した。
  • 生成速度(ウォーム状態)で平均18.02 t/sを記録した。
  • バルクプレフィルでは約194.19 t/sという高速な処理を実現した。
  • 512Kのコンテキスト運用時でも、メモリ内に収まることを確認した。
  • 量子化誤差ゼロのMXFP4形式での動作に成功した。
  • SSDストリーミングが実用域にあることを実証した。

Senior Engineer Insight

> 精度とメモリ容量のトレードオフを、ストリーミング技術で解決する手法は極めて実践的だ。特にエキスパートのルーティング分布の偏りを利用したキャッシュ戦略は、特定ドメインの運用において高速化の鍵となる。ただし、DSparkとの排他制約やMetal依存といった実装上の制約は、汎用的なデプロイメントにおいては無視できない。

[ RELATED_KERNELS_DETECTED ]

cd ..

> System.About()

TechDistillは、膨大な技術記事から情報の真髄(Kernel)のみを抽出・提示します。