【要約】ローカルLLM study1-b: Hugging Faceオリジナル版Gemma 4を動かしてみた [Zenn_Python] | Summary by TechDistill
> Source: Zenn_Python
Execute Primary Source
// Problem
開発者がHugging Faceのオリジナル重みを用いてGemma 4を動かそうとする際、環境構築と生成品質の面で深刻な問題に直面する。\n・標準のtransformersではGemma 4のアーキテクチャに未対応である。\n・Rosetta経由のツールチェーンでは、arm64専用のtorchが動作しない。\n・デフォルトのサンプリング設定では、出力に多言語トークンが混入する。\n・この混入により、生成されたコードが構文エラーで動作しなくなる。
// Approach
検証者はApple Siliconの性能を最大限引き出すため、micromambaを用いてarm64ネイティブな環境を構築した。\n・micromambaでPython 3.11のarm64環境を作成した。\n・GitHubから最新のtransformersを直接インストールした。\n・transformers serveを用いてOpenAI互換APIを構築した。\n・Aiderとの連携により、コード生成の検証プロセスを自動化した。
// Result
検証の結果、HFオリジナル版はMLX版と比較して実用性に欠けることが判明した。\n・推論速度はMLX版の3分の1以下と極めて遅い。\n・デフォルト設定では、コードが破壊される致命的なリスクがある。\n・do_sample=Falseに設定することで、品質の安定化が可能である。\n・Aiderとの連携自体は、APIサーバー経由で正常に動作した。
Senior Engineer Insight
> 実務での採用はMLX版を強く推奨する。HFオリジナル版は、サンプリング設定による「サイレントなコード破壊」のリスクがある。これは自動化パイプラインにおいて致命的だ。最新アーキテクチャの検証用途に限定すべきである。