【要約】Claude Codeに動画を見せる /watch-video、実は「渡すだけ」じゃなかった — 3つの深さを使い分ける [Qiita_Trend] | Summary by TechDistill
> Source: Qiita_Trend
Execute Primary Source
// Problem
ユーザーは、動画を渡すだけで全ての解析が行われると誤解しやすい。その結果、期待した解析結果が得られない問題が生じる。
- ・既定のtranscriptモードでは、文字起こしのみが行われる。
- ・画像解析や要約が必要な場合に、適切なモードを選択できていない。
- ・動画の性質に応じたコスト管理ができていない。
// Approach
開発者は、解析の深さを3段階のモードとして定義した。動画の性質に応じた選択を可能にする設計である。
- ・解析深度をtranscript, visual, multimodalの3種で提供。
- ・動画の種類に基づき、フレーム抽出間隔を自動で切り替える。
- ・プラットフォームの字幕を優先する階層的な文字起こしを実現。
- ・解析結果をディレクトリに保存し、他のSkillへ受け渡す設計を採用。
// Result
ユーザーは、動画の内容とコストのバランスを最適化できるようになった。解析の精度と計算資源の無駄を、動画の特性に合わせて制御可能である。
- ・音声中心の動画には低コストなtranscriptを適用できる。
- ・デモ動画にはvisualを使い、画面操作を詳細に記録できる。
- ・画面共有時は5秒、対談時は30秒と、情報の密度に合わせた抽出が可能。
- ・解析結果が構造化データとして保存され、後続のタスク管理に直結する。
Senior Engineer Insight
> 本設計は、LLMの推論コストと精度のトレードオフを、動画の「情報密度」という観点から見事に解決している。特に、動画種別に応じたフレーム抽出間隔の動的制御は、計算資源の無駄を省く実戦的なアプローチだ。ただし、ffmpeg等の外部依存関係や、モード選択の知識をユーザーに強いる点は、ツールとしての抽象化レベルに課題を残す。エージェント間の連携を前提とした設計は、自律型ワークフロー構築の観点から高く評価できる。