【要約】画面クリック系のゲームなら大体自動操作&実況できるAIエージェントを開発した話 [Zenn_Python] | Summary by TechDistill
> Source: Zenn_Python
Execute Primary Source
// Problem
開発者は、LLMによるゲーム実況において、判断のタイミングや記憶の正確性が課題だと判断した。
- ・発話と操作の乖離:別々のAIに判断させると、話している内容と操作が一致しない。
- ・事実の誤認:操作の成否を確認せずに記憶すると、AIが「実行したつもり」の嘘を事実として扱う。
- ・状態管理の失敗:LLMに発話回数などの状態管理を任せると、正確な制御が困難になる。
- ・画面変化の検知:待機モーション等のノイズにより、画面の静止や変化の判定が極めて難しい。
// Approach
開発者は、LLMの能力に依存しすぎず、制御ロジック(ハーネス)で挙動を補完する手法を採用した。
- ・統合判断:1回のLLM呼び出しで、セリフ、操作、記憶の更新差分をまとめて出力させる。
- ・観測ベースの記憶:操作実行後、画面の変化を観測して初めて記憶を確定させる仕組みを構築。
- ・階層的記憶管理:RAM上の作業記憶と、セッション終了後に整理する永続記憶を分離する。
- ・適応的再試行:AIが停止した際、指数関数的な待機間隔の調整とプロンプトの段階的変更を行う。
- ・局所的高解像度比較:画面全体は縮小して変化率を測り、クリック位置周辺のみ原寸で比較する。
// Result
開発者は、育成ゲームでの自律的な操作、実況、動画編集の一連のプロセスを実現した。
- ・一貫性の確保:操作の理由を話してからクリックする、矛盾のない実況が可能になった。
- ・記憶の連続性:前回の動画の内容を踏まえた、文脈のある実況を実現した。
- ・今後の展望:現在は低速なゲーム向けだが、今後は視聴者が魅力を感じる「人格」の育成を目指す。
Senior Engineer Insight
> LLMを単なる「脳」として扱うのではなく、不完全さを補う「ハーネス」の設計に真髄がある。特に、観測後に記憶を更新する「事実確認」は、信頼性担保に極めて実践的だ。ただし、API遅延やコスト、リアルタイム性の欠如は、商用利用における大きな障壁となる。スローペースな意思決定タスクへの適用が現実的である。