【要約】Vision LLM に文字を読ませると、自信を持って間違える [Zenn_Python] | Summary by TechDistill
> Source: Zenn_Python
Execute Primary Source
// Problem
開発者はVision LLMによるOCRで課題を抱える。モデルが読めない箇所を、自然な日本語として捏造し誤読を隠蔽するからだ。
- ・モデルは読めない文字を、文脈から推測して「正解」のように出力する。
- ・誤読が自然なため、人間が校正しても気づきにくい。
- ・「囲みの数」が少ないモデルほど、大量の誤読を隠蔽しているリスクがある。
- ・物理的な欠損に対し、モデルが勝手に補完してしまう。
// Approach
開発者は、不確実な箇所を記号で囲むプロンプトと、人間が確認するワークフローを構築した。
- ・
scan2mdを開発し、読めない箇所を{{...}}で囲むよう指示した。 - ・プロンプトに「理由」を添え、文脈からの推測を促した。
- ・「語句全体を囲む」指示を追加し、誤読の検知範囲を広げた。
- ・
review.htmlで、拡大画像と推測値を突き合わせる校正フローを実装した。
// Result
プロンプトの改善により、誤読の検知精度と校正の効率を向上させた。
- ・「理由を添える」ことで、推測可能な箇所の申告数を増やした。
- ・「語句全体を囲む」指示により、Sonnet 5の囲み幅が拡大した。
- ・これにより、誤読の取りこぼしを抑制することに成功した。
- ・ただし、「囲みの数」は正しさを示す指標にはならないと判明した。
Senior Engineer Insight
> Vision LLMの実運用では、モデルの「自信」を鵜呑みにするのは危険だ。モデルは誤読を自然な文脈で隠蔽する性質を持つ。システム設計では、不確実性をいかに明示させるかという「不確実性の制御」に注力すべきだ。また、囲みの数などの表面的な指標に惑わされず、ページ全体の突き合わせによる厳格な評価が不可欠である。