【要約】打ち合わせの録音を置くだけで議事録にする仕組みを作った [Zenn_Python] | Summary by TechDistill
> Source: Zenn_Python
Execute Primary Source
// Problem
製造業のエンジニアが、機密性の高い会議の議事録作成において、作業負荷と情報漏洩のリスクに直面した。具体的には以下の課題が存在する。
- ・手作業による聞き直しと清書に、1会議あたり30〜60分を要している。
- ・会議内容が社外秘であるため、クラウドの文字起こしAPIを利用できない。
- ・AIが不確かな情報を確信を持って出力し、議事録の信頼性を損なう懸念がある。
// Approach
音声処理の決定論的な工程と、文脈判断が必要な工程を分離するハイブリッドアプローチを採用した。以下の2段階で処理を行う。
- ・フェーズ1(Pythonによる決定論的処理): ffmpegによる正規化、faster-whisperによる文字起こし、pyannote.audioによる話者分離、辞書による固有名詞置換を行う。
- ・フェーズ2(Claudeによる文脈判断): 文脈から話者を実名化し、誤変換を補正した上で、決定事項やTODOを抽出する。
- ・リスク管理: 不確かな情報は「要確認事項」として隔離し、LLMが無理に埋めないようプロンプトで制御する。
// Result
議事録作成のプロセスを大幅に効率化し、作業時間の削減とセキュリティ確保を両立した。主な成果は以下の通りである。
- ・人間の作業時間を、1会議あたり30〜60分から15分へと短縮した。
- ・音声データおよび文字起こし内容はローカルで完結し、外部への流出を防いでいる。
- ・「要確認事項」の隔離により、誤った情報を決定事項に混ぜない運用を実現した。
Senior Engineer Insight
> セキュリティと精度のトレードオフを、ローカル処理とLLMの役割分担で解決した設計は極めて実戦的だ。特に「不確かな情報を隔離する」という設計思想は、LLMのハルシネーション対策として非常に重要である。ただし、CPU実行による処理時間の長さは、大規模運用ではGPUリソースの確保が必須となる。ボトルネックの可視化と、処理のレジューム機能の実装が、プロダクション環境への投入に向けた次のステップとなるだろう。