【要約】スター3000超の『規制産業向けAI監査基盤』ルールエンジンがreturn Trueだった [Zenn_Python] | Summary by TechDistill
> Source: Zenn_Python
Execute Primary Source
// Problem
検証者が、高機能なAI監査基盤を謳うOSS「semantica」の信頼性を検証した。その際、READMEのコード例が期待通りに動作しない問題に直面した。
- ・Reteエンジンが条件評価を行わず、条件数により極端な挙動を示す。
- ・因果連鎖の追跡が、張られたエッジを無視した推測に基づいている。
- ・意味検索が、意味理解ではなく単語の表層一致に依存している。
- ・監査証跡の出力に、謳われているPROV-O語彙が含まれていない。
- ・主要な機能の入り口が、誤った実装やエイリアスを案内している。
// Approach
検証者は、READMEのコード例をそのまま実行し、期待値との乖離を検証した。
- ・Python 3.14環境を用い、依存関係を最小限に絞って検証を実施。
- ・Reteエンジン、Decision Intelligence、Provenanceを個別に検証。
- ・Datalogエンジンや正しいPROV-O出力メソッドとの比較検証を実施。
- ・READMEの記載内容と、実際の実行結果を一つずつ突き合わせる。
- ・重い依存関係を避け、軽量なパッケージのみで中核機能の動作を確認。
- ・検証環境は、軽量な15個のパッケージのみを導入して構築した。
// Result
検証の結果、READMEの看板機能の多くが、期待通りに動作しないことが判明した。
- ・Reteエンジンは1条件なら無条件マッチ、2条件以上なら全拒否となる。
- ・因果連鎖や意味検索は、READMEの例では期待通りに動作しない。
- ・一方で、Datalogエンジンや正しいPROV-O出力の実装は正常に動作する。
- ・テストコードは存在するが、CIで自動実行されていないことが判明した。
- ・実装は存在するが、ドキュメントが誤った入り口を案内している。
Senior Engineer Insight
> 実装は存在するが、ドキュメントが誤ったAPIを案内している。これは開発体験を著しく損なう。CIでテストが自動実行されていない点も、品質保証の観点から極めて危うい。大規模トラフィックや厳格なコンプライアンスが求められる現場での採用は、現時点では不可能である。