【要約】Four major AI models suffer rare overlapping downtime [Ars_Technica] | Summary by TechDistill
> Source: Ars_Technica
Execute Primary Source
// Problem
主要なAIプロバイダーが、同時期に大規模なサービス障害に直面した。各社が提供する最先端のLLMモデルにおいて、リクエストエラーや性能低下が発生した。具体的には以下の問題が確認された。
- ・Anthropic: Claude Mythos 5.1、Fable 5.1、Opus 5等でエラーが発生。
- ・OpenAI: ChatGPTおよびCodexにおいて性能低下が発生。
- ・xAI: Grokにおいてユーザー向けエラーメッセージが表示。
- ・Google: Gemini APIにおいて一時的な停止が発生。
// Approach
各プロバイダーは、障害検知後に迅速な原因特定と緩和策の実施を行った。各社は独自のインフラ管理体制に基づき、復旧作業を進めた。
- ・Anthropic: 原因を特定し、修正プログラムをデプロイして解決。
- ・OpenAI: 緩和策を講じ、性能を正常な状態へ回復。
- ・xAI: サービスの迅速な復旧に向けて継続的な作業を実施。
- ・Google: APIのステータスを正常な状態へ復帰。
// Result
各社は、迅速な復旧作業を通じてサービスの正常化を図った。障害は数時間以内に解消され、各モデルの稼働率は概ね高い水準を維持している。
- ・Anthropic: 過去90日間で99.4%の稼働率を記録。
- ・OpenAI: ChatGPTで99.63%、Codexで100%の稼働率を維持。
- ・インフラ側: AWS、Azure、Cloudflareに大きな問題は確認されず。
Senior Engineer Insight
> 4大モデルの同時障害は、単一のクラウド基盤の故障ではなく、共通の依存関係を疑うべき事象だ。AIをプロダクション環境に組み込む際は、単一モデルへの依存は極めて危険である。マルチモデル構成によるフェイルオーバー設計が、可用性確保の必須要件となる。インフラの冗長化だけでなく、モデルの冗長化も検討すべきだ。