質問
⚠️ この事例は公開されてから1年以上経過しています。 情報が古い可能性がありますので、ご注意ください。
🕓 事例公開日 : 2024-10-22
【背景】
システム監視アラートにより、データベースサーバーの異常とアプリケーションサーバーの停止が検知された。サービスに影響が発生したため、原因の調査を依頼したい。1. 事象
アラート内容:
・16:00頃:エラー検知アラート発報・16:02頃:APサーバーダウン検知アラート発報
症状の説明:
システム監視ツールから連続してアラートが通知され、アプリケーションサービスが一時的に利用できない状態となった。2. 発生条件
発生日時:9月28日(土)16:00~16:02頃対象システム:本番環境システム
回答
1. 原因
AWS基盤側のハードウェア障害により、データベースインスタンスに問題が発生し、自動リカバリによる再起動が実行されました。この影響でアプリケーションサーバーとの接続が一時的に切断され、サービス停止が発生しました。2. 対応結果
AWS側で自動リカバリが完了しており、データベースインスタンスは正常に稼働している仮想サーバーホストに移行済みです。現在、対象のデータベースインスタンスは正常に稼働しています。3. 調査方法
1. 16:00頃のエラー検知アラート確認2. 16:02頃のAPサーバーダウンアラート確認
3. 該当時間帯のシステム状況調査
4. RDSインスタンスの再起動履歴確認
5. AWS側への障害原因問い合わせ実施
6. AWS基盤側ハードウェア障害による自動リカバリの確認