データベースサーバーの自動再起動によるサービス停止

質問

⚠️ この事例は公開されてから1年以上経過しています。 情報が古い可能性がありますので、ご注意ください。

🕓 事例公開日 : 2024-10-22

【背景】

システム監視アラートにより、データベースサーバーの異常とアプリケーションサーバーの停止が検知された。サービスに影響が発生したため、原因の調査を依頼したい。



1. 事象

アラート内容:

・16:00頃:エラー検知アラート発報
・16:02頃:APサーバーダウン検知アラート発報

症状の説明:

システム監視ツールから連続してアラートが通知され、アプリケーションサービスが一時的に利用できない状態となった。



2. 発生条件

発生日時:9月28日(土)16:00~16:02頃
対象システム:本番環境システム

回答

1. 原因

AWS基盤側のハードウェア障害により、データベースインスタンスに問題が発生し、自動リカバリによる再起動が実行されました。この影響でアプリケーションサーバーとの接続が一時的に切断され、サービス停止が発生しました。

2. 対応結果

AWS側で自動リカバリが完了しており、データベースインスタンスは正常に稼働している仮想サーバーホストに移行済みです。現在、対象のデータベースインスタンスは正常に稼働しています。

3. 調査方法

1. 16:00頃のエラー検知アラート確認
2. 16:02頃のAPサーバーダウンアラート確認
3. 該当時間帯のシステム状況調査
4. RDSインスタンスの再起動履歴確認
5. AWS側への障害原因問い合わせ実施
6. AWS基盤側ハードウェア障害による自動リカバリの確認
この記事は役に立ちましたか?
0人中0人がこの記事が役に立ったと言っています
Powered by Zendesk