質問
⚠️ この事例は公開されてから1年以上経過しています。 情報が古い可能性がありますので、ご注意ください。
🕓 事例公開日 : 2024-10-22
【背景】
本番環境システムでAPサーバダウンの監視アラートが発生し、監視システムから障害検知の通知を受け取った。1. 事象
監視アラート内容:
システムID:123456789000システム名:本番環境システム障害検知日時:2024-10-01 13:43:44監視項目:プロセス監視 123456789000 APサーバダウン検知検出した値:1
症状の説明:
APサーバのプロセス監視で異常が検知され、監視システムから自動的にアラートメールが送信された。2. 発生条件
本番環境のAPサーバで何らかの異常が発生し、ヘルスチェックが失敗した状況。3. 質問内容
・どのプロセスが要因でダウンが発生したのか知りたい・問題となったプロセスの監視閾値を教えてほしい
・該当プロセスのサーバ側上限設定値を確認したい
・監視メールの検出値「1」が示す意味を理解したい
回答
1. 監視対象プロセスについて
監視対象:
intra-mart Accel Platformのヘルスチェック機能により、APサーバの状態を監視しています。ヘルスチェックで異常と判定された場合に、APサーバダウンの障害メールが送信されます。ヘルスチェックの詳細:
監視対象となるヘルスチェックの仕様については、以下のドキュメントをご参照ください。https://document.intra-mart.jp/library/iap/public/setup/iap_setup_guide/texts/appendix/health_check.html#common-base-product
2. 監視閾値と上限設定
監視閾値:
死活監視の場合、監視閾値は1以上に設定されています。プロセス上限設定:
検知される可能性のあるプロセスの上限は、ご利用環境のAPサーバ台数と同じです。例えば、Small環境の場合は1台となります。3. 検出値の意味
検出値「1」の内容:
お客様のご利用環境のAPサーバのうち、1台でサーバダウンが検知されたことを示しています。参考ドキュメント:
監視サービスの詳細仕様については、以下をご確認ください。https://aws.accel-mart.com/service_manual/texts/03_specifications/03_system_operations/02_other_operations.html#monitoring-services