APサーバダウン検知の監視項目と閾値について

質問

⚠️ この事例は公開されてから1年以上経過しています。 情報が古い可能性がありますので、ご注意ください。

🕓 事例公開日 : 2024-10-22

【背景】

本番環境システムでAPサーバダウンの監視アラートが発生し、監視システムから障害検知の通知を受け取った。



1. 事象

監視アラート内容:

システムID:123456789000システム名:本番環境システム障害検知日時:2024-10-01 13:43:44監視項目:プロセス監視 123456789000 APサーバダウン検知検出した値:1

症状の説明:

APサーバのプロセス監視で異常が検知され、監視システムから自動的にアラートメールが送信された。



2. 発生条件

本番環境のAPサーバで何らかの異常が発生し、ヘルスチェックが失敗した状況。

3. 質問内容

・どのプロセスが要因でダウンが発生したのか知りたい
・問題となったプロセスの監視閾値を教えてほしい
・該当プロセスのサーバ側上限設定値を確認したい
・監視メールの検出値「1」が示す意味を理解したい

回答

1. 監視対象プロセスについて

監視対象:

intra-mart Accel Platformのヘルスチェック機能により、APサーバの状態を監視しています。ヘルスチェックで異常と判定された場合に、APサーバダウンの障害メールが送信されます。

ヘルスチェックの詳細:

監視対象となるヘルスチェックの仕様については、以下のドキュメントをご参照ください。
https://document.intra-mart.jp/library/iap/public/setup/iap_setup_guide/texts/appendix/health_check.html#common-base-product

2. 監視閾値と上限設定

監視閾値:

死活監視の場合、監視閾値は1以上に設定されています。

プロセス上限設定:

検知される可能性のあるプロセスの上限は、ご利用環境のAPサーバ台数と同じです。例えば、Small環境の場合は1台となります。

3. 検出値の意味

検出値「1」の内容:

お客様のご利用環境のAPサーバのうち、1台でサーバダウンが検知されたことを示しています。

参考ドキュメント:

監視サービスの詳細仕様については、以下をご確認ください。
https://aws.accel-mart.com/service_manual/texts/03_specifications/03_system_operations/02_other_operations.html#monitoring-services
この記事は役に立ちましたか?
0人中0人がこの記事が役に立ったと言っています
Powered by Zendesk