APサーバのディスク逼迫によるサービス停止

質問

🕓 事例公開日 : 2026-06-23

【背景】

APサーバでディスク容量が不足し、サービスが停止した。サーバ再起動を試みたが、容量不足により異常終了してしまう状況となった。



1. 事象

症状の説明:

APサーバのディスク容量が逼迫し、サービスが停止する。サーバ再起動を実施しても、容量不足のため正常に起動できず異常終了する。


2. 発生条件

特定の日時を起点にディスク使用率が急激に増加し、容量が逼迫した環境で発生。

回答

1. 原因

技術的な原因:

ログレベルがDEBUGに設定されていたため、データ処理実行のたびに詳細なトレース情報が大量に出力され、ログファイルが肥大化したことが直接的な原因です。

技術的要因の分析:

  • 要因1:ログレベルがDEBUGに設定されていた → データ処理のたびに詳細なトレース情報が大量出力
  • 要因2:logic_flow.logファイルが大容量に肥大化 → ディスク容量を大幅に圧迫
  • 要因3:jvm-app-0.logファイルが複数世代蓄積 → さらにディスク容量を消費
  • 要因4:ディスク容量が逼迫した状態でサーバ再起動を実施 → 起動処理に必要な一時領域が確保できず異常終了

根本的な要因:

ログレベルがDEBUGに設定されていたことにより、通常運用では不要な詳細ログが継続的に出力され、短期間でディスク容量を消費したことが根本原因です。

2. 対応方法

根本解決方法:

1. ログレベルをDEBUGからINFOへ変更し、不要な詳細ログの出力を抑制する
2. 定期的にログファイルのサイズを監視し、肥大化を早期に検知する体制を構築する
3. ログローテーション設定を見直し、古いログファイルが自動削除されるよう設定する

暫定対処方法:

1. 運用管理サイトのリストア機能を使用し、ディスク容量が逼迫する前のバックアップから環境を復元する
2. リストアが困難な場合は、肥大化したログファイルを手動で削除し、ディスク容量を確保する
3. サーバを再起動し、サービスが正常に起動することを確認する

3. 原因究明に至るまでの調査方法

1. 運用管理サイトでディスク使用率の推移を確認し、急増した時刻を特定
2. APサーバにアクセスし、ディスク使用量の大きいファイルを調査(duコマンド等を使用)
3. 以下のログファイルが大容量を占めていることを確認:
  • /opt/accel-mart/logs/resin/jvm-app-0.log(複数世代存在)
  • /opt/accel-mart/logs/intra-mart/platform/logic_flow.log(大容量)
4. ログファイルの出力内容を確認し、ログレベルがDEBUGに設定されていることを特定
5. DEBUGレベルでの詳細トレース情報が大量出力されていることを確認し、ログ肥大化の原因と判断
6. お客様の承認を得た上で、肥大化したログファイルを削除してディスク容量を確保
7. サーバ再起動後、サービスが正常に動作することを確認し、対応完了
再発防止策
ログレベルをINFOに変更することで、同様の事象の再発を防止できます。また、定期的なディスク使用率の監視とログファイルの管理体制の構築をご検討ください。
この記事は役に立ちましたか?
0人中0人がこの記事が役に立ったと言っています
Powered by Zendesk