サーバー障害の一次切り分け手順
CPU・メモリ・ディスク・ネットワーク・サービス・ログを確認する基本手順
障害対応や日常運用で迷ったときに、確認の順序と判断材料を整理するためのガイドです。
CPU・メモリ・ディスク・ネットワーク・サービス・ログを確認する基本手順
容量不足、inode不足、ディレクトリ使用量、削除済みopen file、ログ使用量を安全に確認する手順
MemAvailable、swap、プロセス別メモリ、swap in/out、OOM記録を安全に確認する手順
load average、CPU使用状況、プロセス別CPU、実行待ち・I/O待ちを安全に確認する手順
IPアドレス、route、listening port、名前解決、ICMP、HTTP(S)疎通を安全に確認する手順
service状態、unit設定、終了結果、journal logを安全に確認する手順