Daha fazla grafik, daha iyi görünürlük demek değildir

Homelab büyüdükçe izleme panoları da şişer. CPU eğrileri, container metrikleri, onlarca warning ve sonunda görmezden gelinen bir bildirim yığını. Bu yazının tezi basit: İzlemenin amacı veri biriktirmek değil, doğru anda doğru aksiyonu tetiklemektir. Bunun için sinyalleri katmanlara ayırmak gerekir.

İzleme ve analitik panosuİlk katman erişilebilirliktir. Dışarıdan kritik hostname’lerin ayakta olup olmadığı ölçülür. Site açılmıyorsa disk doluluğu grafiği ikinci plandadır. İkinci katman kaynak sağlığıdır: CPU, bellek, disk, inode, depolama doluluğu. Üçüncü katman servis sinyalleridir: VM/container health, sertifika süresi, yedek job sonucu, reverse proxy upstream hataları.

Bu üç katmanı aynı alarm kanalına yığmak gürültü üretir. Uptime için hızlı bir kanal; kaynak için günlük özet; servis için runbook’lu uyarı daha sürdürülebilir bir düzendir.

Katmanlar ve örnekler

  • Uptime: aniltanrikulu.com, kritik reverse proxy hostname’leri
  • Kaynak: disk yüzde 85/95, bellek baskısı, inode tükenmesi
  • Servis: yedek job fail, TLS 14 gün kala, container restart loop

Operasyon masası ve müdahale ortamıAlarm tasarımında bilgi amaçlı uyarılar hızla değersizleşir. Her alarm bir aksiyon çağrısı olmalıdır: yeniden başlat, disk temizle, sertifikayı yenile, yedeği yeniden çalıştır. Runbook’u yazılamayan alarmı ya eşiği yükselterek yumuşatın ya da tamamen kapatın.

İyi bir homelab izleme yığını sabah size “her şey yolunda” veya “şu üç noktaya bak” der. Panoda yüzlerce yeşil kutu göstermek başarı değildir; gürültüyü azaltıp güvenilir sinyali korumak başarıdır.