Yönetilen İzleme ve Gözlemlenebilirlik

İzleme altyapısını kuruyor, sonra da biz işletiyoruz — ekibinize ulaşan alarm, gerçekten müdahale gerektiren alarm oluyor.

GİTA Teknoloji, Türkiye’deki kurumlar için izleme platformlarını tasarlıyor, kuruyor ve işletiyor. Zabbix, Grafana ve Prometheus ile çalışıyor; sonucu bir pano teslim edip çekilmek yerine yönetilen hizmet olarak işletiyoruz.

Tipik bir kapsam; çok noktalı WAN bağlantısını, sanallaştırma platformlarını, güvenlik duvarlarını, Linux ve Windows sunucularını, depolamayı ve müşterinin kendi uygulamalarını özel entegrasyonlarla kapsar. Kurulum tek seferlik bir iştir; işletme ise tanımlı bir destek penceresi, yıllık talep hakkı ve eskalasyon yolu olan aylık bir yönetilen hizmettir.

Bize gelen kurumların çoğunda zaten bir izleme aracı vardır. Olmayan şey, çalışan bir alarm modelidir. Günde binlerle ifade edilen bildirimi, müdahale edilebilir birkaç alarma indirmek, operasyon ekibinin gününü asıl değiştiren iştir.

Ülke geneline yayılmış bir şube bağlantısı projesi

Bir projemiz, MPLS VPN ile merkezi veri merkezine bağlanan ülke geneline yayılmış bir şube ağını kapsıyor. Önceki platform o kadar çok bildirim üretiyordu ki operatörler bildirimleri okumayı bırakmıştı. Alarm modelini operatörün gerçekten müdahale edebileceği olaylar üzerine yeniden kurduk, periyodik raporlamayı ekledik ve günlük işletmeyi devraldık.

~320 izlenen uzak lokasyon
81 il
20 sn WAN hatlarında ICMP keepalive eşiği
~2.000/gün yeniden tasarım öncesi bildirim

Hizmetin kapsamı

Her projede aynı çekirdek yer alır; ölçek altyapının büyüklüğüne göre belirlenir.

Metrik ve olay toplama

Cihazın gerçekte ne sunduğuna göre SNMP, ICMP, TCP ve HTTP probları, SSH, REST API, syslog, WMI ve IPMI/Redfish üzerinden ajanlı veya ajansız toplama.

Alarm tasarımı ve gürültü azaltma

Eşikler, bağımlılıklar, bakım pencereleri ve flap bastırma; böylece tek bir üst katman arızası iki yüz alarm yerine tek alarm üretir.

Panolar

Kullanan kişiye göre kurgulanmış Grafana panoları — NOC için ayrı, yönetim için ayrı; herkese açık ama kimsenin açmadığı tek pano yerine.

Periyodik raporlama

Haftalık ve aylık erişilebilirlik ve olay raporları e-posta ile iletilir; hizmet kalitesi izlenimden çıkıp sayıya dönüşür.

Bildirim ve eskalasyon

E-posta, kritik alarmlar için SMS, Telegram, webhook ve sohbet platformları üzerinden iletim; eskalasyon yolu baştan mutabık kalınarak tanımlanır.

Sürekli işletme

Tanımlı destek penceresi ve yıllık talep hakkı, platform güncellemeleri ve altyapı büyüdükçe yapılan değişiklikler — yönetilen izlemenin “yönetilen” kısmı.

Çalıştığımız teknolojiler

Tek bir araca bağlı değiliz. Altyapıya göre seçiyor, çoğu zaman da birlikte kullanıyoruz.

Zabbix

Ajanlı toplama, ağ keşfi ve benzer cihazlardan oluşan geniş filolarda şablonlamada güçlü. Alarm ve görselleştirme katmanı değiştirilse bile çoğu zaman toplayıcı olarak yerinde bırakılır.

Grafana

Görselleştirme ve giderek artan biçimde alarm motoru. Grafana Alerting, farklı veri kaynakları üzerinde tek bir alarm modeli kurmayı mümkün kılar; gürültü azaltmayı uygulanabilir yapan da budur.

Prometheus

Dinamik hedefler için doğru tercih — konteynerler, mikroservisler, bulut iş yükleri; sabit sunucu listesi yerine servis keşfinin önem kazandığı ortamlar.

Exporter ve ajanlar

Standart exporter varsa o, yoksa Python veya Go ile amaca özel yazılmış olanlar.

Zaman serisi saklama

Saklama süresi gerçekten ihtiyaç duyulan raporlamaya göre boyutlandırılır; kapasite planlaması için geçmiş elde kalır, depolama sınırsız büyümez.

Kod olarak altyapı

Yapılandırma Ansible ile yönetilir; platform yeniden kurulabilir, değişiklikler hatırlanan değil incelenebilir hale gelir.

Neleri izliyoruz

WAN ve şube bağlantısı

MPLS ve internet hatları, dakika altı eşiklerle ICMP keepalive, gecikme ve paket kaybı, lokasyon bazlı erişilebilirlik raporu.

Ağ cihazları

Anahtarlar, yönlendiriciler, kablosuz denetleyiciler ve yük dengeleyiciler SNMP üzerinden; arayüz hataları, kapasite ve donanım sağlığı dahil.

Güvenlik duvarları

FortiGate ve benzeri platformlarda oturum sayıları, VPN tünel durumu, throughput, HA durumu ve donanım alarmları.

Sanallaştırma

VMware vCenter, Proxmox VE ve XenServer — host ve misafir sağlığı, kaynak baskısı, datastore kapasitesi ve küme durumu.

Sunucular ve işletim sistemleri

Linux ve Windows: CPU, bellek, disk, dosya sistemi, servis durumu, log desenleri ve IPMI/Redfish üzerinden donanım sağlığı.

Uygulamalar ve API’ler

HTTP ve TCP probları, sertifika süresi, işlem kontrolleri ve özel entegrasyonlarla kurum içi uygulamalardan alınan metrikler.

Hizmet modeli

Tek seferlik kurulum, ardından aylık hizmet. İkisi de işe başlamadan önce fiyatlanır.

Keşif

Neyin var olduğunu, neyin zaten izlendiğini, gece kimin telefonunu çaldıran alarmların hangileri olduğunu ve bunların hangisine gerçekten müdahale edildiğini çıkarıyoruz.

Kurulum

Ansible çalıştıran bir kontrol sunucusu ve izleme yığınının kendisi; altyapının büyüklüğüne göre boyutlandırılır, sizin ortamınızda veya bizim işlettiğimiz ortamda konumlandırılır.

Paralel çalışma

Alarm modeli sahada kanıtlanana kadar yeni platform mevcut platformla birlikte çalışır; geçişte hiçbir şey kaybolmaz.

Yönetilen işletme

Mesai saatleri veya genişletilmiş bir destek penceresi, mutabık kalınan yıllık talep hakkı ve isimlendirilmiş bir eskalasyon yolu.

Raporlama düzeni

Haftalık operasyon raporları ve erişilebilirlik, olaylar ve tekrar eden nedenleri kapsayan aylık hizmet değerlendirmesi.

Değişim ve büyüme

Yeni lokasyonlar, yeni cihazlar ve yeni entegrasyonlar ayrı proje olarak değil, aynı hizmet kapsamında eklenir.

Sık sorulan sorular

Mevcut Zabbix’i kaldırmak zorunda mıyız?

Hayır. Birçok projede Zabbix toplama katmanı olarak yerinde kalır; biz alarm ve görselleştirme katmanını onun üzerine yeniden kurarız. Toplayıcının da değişmesi, baştan varsayılan değil keşif sonrası verilen bir karardır.

Kendi yazdığımız uygulamayı izleyebilir misiniz?

Evet. Uygulama bir API, log, veritabanı tablosu veya port sunuyorsa bunun üzerine kontrol kurabiliriz. Kullanılabilir hiçbir şey sunmuyorsa, kapsamı ayrı belirlenen bir iş olarak Python veya Go ile exporter ya da ajan yazarız.

Hangi bildirim kanallarını destekliyorsunuz?

E-posta, kritik alarmlar için SMS, Telegram, webhook ve Slack ile Microsoft Teams gibi sohbet platformları. Alarmlar için hâlihazırda Telegram kullanan ekipler genellikle devam eder; geçiş sırasında operatörleri yeni bir kanala alıştırmanın bir gerekçesi yoktur.

Hizmet 7/24 mü?

Standart olarak mesai saatleri içinde destek penceresi sunuyoruz; altyapı gerektirdiğinde genişletilmiş kapsam mümkün. İzleme ve alarm iletimi destek penceresinden bağımsız olarak kesintisiz çalışır; destek penceresi mühendislerimizin ne zaman müdahale ettiğini tanımlar.

İzleme platformu nerede çalışır?

Genellikle kendi ortamınızdaki sanal sunucularda; böylece izleme verisi sizin altyapınızda kalır. Barındırmak istemediğiniz durumlarda bizim yönettiğimiz altyapıda da işletebiliriz.

Geçmiş verilerimize ne olur?

Mevcut toplayıcı geçiş sırasında ve sonrasında yerinde bırakılarak geçmiş veri korunabilir. Geçmişin mutlaka taşınması gerekiyorsa, bu varsayılmak yerine kurulum kapsamında ayrıca değerlendirilir.

Ekibinizi gece uyandıran alarmı anlatın

Sorunun araçta mı yoksa alarm modelinde mi olduğunu söylemek için genellikle kısa bir keşif görüşmesi yeterli oluyor.

İletişime geçin