Gerçek Zamanlı Kesinti İstihbaratı: Nedir?
Gerçek zamanlı kesinti istihbaratı, güncel hizmet sağlığı sinyallerini; kullanıcıların neler yaşıyor olabileceğine, aksamanın ne kadar geniş göründüğüne ve karar alıcıların ardından ne yapması gerektiğine dair kanıta dayalı bir görünüme dönüştürme disiplinidir. Anında kök neden ya da kusursuz kapsama vaat etmez. Değeri, olay henüz gelişirken belirsizliği azaltmasındadır.
Yayımlandı 2026-09-26 · 6 dk. okuma · İnceleyen SID Monitor Editör Ekibi
Pratik bir tanım
Gerçek zamanlı kesinti istihbaratının tek bir sektör standardı tanımı yoktur. Bu makalede, bir hizmet aksamasına ilişkin kanıtları toplayıp yorumlayan, bu kanıtları kullanıcı ve iş etkisiyle ilişkilendiren ve koşullar değiştikçe görünümü güncel tutan zamana duyarlı bir yetenek anlamına gelir. Çıktı, yalnızca kırmızı/yeşil bir erişilebilirlik kontrolü değildir. Neyin başarısız olduğuna, kimlerin etkilenebileceğine, ne bilindiğine ve bu değerlendirmenin ne ölçüde kesin olduğuna ilişkin karar almaya hazır bir açıklamadır.
Bu önemlidir; çünkü bir kesinti ilk başta çoğu zaman belirsizdir. Bir hizmet küresel olarak kullanılamıyor, bir bölgede düşük performans gösteriyor, yalnızca bir iş akışında başarısız oluyor ya da erişilebilir olduğu hâlde yanlış sonuçlar döndürüyor olabilir. Google’ın SRE rehberi, dışarıdan görünen davranışın (“kara kutu”) izlenmesini iç telemetriden (“beyaz kutu”) ayırır ve gözlemlenebilir bir belirti ile alttaki neden arasındaki farkı vurgular. [1] Gerçek zamanlı kesinti istihbaratı bu ayrımı korumalıdır: müşteri tarafından görülen durumu hızla bildirmeli, ancak şüphelenilen bir nedeni yerleşik gerçek olarak sunmamalıdır.
Onu “akıllı” kılan kanıt nedir?
Dayanıklı bir istihbarat görünümü, herhangi bir akışı kesin sonuç saymak yerine birbirini tamamlayan sinyalleri birleştirir. Dış kontroller ve kullanıcı raporları, insanların ne deneyimlediğini gösterebilir. Hizmet metrikleri, günlükler, izler, dağıtım olayları, bağımlılık durumu ve destek talepleri, durumun kapsamını belirlemeye ve araştırmaya yardımcı olabilir. Google, metrikleri, metin ve yapılandırılmış günlük kaydını, dağıtık izlemeyi ve olay içgözlemini izleme girdileri olarak listeler; ayrıca metriklerin genellikle hızlı uyarıları desteklediğini, günlüklerin ise çoğu zaman kök nedeni araştırmak için gereken ayrıntıyı sağladığını belirtir. [2]
Kullanıcıya dönük bir hizmet için Google’ın dört izleme sinyali—gecikme, trafik, hatalar ve doygunluk—yararlı bir başlangıç çerçevesidir. Bunlar, kesin bir arızayı yavaş bir hizmetten, trafik değişiminden, yüksek hata oranından veya kapasite kısıtından ayırmaya yardımcı olur. [1] Ancak her soruyu yanıtlamazlar. 200 yanıtı yine de yanlış içeriği sunabilir; bölgesel bir ağ yolu başarısız olurken bir iç metrik normal görünebilir. Bağımsız dış gözlemler ile iç telemetrinin farklı amaçlara hizmet etmesinin nedeni budur.
İstihbarat ayrıca zaman ve kapsam boyunca korelasyon gerektirir. Tek başına başarısız bir yoklama, tek bir şikâyet veya bir durum sayfası güncellemesi kanıttır; tam bir olay anlatısı değildir. Ekipler kaynak atfını, zaman damgalarını, biliniyorsa etkilenen bileşenleri ya da coğrafyaları ve belirtilmiş bir güven düzeyini saklamalıdır. Bu, geçmişi yeniden yazmadan veya kesinliği abartmadan sonuçları güncellemeyi mümkün kılar.
Sinyalden operasyonel karara
Operasyonel sıra ilke olarak basittir: anlamlı bir belirtiyi tespit etmek, onu bağımsız kanıtla doğrulamak, etkiyi ve kapsamı değerlendirmek, müdahaleyi koordine etmek, bilinenleri iletmek ve kalıcı toparlanmayı teyit etmek. Uygulamada sıra, yeni kanıtlar geldikçe çakışır ve tekrarlanır.
Hizmet düzeyi hedefleri (SLO’lar) karar eşiğini daha somut hâle getirir. Google Cloud, hizmet düzeyi göstergesini (SLI) bir performans ölçümü, SLO’yu bu ölçüm için istenen performans ve hata bütçesini de SLO’nun ima ettiği tolerans olarak tanımlar. Erişilebilirlik ve gecikme, iyi isteklerin veya çağrıların tüm isteklere ya da çağrılara oranı olarak gösterilebilir. [3] Bu, operasyonel sinyalleri keyfî bir uyarı eşiği yerine açık bir hizmet beklentisine bağlar. Bir hata bütçesinin hızla tüketilmesi, daha geniş bir başarısızlık zincirleme yayılmadan önce uyarı sağlayabilir. [3]
İletişim, sonradan akla gelen bir unsur değil, müdahalenin parçasıdır. Atlassian’ın olay rehberi, bir sorunu erken kabul etmeyi, bilinen etkiyi açıklamayı, uygun bir sıklıkta güncelleme yapmayı ve kanallar arasında kesin ve tutarlı iletişim kurmayı önerir. [4] Yöneticiler için bu, müşteri mesajlaşması, süreklilik öncelikleri ve eskalasyona ilişkin daha net kararları destekler. Teknik ekipler için ise mükerrer triyajı azaltır ve müdahale ekiplerine ortak, zaman damgalı bir operasyonel görünüm sağlar.
Sınırlar: gerçek zaman her şeyi bilmek değildir
“Gerçek zaman”, anında tespit, tam kapsama veya doğrulanmış nedensellik garantisini değil, bilginin güncelliğini ve operasyonel faydasını ifade etmelidir. Metrikler gerçek zamana yakın olabilir ancak tanısal ayrıntı içermeyebilir; günlükler daha zengin olabilir fakat bir miktar gecikmeyle görünür hâle gelebilir. [2] Dış gözlemler müşteriyle ilgili bir sorunu ortaya çıkarabilir; ancak tek başlarına iç kök nedeni kanıtlayamaz. Kullanıcı raporları değerli bir bakış açısı ekler, ancak eksik, yinelenmiş veya yerel koşullarca şekillenmiş olabilir.
Buna göre, iyi kesinti istihbaratı gözlemleri yorumlardan ayırır. Bilinmeyenleri etiketler, doğrulanmış geri dönüşü ilk toparlanma sinyalinden ayırır ve kanıt olmadan bir güvenlik olayı, üçüncü taraf hatası, coğrafi kapsam veya süre iddia etmekten kaçınır. CISA da açık, uygulanabilir olay müdahale planlarını ve önleme, tespit ile müdahale kaynaklarını vurgular; istihbarat, bu yerleşik karar yollarını beslediğinde en yararlıdır. [5]
SID Monitor perspektifi: çalışırlık yetkinliği için kesinti istihbaratı
SID Monitor için kesinti istihbaratı, kuruluşların belirsizlikten orantılı eyleme geçmesine yardımcı olduğunda en yararlıdır: canlı bir hizmet durumunu anlamak, sorumlu biçimde iletişim kurmak ve toparlanma sonrasında hangi güvenilirlik sorularının ilgiyi hak ettiğini öğrenmek. Amaç, dramatik olay anlatımı veya kusursuz öngörü iddiası değil, çalışırlık yetkinliğidir.
Status Is Down’ın herkese açık platform rakamları, çevresindeki kamuya açık kaydın genişliğine ilişkin yararlı bir gösterge sunar: izlenen 2M+ web sitesi, 13.500+ hizmet, belgelenmiş 20.000+ geçmiş kesinti ve 60+ kategori. [6] Bu toplamlar yalnızca herkese açık platform ölçeğini açıklar. Bir hizmetin güvenilirliğini ortaya koymaz, nedenselliği kanıtlamaz veya tek tek sağlayıcılar hakkında iddiaları desteklemez. Ayrıca gözlemlenmemiş üç aylık değişimleri çıkarsamak için de kullanılmamalıdır.
Metodoloji ve uyarılar
Bu araştırma taslağı, Google SRE ve Google Cloud belgeleri, CISA ve NIST yayınları, Atlassian’ın olay iletişimi rehberi ile Status Is Down’ın herkese açık platform sayfasından elde edilen güncel ve kamuya açık rehberliği sentezler. Kaynaklar, birincil veya operasyonel nitelikleri nedeniyle seçilmiş ve tamamı okunmuştur. Gerçek zamanlı kesinti istihbaratı tanımı, resmi bir standart veya herhangi bir özel SID Monitor sürecinin açıklaması değil, pratik bir editoryal sentezdir.
Bir Q3 özeti için, yukarıdaki SID rakamları burada kullanılan tek herkese açık toplamlardır. Bu gözlemler atıf yapılan kamuya açık verilerle ortaya konmadığından, üç aylık kesinti hacmi, kategori hareketi, toparlanma eğilimi, müşteri etkisi veya piyasa karşılaştırması ileri sürülmemektedir.
Kaynaklar
- Google SRE: Monitoring Distributed Systems — Google Site Reliability Engineering
- Google SRE Workbook: Monitoring — Google Site Reliability Engineering
- Google Cloud Observability: Concepts in service monitoring — Google Cloud
- Atlassian Statuspage: Incident communication tips — Atlassian
- CISA: Incident Response — Cybersecurity and Infrastructure Security Agency
- Status Is Down public platform page — Status Is Down