Anormallik tespiti için büyük ölçekli sistem günlüklerinin ölçeklenebilir analizi

İsim Anormallik tespiti için büyük ölçekli sistem günlüklerinin ölçeklenebilir analizi
Yazar Astekin, Merve
Basım Tarihi: 2019-05-30
Konu Bulut bilişim, Dağıtık sistemler, Yazılım mühendisliği, Büyük veri, Gerçek zamanlı sistemler, Olay tespiti, Paralel hesaplama, Açık kaynaklı yazılım, Anomali tespiti, Sistem günlükleri, Yazılım analizi, Yazılım testi
Tür Belge
Dil İngilizce
Dijital Evet
Yazma Hayır
Kütüphane: Özyeğin Üniversitesi
Kayıt Numarası 87508a8e-c26e-4a81-93ce-b02dab6f69ad
Lokasyon Bilgisayar Bilimleri Bölümü
Tarih 2019-05-30
Örnek Metin Sistem günlükleri, sistem bileşenlerinin durumu ve çalışma zamanında meydana gelen çeşitli olaylar hakkında bilgi sağlar. Bu bilgiler arıza tespiti, teşhis ve tahmin faaliyetlerini destekleyebilir. Ancak her zaman standart bir yapıya uymayan büyük hacimli log verilerinin analiz edilmesi ve yorumlanması zorlu bir iştir. Ölçek arttıkça, dağıtılmış sistemler çeşitli bileşenlerden gelen büyük hacimli mesajların bir koleksiyonu olarak günlükler oluşturabilir. Böylece manuel veya geleneksel analiz tekniklerini uygulayarak anormallikleri etkin ve verimli bir şekilde izlemek ve tespit etmek mümkün olmaz. Sistem günlükleri üzerinde makine öğrenimi tekniklerini uygulayarak sistem anormalliklerini otomatik olarak tespit etmeyi amaçlayan çeşitli çalışmalar yapılmıştır. Ancak sınırlı verimlilik ve ölçeklenebilirlik sunarlar. Bu sınırlamalara neden olan üç eksiklik belirledik: i) Mevcut günlük ayrıştırma teknikleri, yapılandırılmamış günlük mesajlarını paralel ve dağıtılmış bir şekilde ayrıştırmamaktadır. ii) Günlük verileri çevrimiçi olmaktan ziyade çoğunlukla çevrimiçi modda işlenir. Yani, daha fazla veri elde edildiğinde bunları parça parça analiz etmek yerine, tüm günlük verileri önceden toplanır. iii) Mevcut çalışmalarda makine öğrenimi algoritmalarının merkezi uygulamaları kullanılmaktadır. Bu tezde, anormallik tespiti için büyük ölçekli sistem günlüklerinin uçtan uca ölçeklenebilir analizini kolaylaştırmak amacıyla bu eksiklikleri ele alıyoruz. Yapılandırılmamış günlük mesajlarının dağıtılmış analizi için bir çerçeve sunuyoruz. Çerçevemizi gerçek sistemlerden elde edilen iki grup günlük mesajıyla değerlendirdik. Sonuçlar, çerçevemizin, tamamen dağıtılmış işlemeyi kullanmayan temel yaklaşımlarla karşılaştırıldığında ortalama %30'dan fazla performans artışı sağladığını gösterdi. Ayrıca kıyaslama çalışmalarından farklı olarak kaynak kodunun bulunmasını gerektirmese de elde edilenlerle aynı doğruluk düzeyini korur. Çerçevemiz aynı zamanda günlük verilerinin ardışık zaman pencerelerinde aşamalı olarak işlendiği çevrimiçi işlemeyi de mümkün kılar. Bu yaklaşımın faydası bazı anormalliklerin daha erken tespit edilebilmesidir. Risk, doğruluğun engellenmesidir. Deneysel sonuçlar, bu riskin nadiren ortaya çıktığını, yalnızca bir pencere sınırının bir olaylar oturumunu kestiği durumlarda ortaya çıktığını gösterdi. Öte yandan ortalama anormallik tespit süresi önemli ölçüde azalır. Son olarak, PCA ve K-means algoritmalarının dağıtılmış uygulamalarını değerlendiren bir vaka çalışması sunuyoruz. Bu algoritmaların doğruluğunu ve performansını hem birbirlerine hem de merkezi uygulamalarına göre karşılaştırdık. Sonuçlar, dağıtılmış sürümlerin, merkezi sürümleriyle karşılaştırıldığında aynı doğruluğu elde edebildiğini ve büyük siparişlerde performans artışı sağlayabildiğini gösterdi. PCA'nın performansı K-means'ten daha iyi çıkıyor, ancak paralellik derecesi arttıkça ikisi arasındaki farkın azalma eğiliminde olduğunu gözlemledik. Sistem logları (günlükleri), sistem bileşenlerinin durumu ve çalışma zamanında ortaya çıkan çeşitli olaylar hakkında bilgi sağlamaktadır. Bu bilgi hata tespiti, teşhis ve tahmin faaliyetleri desteklenebilmektedir. Bununla birlikte, her zaman standart bir yapıya uymayan geniş boyutlu log verisinin analiz edilmesi ve yorumlanması oldukça zor bir iş haline gelebilmektedir. Ölçekleri, dağıtım sistemleri çeşitli şekillerden gelen çok sayıda mesajın bir yığın halinde sistem logları oluşturulabilmektedir. Bu nedenle, manuel veya geleneksel analiz teknikleri bu genişlikteki sistem loglarının verimli ve etkili bir şekilde depolanmasında ve anormalliklerin tespitinde yetersiz kalmaktadır. Sistem logları üzerinde makine öğrenme tekniklerini değiştirme sistem anormalliklerini otomatik olarak tespit etmeyi amaçlayan çeşitli çalışmalar yapılmıştır. Ancak bu üretim verimliliği ve ölçeklenebilirlik açısından sınırlı kalırlar. Bu kısıtlamalara neden olan üç eksiklik tespit ettik: i) Mevcut log ayrıştırma teknikleri, yapılandırılmamış log mesajlarını paralel ve dağıtılmış bir şekilde ayrıştırmamaktadır. ii) Log verisi genellikle çevrimiçi (akışlı) değil, çevrimdışı (yığın) modlu olarak çalıştırılmaktadır. Diğer bir deyişle, yeni log mesajları geldikçe parça parça işlemek yerine tüm log verileri önceden toplanmış yığın halinde analiz edilmektedir. iii) Mevcut çalışmalar, makine öğrenmesi geliştirmelerinin merkezi depolamaya başlar. Bu tezde, anormallik tespiti için geniş değişiklik sistem loglarının üçten uca ölçeklenebilir analizini değiştirmek amacıyla bu eksiklikleri ele alarak satın alma. Öncelikli olarak, yapılandırılmamış log mesajlarının dağıtımı analizi için bir çerçeve sunulmaktadır. Çerçevemizi, gerçek sistemlerden elde edilen iki günlük günlük mesajlarından oluşan veri seti ileterek değerlendiriyoruz. Sonuç olarak, çerçevemizin eksiksiz dağıtımını yaparak temel yöntemlere kıyasla ortalama %30'dan fazla performans artışı gösterilmiştir. Ayrıca, çerçevemiz diğer taramaların farklı olarak kaynak kodunun bulunmasını gerektirmeden, karşılaştırma çalışmaları ile elde edilenlerle aynı doğruluk seviyesini korumaktadır. İkinci olarak, çerçevemiz sistem log verisinin art arda zaman pencerelerinde işlemleri olarak işlendiği çevrimiçi işlemelerin yapılmasını sağlar. Bu yaklaşım, bazı anormalliklerin daha erken tespit edilebilmesine olanak sağlamaktadır. Öte yandan, çevrimiçi işleme anomalilerinin tespitinde ortaya çıkan güvenlik riskini doğurabilir. Deneysel sonuçlar, bu riskin ancak bir pencere sınırının bir olay kaydını kestiği zamanlarda nadiren ortaya çıktığını gösterdi. Öte yandan ortalama anomali tespit süresi önemli ölçüde kısaltılmıştır. Bu tezde son olarak PCA ve K-ortalama programlarının dağıtımını değerlendiren bir vaka çalışması sunuyoruz. Bu ekonomiklerin sağlığı ve çalışmaları, hem kapsayıcı hem de merkezi uygulamalara göre karşılaştırıldı. Sonuçlar, dağıtım ürünlerinin aynılığa doğru yeterliliklerini ve merkezi dayanıklılıklarıyla karşı onlarca kat performansın gösterildiği gösterilmiştir. PCA yazılımının görünüşünün, K-ortalama sürümlerinden daha iyi olduğu, ancak ikisi arasındaki farkın paralellik seviyesinde bozulmanın görüldüğü gözlenmiştir.
Kaynağa git Özyeğin Üniversitesi Özyeğin Üniversitesi - Tarihî eser, arşiv ve süreli yayın arama motoru
Özyeğin Üniversitesi - Tarihî eser, arşiv ve süreli yayın arama motoru Özyeğin Üniversitesi

Anormallik tespiti için büyük ölçekli sistem günlüklerinin ölçeklenebilir analizi

Yazar Astekin, Merve
Basım Tarihi 2019-05-30
Konu Bulut bilişim, Dağıtık sistemler, Yazılım mühendisliği, Büyük veri, Gerçek zamanlı sistemler, Olay tespiti, Paralel hesaplama, Açık kaynaklı yazılım, Anomali tespiti, Sistem günlükleri, Yazılım analizi, Yazılım testi
Tür Belge
Dil İngilizce
Dijital Evet
Yazma Hayır
Kütüphane Özyeğin Üniversitesi
Kayıt Numarası 87508a8e-c26e-4a81-93ce-b02dab6f69ad
Lokasyon Bilgisayar Bilimleri Bölümü
Tarih 2019-05-30
Örnek Metin Sistem günlükleri, sistem bileşenlerinin durumu ve çalışma zamanında meydana gelen çeşitli olaylar hakkında bilgi sağlar. Bu bilgiler arıza tespiti, teşhis ve tahmin faaliyetlerini destekleyebilir. Ancak her zaman standart bir yapıya uymayan büyük hacimli log verilerinin analiz edilmesi ve yorumlanması zorlu bir iştir. Ölçek arttıkça, dağıtılmış sistemler çeşitli bileşenlerden gelen büyük hacimli mesajların bir koleksiyonu olarak günlükler oluşturabilir. Böylece manuel veya geleneksel analiz tekniklerini uygulayarak anormallikleri etkin ve verimli bir şekilde izlemek ve tespit etmek mümkün olmaz. Sistem günlükleri üzerinde makine öğrenimi tekniklerini uygulayarak sistem anormalliklerini otomatik olarak tespit etmeyi amaçlayan çeşitli çalışmalar yapılmıştır. Ancak sınırlı verimlilik ve ölçeklenebilirlik sunarlar. Bu sınırlamalara neden olan üç eksiklik belirledik: i) Mevcut günlük ayrıştırma teknikleri, yapılandırılmamış günlük mesajlarını paralel ve dağıtılmış bir şekilde ayrıştırmamaktadır. ii) Günlük verileri çevrimiçi olmaktan ziyade çoğunlukla çevrimiçi modda işlenir. Yani, daha fazla veri elde edildiğinde bunları parça parça analiz etmek yerine, tüm günlük verileri önceden toplanır. iii) Mevcut çalışmalarda makine öğrenimi algoritmalarının merkezi uygulamaları kullanılmaktadır. Bu tezde, anormallik tespiti için büyük ölçekli sistem günlüklerinin uçtan uca ölçeklenebilir analizini kolaylaştırmak amacıyla bu eksiklikleri ele alıyoruz. Yapılandırılmamış günlük mesajlarının dağıtılmış analizi için bir çerçeve sunuyoruz. Çerçevemizi gerçek sistemlerden elde edilen iki grup günlük mesajıyla değerlendirdik. Sonuçlar, çerçevemizin, tamamen dağıtılmış işlemeyi kullanmayan temel yaklaşımlarla karşılaştırıldığında ortalama %30'dan fazla performans artışı sağladığını gösterdi. Ayrıca kıyaslama çalışmalarından farklı olarak kaynak kodunun bulunmasını gerektirmese de elde edilenlerle aynı doğruluk düzeyini korur. Çerçevemiz aynı zamanda günlük verilerinin ardışık zaman pencerelerinde aşamalı olarak işlendiği çevrimiçi işlemeyi de mümkün kılar. Bu yaklaşımın faydası bazı anormalliklerin daha erken tespit edilebilmesidir. Risk, doğruluğun engellenmesidir. Deneysel sonuçlar, bu riskin nadiren ortaya çıktığını, yalnızca bir pencere sınırının bir olaylar oturumunu kestiği durumlarda ortaya çıktığını gösterdi. Öte yandan ortalama anormallik tespit süresi önemli ölçüde azalır. Son olarak, PCA ve K-means algoritmalarının dağıtılmış uygulamalarını değerlendiren bir vaka çalışması sunuyoruz. Bu algoritmaların doğruluğunu ve performansını hem birbirlerine hem de merkezi uygulamalarına göre karşılaştırdık. Sonuçlar, dağıtılmış sürümlerin, merkezi sürümleriyle karşılaştırıldığında aynı doğruluğu elde edebildiğini ve büyük siparişlerde performans artışı sağlayabildiğini gösterdi. PCA'nın performansı K-means'ten daha iyi çıkıyor, ancak paralellik derecesi arttıkça ikisi arasındaki farkın azalma eğiliminde olduğunu gözlemledik. Sistem logları (günlükleri), sistem bileşenlerinin durumu ve çalışma zamanında ortaya çıkan çeşitli olaylar hakkında bilgi sağlamaktadır. Bu bilgi hata tespiti, teşhis ve tahmin faaliyetleri desteklenebilmektedir. Bununla birlikte, her zaman standart bir yapıya uymayan geniş boyutlu log verisinin analiz edilmesi ve yorumlanması oldukça zor bir iş haline gelebilmektedir. Ölçekleri, dağıtım sistemleri çeşitli şekillerden gelen çok sayıda mesajın bir yığın halinde sistem logları oluşturulabilmektedir. Bu nedenle, manuel veya geleneksel analiz teknikleri bu genişlikteki sistem loglarının verimli ve etkili bir şekilde depolanmasında ve anormalliklerin tespitinde yetersiz kalmaktadır. Sistem logları üzerinde makine öğrenme tekniklerini değiştirme sistem anormalliklerini otomatik olarak tespit etmeyi amaçlayan çeşitli çalışmalar yapılmıştır. Ancak bu üretim verimliliği ve ölçeklenebilirlik açısından sınırlı kalırlar. Bu kısıtlamalara neden olan üç eksiklik tespit ettik: i) Mevcut log ayrıştırma teknikleri, yapılandırılmamış log mesajlarını paralel ve dağıtılmış bir şekilde ayrıştırmamaktadır. ii) Log verisi genellikle çevrimiçi (akışlı) değil, çevrimdışı (yığın) modlu olarak çalıştırılmaktadır. Diğer bir deyişle, yeni log mesajları geldikçe parça parça işlemek yerine tüm log verileri önceden toplanmış yığın halinde analiz edilmektedir. iii) Mevcut çalışmalar, makine öğrenmesi geliştirmelerinin merkezi depolamaya başlar. Bu tezde, anormallik tespiti için geniş değişiklik sistem loglarının üçten uca ölçeklenebilir analizini değiştirmek amacıyla bu eksiklikleri ele alarak satın alma. Öncelikli olarak, yapılandırılmamış log mesajlarının dağıtımı analizi için bir çerçeve sunulmaktadır. Çerçevemizi, gerçek sistemlerden elde edilen iki günlük günlük mesajlarından oluşan veri seti ileterek değerlendiriyoruz. Sonuç olarak, çerçevemizin eksiksiz dağıtımını yaparak temel yöntemlere kıyasla ortalama %30'dan fazla performans artışı gösterilmiştir. Ayrıca, çerçevemiz diğer taramaların farklı olarak kaynak kodunun bulunmasını gerektirmeden, karşılaştırma çalışmaları ile elde edilenlerle aynı doğruluk seviyesini korumaktadır. İkinci olarak, çerçevemiz sistem log verisinin art arda zaman pencerelerinde işlemleri olarak işlendiği çevrimiçi işlemelerin yapılmasını sağlar. Bu yaklaşım, bazı anormalliklerin daha erken tespit edilebilmesine olanak sağlamaktadır. Öte yandan, çevrimiçi işleme anomalilerinin tespitinde ortaya çıkan güvenlik riskini doğurabilir. Deneysel sonuçlar, bu riskin ancak bir pencere sınırının bir olay kaydını kestiği zamanlarda nadiren ortaya çıktığını gösterdi. Öte yandan ortalama anomali tespit süresi önemli ölçüde kısaltılmıştır. Bu tezde son olarak PCA ve K-ortalama programlarının dağıtımını değerlendiren bir vaka çalışması sunuyoruz. Bu ekonomiklerin sağlığı ve çalışmaları, hem kapsayıcı hem de merkezi uygulamalara göre karşılaştırıldı. Sonuçlar, dağıtım ürünlerinin aynılığa doğru yeterliliklerini ve merkezi dayanıklılıklarıyla karşı onlarca kat performansın gösterildiği gösterilmiştir. PCA yazılımının görünüşünün, K-ortalama sürümlerinden daha iyi olduğu, ancak ikisi arasındaki farkın paralellik seviyesinde bozulmanın görüldüğü gözlenmiştir.
Özyeğin Üniversitesi - Tarihî eser, arşiv ve süreli yayın arama motoru
Özyeğin Üniversitesi yönlendiriliyorsunuz...

Lütfen bekleyiniz.