تجزیه و تحلیل مقیاس پذیر لاگ سیستم در مقیاس بزرگ برای تشخیص ناهنجاری

عنوان تجزیه و تحلیل مقیاس پذیر لاگ سیستم در مقیاس بزرگ برای تشخیص ناهنجاری
نویسنده استکین، مروه
تاریخ انتشار: 2019-05-30
موضوع رایانش ابری، سیستم‌های توزیع‌شده، مهندسی نرم‌افزار، داده‌های بزرگ، سیستم‌های بلادرنگ، تشخیص رویداد، محاسبات موازی، نرم‌افزار منبع باز، تشخیص ناهنجاری، گزارش‌های سیستم، تجزیه و تحلیل نرم‌افزار، تست نرم‌افزار
نوع سند
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه: دانشگاه اوزیغین
شماره ثبت 87508a8e-c26e-4a81-93ce-b02dab6f69ad
محل کتابخانه گروه علوم کامپیوتر
تاریخ 2019-05-30
متن نمونه گزارش های سیستم اطلاعاتی را در مورد وضعیت اجزای سیستم و رویدادهای مختلفی که در زمان اجرا رخ می دهند، ارائه می دهد. این اطلاعات می تواند از فعالیت های تشخیص، تشخیص و پیش بینی خطا پشتیبانی کند. با این حال، تجزیه و تحلیل و تفسیر حجم عظیمی از داده های گزارش، که همیشه با یک ساختار استاندارد مطابقت ندارد، یک کار چالش برانگیز است. با افزایش مقیاس، سیستم های توزیع شده می توانند گزارش ها را به عنوان مجموعه ای از حجم عظیمی از پیام ها از چندین مؤلفه تولید کنند. بنابراین، نظارت و تشخیص ناهنجاری ها به طور مؤثر و مؤثر با استفاده از تکنیک های تحلیل دستی یا سنتی غیر ممکن می شود. مطالعات متعددی انجام شده است که هدف آنها تشخیص خودکار ناهنجاری‌های سیستم با استفاده از تکنیک‌های یادگیری ماشین در گزارش‌های سیستم است. با این حال، آنها کارایی و مقیاس پذیری محدودی دارند. ما سه کاستی را شناسایی کردیم که باعث این محدودیت‌ها می‌شوند: الف) تکنیک‌های تجزیه گزارش موجود، پیام‌های گزارش بدون ساختار را به صورت موازی و توزیع شده تجزیه نمی‌کنند. ii) داده های گزارش عمدتاً در حالت O ine به جای آنلاین پردازش می شوند. به این معنا که کل داده‌های گزارش از قبل جمع‌آوری می‌شوند، به‌جای تجزیه و تحلیل تکه‌به‌تکه به محض اینکه داده‌های بیشتری در دسترس قرار گرفت. iii) مطالعات موجود از پیاده سازی متمرکز الگوریتم های یادگیری ماشین استفاده می کنند. در این پایان نامه، ما به این کاستی ها می پردازیم تا تجزیه و تحلیل مقیاس پذیر پایان به انتها گزارش های سیستم در مقیاس بزرگ برای تشخیص ناهنجاری را تسهیل کنیم. ما چارچوبی را برای تجزیه و تحلیل توزیع شده پیام های گزارش بدون ساختار معرفی می کنیم. ما چارچوب خود را با دو مجموعه از پیام های ورود به سیستم به دست آمده از سیستم های واقعی ارزیابی کردیم. نتایج نشان داد که چارچوب ما به طور متوسط ​​بیش از 30 درصد بهبود عملکرد را در مقایسه با رویکردهای پایه که از پردازش کاملاً توزیع شده استفاده نمی‌کنند، به دست می‌آورد. علاوه بر این، همان سطح دقت به دست آمده با مطالعات معیار را حفظ می کند، اگرچه برخلاف آن مطالعات به در دسترس بودن کد منبع نیاز ندارد. چارچوب ما همچنین پردازش آنلاین را امکان پذیر می کند، جایی که داده های گزارش به تدریج در پنجره های زمانی متوالی پردازش می شوند. مزیت این رویکرد این است که برخی از ناهنجاری ها را می توان زودتر تشخیص داد. خطر این است که دقت ممکن است مختل شود. نتایج تجربی نشان داد که این خطر به ندرت رخ می دهد، فقط زمانی که یک مرز پنجره یک جلسه از رویدادها را قطع می کند. از سوی دیگر، میانگین زمان تشخیص ناهنجاری به میزان قابل توجهی کاهش می یابد. در نهایت، ما یک مطالعه موردی را معرفی می‌کنیم که اجرای توزیع‌شده الگوریتم‌های PCA و K-means را ارزیابی می‌کند. ما دقت و عملکرد این الگوریتم ها را با توجه به یکدیگر و با توجه به پیاده سازی متمرکز آنها مقایسه کردیم. نتایج نشان داد که نسخه‌های توزیع‌شده می‌توانند به دقت یکسانی دست یابند و در مقایسه با نسخه‌های متمرکز خود، بهبود عملکرد را با سفارشات بزرگی ارائه دهند. عملکرد PCA بهتر از K-means به نظر می رسد، اگرچه مشاهده کردیم که با افزایش درجه موازی، تفاوت بین این دو کاهش پیدا می کند. بو بیلگی هاتا تسپیت، تشهیس و تهمین فاعلیتلرینی دستکلیبیلمکتیدیر. بونونلا بیرلیکته، هر زمان استاندارد بیر یاپییا اویمایان جنیش ولچکتکی لوگ وریسینین آنالیز ادیلمسی و یوروملانماسی اولدوکچا زور بیر ایش هالینه گله بیلمکتیدیر. Ölçekleri arttıkça, dağıtık sistemler çeşitli bileşenlerinden gelen çok sayıda mesajın bir yığını halinde sistem logları oluşturabilmektedir. بو ندنله، مانوئل ویا گلنکسل آنالیز تکنیکلری بو اؤلچکتکی سیستم لغلارینین وریملی و اتکیلی بیر شکیلده ایزلمسینده و آنومالیلرین تسپیت ادیلمسینده یترسیز کالمکتادیر. Sistem logları üzerinde makine öğrenme tekniklerini uygulayarak sistem anormalliklerini otomatik olarak tespit etmeyi amaçlayan çeşitli çalışmalar yapılmıştır. انجاک، بو چالیشمالار ویریملیلیک و اولچکلنبیلرلیک آچیسیندان کیسیتلی کالمکتادیرلار. Bu kısıtlamalara neden olan üç eksiklik tespit ettik: i) Mevcut log ayrıştırma teknikleri, yapılandırılmamış log mesajlarını paralel ve dağıtık bir şekilde ayrıştırmamaktadır. دوم) Log verisi genellikle çevrimiçi (akış halinde) değil، çevrimdışı (yığın) مددا işlenmektedir. Diğer bir deyisle, yeni log mesajları geldikçe parça parça işlemek yerine tum log verisi önceden toplanmış yığın halinde analiz edilmektedir. iii) Mevcut çalışmalar، Makine öğrenmesi algoritmalarının merkezi uygulamalarını kullanmaktadır. Bu tezde, anomali tespit için geniş ölçekli sistem loglarının uctan uca ölçeklenebilir analizini kolaylaştırmak amacıyla bu eksiklikleri ele alıyoruz. Öncelikli olarak, yapılandırılmamış log mesajlarının dağıtık analizi için bir çerçeve sunuyoruz. Çerçevemizi، gerçek sistemlerden elde edilen iki günlük log mesajlarından oluşan veri kumesi ile değerlendirdik. سونوچلار، çerçevemizin tumüyle dağıtık işlem yapmayan temel yaklaşımlara kıyasla، ortalama olarak %30'dan fazla performans artışı sağladığını göstermiştir. آیریجا، چرچویمیز دیغر چالیشمالاردان فارکلی اولارک کاینک کودون بولونماسینی بایدتیرمدن د، کیاسلاما چالیشمالاری ایله اولده ادیلنلرله عینی دوغرولوک seviyesini korumaktadır. İkinci olarak, çerçevemiz sistem log verisinin art arda zaman pencerelerinde aşamalı olarak işlendiği çevrimiçi işleme altyapısı sağlamaktadır. بو یاکلاشیم، باذی آنومالیلرین داها اِرکِن تِسپیت ائدیله بیلمسین اولانک تانیماکتادیر. دیغر یاندان، چوریمیچی ایشلمه آنومالی تستینده دوغرولوغون آزالماسی ریسکینی دوغورابیلیر. Deneysel sonuçlar، bu riskin ancak bir pencere sınırının bir olay oturumunu kestiği zamanlarda nadiren ortaya çıktığını göstermiştir. دیغر یاندان، اورتالاما آنومالی تسپیت سورهسی اونملی اولچوده کیسالتیلمیشتیر. بو تزده سون اولارک، PCA و K-ortalama algoritmalarının dağıtık uygulamalarını değerlendiren بیر واکا چالیشماسی سونویوروز. Bu algoritmaların doğruluğunu ve performansını, hem birbirine hem de merkezi uygulamalarına göre karşılaştırdık. Sonuçlar, dağıtık sürümlerin aynı doğruluğa ulaşabileceğini ve merkezi sürümleriyle karşılaştırıldığında onlarca kat performans iyileştirmesi sağladığını göstermiştir. PCA algoritmasının performansının, K-ortalama algoritmasından daha iyi olduğu, ancak ikisi arasındaki farkın paralellik derecesi arttıkça düşme eğiliminde olduğu gözlemlenmiştir.
مشاهده در منبع دانشگاه اوزیغین دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات دانشگاه اوزیغین

تجزیه و تحلیل مقیاس پذیر لاگ سیستم در مقیاس بزرگ برای تشخیص ناهنجاری

نویسنده استکین، مروه
تاریخ انتشار 2019-05-30
موضوع رایانش ابری، سیستم‌های توزیع‌شده، مهندسی نرم‌افزار، داده‌های بزرگ، سیستم‌های بلادرنگ، تشخیص رویداد، محاسبات موازی، نرم‌افزار منبع باز، تشخیص ناهنجاری، گزارش‌های سیستم، تجزیه و تحلیل نرم‌افزار، تست نرم‌افزار
نوع سند
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه دانشگاه اوزیغین
شماره ثبت 87508a8e-c26e-4a81-93ce-b02dab6f69ad
محل کتابخانه گروه علوم کامپیوتر
تاریخ 2019-05-30
متن نمونه گزارش های سیستم اطلاعاتی را در مورد وضعیت اجزای سیستم و رویدادهای مختلفی که در زمان اجرا رخ می دهند، ارائه می دهد. این اطلاعات می تواند از فعالیت های تشخیص، تشخیص و پیش بینی خطا پشتیبانی کند. با این حال، تجزیه و تحلیل و تفسیر حجم عظیمی از داده های گزارش، که همیشه با یک ساختار استاندارد مطابقت ندارد، یک کار چالش برانگیز است. با افزایش مقیاس، سیستم های توزیع شده می توانند گزارش ها را به عنوان مجموعه ای از حجم عظیمی از پیام ها از چندین مؤلفه تولید کنند. بنابراین، نظارت و تشخیص ناهنجاری ها به طور مؤثر و مؤثر با استفاده از تکنیک های تحلیل دستی یا سنتی غیر ممکن می شود. مطالعات متعددی انجام شده است که هدف آنها تشخیص خودکار ناهنجاری‌های سیستم با استفاده از تکنیک‌های یادگیری ماشین در گزارش‌های سیستم است. با این حال، آنها کارایی و مقیاس پذیری محدودی دارند. ما سه کاستی را شناسایی کردیم که باعث این محدودیت‌ها می‌شوند: الف) تکنیک‌های تجزیه گزارش موجود، پیام‌های گزارش بدون ساختار را به صورت موازی و توزیع شده تجزیه نمی‌کنند. ii) داده های گزارش عمدتاً در حالت O ine به جای آنلاین پردازش می شوند. به این معنا که کل داده‌های گزارش از قبل جمع‌آوری می‌شوند، به‌جای تجزیه و تحلیل تکه‌به‌تکه به محض اینکه داده‌های بیشتری در دسترس قرار گرفت. iii) مطالعات موجود از پیاده سازی متمرکز الگوریتم های یادگیری ماشین استفاده می کنند. در این پایان نامه، ما به این کاستی ها می پردازیم تا تجزیه و تحلیل مقیاس پذیر پایان به انتها گزارش های سیستم در مقیاس بزرگ برای تشخیص ناهنجاری را تسهیل کنیم. ما چارچوبی را برای تجزیه و تحلیل توزیع شده پیام های گزارش بدون ساختار معرفی می کنیم. ما چارچوب خود را با دو مجموعه از پیام های ورود به سیستم به دست آمده از سیستم های واقعی ارزیابی کردیم. نتایج نشان داد که چارچوب ما به طور متوسط ​​بیش از 30 درصد بهبود عملکرد را در مقایسه با رویکردهای پایه که از پردازش کاملاً توزیع شده استفاده نمی‌کنند، به دست می‌آورد. علاوه بر این، همان سطح دقت به دست آمده با مطالعات معیار را حفظ می کند، اگرچه برخلاف آن مطالعات به در دسترس بودن کد منبع نیاز ندارد. چارچوب ما همچنین پردازش آنلاین را امکان پذیر می کند، جایی که داده های گزارش به تدریج در پنجره های زمانی متوالی پردازش می شوند. مزیت این رویکرد این است که برخی از ناهنجاری ها را می توان زودتر تشخیص داد. خطر این است که دقت ممکن است مختل شود. نتایج تجربی نشان داد که این خطر به ندرت رخ می دهد، فقط زمانی که یک مرز پنجره یک جلسه از رویدادها را قطع می کند. از سوی دیگر، میانگین زمان تشخیص ناهنجاری به میزان قابل توجهی کاهش می یابد. در نهایت، ما یک مطالعه موردی را معرفی می‌کنیم که اجرای توزیع‌شده الگوریتم‌های PCA و K-means را ارزیابی می‌کند. ما دقت و عملکرد این الگوریتم ها را با توجه به یکدیگر و با توجه به پیاده سازی متمرکز آنها مقایسه کردیم. نتایج نشان داد که نسخه‌های توزیع‌شده می‌توانند به دقت یکسانی دست یابند و در مقایسه با نسخه‌های متمرکز خود، بهبود عملکرد را با سفارشات بزرگی ارائه دهند. عملکرد PCA بهتر از K-means به نظر می رسد، اگرچه مشاهده کردیم که با افزایش درجه موازی، تفاوت بین این دو کاهش پیدا می کند. بو بیلگی هاتا تسپیت، تشهیس و تهمین فاعلیتلرینی دستکلیبیلمکتیدیر. بونونلا بیرلیکته، هر زمان استاندارد بیر یاپییا اویمایان جنیش ولچکتکی لوگ وریسینین آنالیز ادیلمسی و یوروملانماسی اولدوکچا زور بیر ایش هالینه گله بیلمکتیدیر. Ölçekleri arttıkça, dağıtık sistemler çeşitli bileşenlerinden gelen çok sayıda mesajın bir yığını halinde sistem logları oluşturabilmektedir. بو ندنله، مانوئل ویا گلنکسل آنالیز تکنیکلری بو اؤلچکتکی سیستم لغلارینین وریملی و اتکیلی بیر شکیلده ایزلمسینده و آنومالیلرین تسپیت ادیلمسینده یترسیز کالمکتادیر. Sistem logları üzerinde makine öğrenme tekniklerini uygulayarak sistem anormalliklerini otomatik olarak tespit etmeyi amaçlayan çeşitli çalışmalar yapılmıştır. انجاک، بو چالیشمالار ویریملیلیک و اولچکلنبیلرلیک آچیسیندان کیسیتلی کالمکتادیرلار. Bu kısıtlamalara neden olan üç eksiklik tespit ettik: i) Mevcut log ayrıştırma teknikleri, yapılandırılmamış log mesajlarını paralel ve dağıtık bir şekilde ayrıştırmamaktadır. دوم) Log verisi genellikle çevrimiçi (akış halinde) değil، çevrimdışı (yığın) مددا işlenmektedir. Diğer bir deyisle, yeni log mesajları geldikçe parça parça işlemek yerine tum log verisi önceden toplanmış yığın halinde analiz edilmektedir. iii) Mevcut çalışmalar، Makine öğrenmesi algoritmalarının merkezi uygulamalarını kullanmaktadır. Bu tezde, anomali tespit için geniş ölçekli sistem loglarının uctan uca ölçeklenebilir analizini kolaylaştırmak amacıyla bu eksiklikleri ele alıyoruz. Öncelikli olarak, yapılandırılmamış log mesajlarının dağıtık analizi için bir çerçeve sunuyoruz. Çerçevemizi، gerçek sistemlerden elde edilen iki günlük log mesajlarından oluşan veri kumesi ile değerlendirdik. سونوچلار، çerçevemizin tumüyle dağıtık işlem yapmayan temel yaklaşımlara kıyasla، ortalama olarak %30'dan fazla performans artışı sağladığını göstermiştir. آیریجا، چرچویمیز دیغر چالیشمالاردان فارکلی اولارک کاینک کودون بولونماسینی بایدتیرمدن د، کیاسلاما چالیشمالاری ایله اولده ادیلنلرله عینی دوغرولوک seviyesini korumaktadır. İkinci olarak, çerçevemiz sistem log verisinin art arda zaman pencerelerinde aşamalı olarak işlendiği çevrimiçi işleme altyapısı sağlamaktadır. بو یاکلاشیم، باذی آنومالیلرین داها اِرکِن تِسپیت ائدیله بیلمسین اولانک تانیماکتادیر. دیغر یاندان، چوریمیچی ایشلمه آنومالی تستینده دوغرولوغون آزالماسی ریسکینی دوغورابیلیر. Deneysel sonuçlar، bu riskin ancak bir pencere sınırının bir olay oturumunu kestiği zamanlarda nadiren ortaya çıktığını göstermiştir. دیغر یاندان، اورتالاما آنومالی تسپیت سورهسی اونملی اولچوده کیسالتیلمیشتیر. بو تزده سون اولارک، PCA و K-ortalama algoritmalarının dağıtık uygulamalarını değerlendiren بیر واکا چالیشماسی سونویوروز. Bu algoritmaların doğruluğunu ve performansını, hem birbirine hem de merkezi uygulamalarına göre karşılaştırdık. Sonuçlar, dağıtık sürümlerin aynı doğruluğa ulaşabileceğini ve merkezi sürümleriyle karşılaştırıldığında onlarca kat performans iyileştirmesi sağladığını göstermiştir. PCA algoritmasının performansının, K-ortalama algoritmasından daha iyi olduğu, ancak ikisi arasındaki farkın paralellik derecesi arttıkça düşme eğiliminde olduğu gözlemlenmiştir.
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین شما در حال هدایت مجدد هستید...

لطفاً صبر کنید