Büyük veri analizi için yeni algoritmalar


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Erciyes Üniversitesi, Fen Bilimleri Enstitüsü, ENDÜSTRİ MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2021

Tezin Dili: Türkçe

Öğrenci: BURAK GÜLMEZ

Danışman: Sinem Kulluk

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Günümüzde veri toplamak, veri depolamak geçmişe göre daha kolay ve basit bir işlemdir. Veri miktarının büyük olması veri üzerinden elde edilen bilgileri ve analizleri daha sağlıklı bir hale getirmektedir, fakat büyük veri ile baş edebilmek zorlaşmaktadır. Geleneksel veri madenciliği yöntemleriyle büyük veri analizi hem teknik olarak hem de süre olarak imkânsız bir hale gelmektedir. Bu probleme çözüm olarak veriyi parçalamak ve veri parçaları üzerinde paralel işlemler yapmak gerekmektedir. Bunun için genellikle Apache Hadoop ve Apache Spark kullanılmaktadır. Apache Spark, Hadoop'a göre hız ve kapsam bakımından üstünlük sağlamaktadır. Büyük veriler üzerinde analiz için Spark'ın kendi içerisinde makine öğrenme kütüphanesi bulunmaktadır. Bu tez çalışmasında büyük veri analizi için iki yeni algoritma önerilmiştir. Bu algoritmalar Spark Hibrit (SH) ve Yapay Sinir Ağı – Karar Ağacı (YSA-KA) algoritmalarıdır. Bu yeni algoritmaların performansı, hem Pokerhand, Susy, Higgs, Hepmass, Wisdm ve Census literatür sınıflandırma veri kümeleri ile, hem de gerçek hayat verisi olan üretim ve ikinci el araba veri kümeleri üzerinde test edilmiştir. Önerilen algoritmalarla elde edilen sonuçlar Spark içerisindeki makine öğrenme algoritmaları ve literatürde önerilen algoritma sonuçlarıyla karşılaştırılmıştır. İstatistiksel analizler ile algoritmaların sonuçları arasındaki farkların anlamlı olup olmadığı istatistiksel olarak test edilmiş ve yorumlanmıştır. Tez çalışmasında önerilen algoritmalardan YSA-KA algoritması Spark'taki ve literatürde son yıllarda yapılan çalışmalardaki algoritmalara göre genel olarak daha iyi sonuç vermiştir. SH algoritması ise diğer algoritmalarla rekabet edebilecek düzeydedir.