GroupBy ve Filter yöntemleri
Artık veri kümesi hakkında biraz daha bilgimiz olduğuna göre, ratings veri kümesinin bazı genel özet metriklerine bakalım; filmlerin kaç puan aldığına ve her kullanıcının kaç puan verdiğine göz atalım.
Spark'ta özet istatistikleri bir araya getirirken işine yarayacak iki yaygın yöntem .filter() ve .groupBy() yöntemleridir. .filter() yöntemi, belirlediğin ölçütleri karşılamayan verileri süzmene olanak tanır.
Bu egzersiz, kursun bir parçasıdır
PySpark ile Öneri Motorları Oluşturma
Egzersiz talimatları
pyspark.sql.functionsiçindencolfonksiyonunu içe aktar ve.show()kullanarakratingsveri kümesini görüntüle.ratingsveri kümesi üzerinde.filter()yöntemini parantez içinde şu filtreyle uygula; yalnızca 100'den küçükuserIddeğerlerini dahil et:col("userId") < 100.- Verileri
userId'a göre gruplamak içinratingsveri kümesi üzerinde.groupBy()yöntemini çağır. HeruserId'ın kaç filme puan verdiğini görmek için.count()yöntemini çağır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()