BaşlayınÜcretsiz başlayın

GroupBy ve Filter yöntemleri

Artık veri kümesi hakkında biraz daha bilgimiz olduğuna göre, ratings veri kümesinin bazı genel özet metriklerine bakalım; filmlerin kaç puan aldığına ve her kullanıcının kaç puan verdiğine göz atalım.

Spark'ta özet istatistikleri bir araya getirirken işine yarayacak iki yaygın yöntem .filter() ve .groupBy() yöntemleridir. .filter() yöntemi, belirlediğin ölçütleri karşılamayan verileri süzmene olanak tanır.

Bu egzersiz, kursun bir parçasıdır

PySpark ile Öneri Motorları Oluşturma

Kursa Göz Atın

Egzersiz talimatları

  • pyspark.sql.functions içinden col fonksiyonunu içe aktar ve .show() kullanarak ratings veri kümesini görüntüle.
  • ratings veri kümesi üzerinde .filter() yöntemini parantez içinde şu filtreyle uygula; yalnızca 100'den küçük userId değerlerini dahil et: col("userId") < 100.
  • Verileri userId'a göre gruplamak için ratings veri kümesi üzerinde .groupBy() yöntemini çağır. Her userId'ın kaç filme puan verdiğini görmek için .count() yöntemini çağır.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Kodu Düzenle ve Çalıştır