Metody GroupBy a Filter
Teď, když o datové sadě víme o něco víc, podívejme se na souhrnné metriky datové sady ratings – zjistíme, kolik hodnocení mají jednotlivé filmy a kolik hodnocení poskytl každý uživatel.
Dvě užitečné metody pro agregaci souhrnných statistik ve Sparku jsou .filter() a .groupBy(). Metoda .filter() ti umožňuje odfiltrovat data, která nesplňují zadaná kritéria.
Toto cvičení je součástí kurzu
Tvorba doporučovacích systémů s PySparkem
Pokyny k cvičení
- Importuj
colzpyspark.sql.functionsa zobraz datovou saduratingspomocí.show(). - Aplikuj metodu
.filter()na datovou saduratingss následujícím filtrem uvnitř závorek, aby výsledek obsahoval pouzeuserIdmenší než 100:col("userId") < 100. - Zavolej metodu
.groupBy()na datové saděratingspro seskupení dat podleuserId. Následně zavolej metodu.count(), abys zjistil/a, kolik filmů každýuserIdohodnotil.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()