Začněte nyníZačněte zdarma

Načtení a parsování datasetu s 5 000 body

Clustering (shlukování) je úloha učení bez učitele, při které se objekty rozdělují do skupin (shluků) na základě vzájemné podobnosti. Na rozdíl od úloh s učitelem, kde jsou data označena, lze clustering využít k analýze neoznačených dat. PySpark MLlib obsahuje populární algoritmus K-means pro shlukování. V tomto tříčásticovém cvičení zjistíš, kolik shluků se nachází v datasetu s 5 000 řádky a 2 sloupci. Nejprve načteš data do RDD, zparsuje RDD podle oddělovače, spustíš model KMeans, vyhodnotíš ho a nakonec shluky vizualizuješ.

V první části načteš data do RDD, zparsuje RDD podle oddělovače a převedeš datový typ string na celé číslo.

Nezapomeň, že ve svém pracovním prostoru máš k dispozici SparkContext sc. Proměnná file_path (cesta k souboru 5000_points.txt) je také již dostupná v pracovním prostoru.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Načti dataset 5000_points do RDD s názvem clusterRDD.
  • Transformuj clusterRDD tak, že rozdělíš řádky podle tabulátoru ("\t").
  • Transformuj rozdělené RDD a vytvoř seznam celých čísel pro oba sloupce.
  • Ověř, že dataset obsahuje 5 000 řádků.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the dataset into an RDD
clusterRDD = sc.____(file_path)

# Split the RDD based on tab
rdd_split = clusterRDD.____(lambda x: ____.split(____))

# Transform the split RDD by creating a list of integers
rdd_split_int = rdd_split.____(lambda x: [int(____), int(x[1])])

# Count the number of rows in RDD 
print("There are {} rows in the rdd_split_int dataset".format(____.____()))
Upravit a spustit kód