Začněte nyníZačněte zdarma

RDD z paralelizovaných kolekcí

Resilient Distributed Dataset (RDD) je základní abstrakce ve Sparku – jde o neměnnou distribuovanou kolekci objektů. RDD je klíčovým stavebním kamenem Sparku, takže je důležité vědět, jak ho vytvořit. V tomto cvičení si vytvoříš své první RDD v PySparku z kolekce slov.

Nezapomeň, že SparkContext sc máš v pracovním prostředí už k dispozici.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř RDD s názvem RDD z Pythonového listu slov.
  • Ověř, že vytvořený objekt je skutečně RDD.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
Upravit a spustit kód