Kom igångKom igång gratis

Använda DataFrames

Sparks grundläggande datastruktur är Resilient Distributed Dataset (RDD). Det är ett lågnivåobjekt som gör det möjligt för Spark att distribuera data över flera noder i klustret. RDD:er är dock svåra att arbeta med direkt, så i den här kursen använder du i stället DataFrame-abstraktionen i Spark, som är byggd ovanpå RDD:er.

Sparks DataFrame är utformad för att fungera ungefär som en SQL-tabell – med variabler i kolumnerna och observationer i raderna. DataFrames är inte bara enklare att förstå; de är även mer optimerade för komplexa operationer än RDD:er.

När du börjar modifiera och kombinera kolumner och rader finns det ofta många vägar till samma resultat, men vissa tar betydligt längre tid än andra. Med RDD:er är det upp till datavetaren att hitta rätt optimeringsstrategi, medan DataFrame-implementationen har mycket av den här optimeringen inbyggd.

För att börja arbeta med Spark DataFrames behöver du först skapa ett SparkSession-objekt från din SparkContext. Du kan tänka på SparkContext som din anslutning till klustret och SparkSession som ditt gränssnitt mot den anslutningen.

Kom ihåg att du under resten av den här kursen har tillgång till en SparkSession med namnet spark i din arbetsmiljö!

Vilket av följande är en fördel med Spark DataFrames jämfört med RDD:er?

Den här övningen är en del av kursen

Grunderna i PySpark

Visa kurs

Interaktiv övning med praktiskt arbete

Gör teori till handling med en av våra interaktiva övningar

Starta övningen