or
Den här övningen är en del av kursen
I det här kapitlet lär du dig att skapa och köra frågor mot en SQL-tabell i Spark. Spark SQL tillför SQL:s uttrycksfullhet till Spark. Du lär dig också hur du använder SQL-fönsterfunktioner i Spark. Fönsterfunktioner utför beräkningar över rader som är relaterade till den aktuella raden. De förenklar avsevärt resultat som är svåra att uppnå med enbart join-operationer och traditionella aggregeringar. Vi använder fönsterfunktioner för att beräkna löpande summor, löpande differenser och andra operationer som är svåra att utföra i grundläggande SQL.
I det här kapitlet läser du in text på naturligt språk och tillämpar sedan en rörlig fönsteranalys för att hitta vanliga ordsekvenser.
I de tidigare kapitlen lärde du dig att utnyttja fönsterfunktionernas uttrycksfullhet i SQL. Den uttrycksfullheten gör det nu viktigt att du förstår hur du cachar DataFrames och SQL-tabeller på rätt sätt. Det är också viktigt att kunna utvärdera din applikation. Du lär dig att göra det med hjälp av Spark-gränssnittet. Du lär dig dessutom bästa praxis för loggning i Spark. Spark SQL tillhandahåller ytterligare ett användbart verktyg för att hantera frågeprestanda – frågekörningsplanen. Du lär dig att använda körningsplanen för att spåra ursprunget för en DataFrame.
Aktuell övning
Tidigare kapitel gav dig verktygen för att läsa in rå text, tokenisera den och extrahera ordsekvenser. Det är redan mycket användbart för analys, men även värdefullt för maskininlärning. Det du har lärt dig knyts nu samman genom att du använder logistisk regression för att klassificera text. I slutet av det här kapitlet har du läst in råa språkdata och använt dem för att träna en textklassificerare.