Zkoumání struktury tibble
Když se pokusíš vypsat tibble, který odkazuje na data uložená ve Sparku, musí se stát trochu magie – tibble si totiž kopii dat sám neuchovává. Tato magie spočívá v tom, že metoda print využije tvoje Spark připojení, přenese část obsahu zpět do R a zobrazí hodnoty, jako by byla data uložena lokálně. Jak jsi viděl/a dříve v této kapitole, přenos dat je pomalá operace, takže se standardně zobrazí jen 10 řádků a tolik sloupců, kolik se vejde na obrazovku.
Počet zobrazených řádků můžeš změnit pomocí argumentu n funkce print(). Šířku zobrazovaného obsahu pak nastavíš argumentem width, který udává počet znaků (nikoli počet sloupců). Praktický trik je použít width = Inf – tím zobrazíš všechny sloupce.
Funkce str() se obvykle používá k zobrazení struktury proměnné. Pro data.frame podá přehledný souhrn s typem a prvními hodnotami každého sloupce. U tibble se vzdáleným zdrojem dat ale str() neví, jak data načíst. Pokud tedy zavoláš str() na tibble s daty uloženými ve Sparku, uvidíš seznam obsahující objekt Spark připojení a několik dalších položek.
Pokud chceš vidět přehled obsahu jednotlivých sloupců datasetu, na který tibble odkazuje, použij místo toho glimpse(). Pozor – u vzdálených dat, jako jsou ta uložená ve Spark clusteru, počet řádků nemusí souhlasit! V takovém případě glimpse() počet řádků neuvádí správně.
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
Spark připojení je pro tebe připraveno jako spark_conn. Tibble napojený na metadata skladeb uložená ve Sparku je předdefinován jako track_metadata_tbl.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print 5 rows, all columns
___
# Examine structure of tibble
___
# Examine structure of data
___