Začněte nyníZačněte zdarma

Sumarizace dat

Teď vytvoříme fazetový graf, který porovná užitečnost různých výukových platforem.

V tomto cvičení si představíme novou funkci z dplyradd_count(). Funkce add_count() přidá do datasetu sloupec n a zachová přitom stejný počet řádků jako původní dataset. Stejně jako count() defaultně vrací počet řádků pro každou skupinu, ale to lze změnit pomocí argumentu wt (váha). Nastavením wt na jiný sloupec způsobíš, že n bude rovno součtu hodnot tohoto sloupce pro každou skupinu.

Řekněme, že chceš do datasetu iris přidat sloupec obsahující součet Petal.Length pro všechny květiny stejného druhu Species. Napsal/a bys:

iris %>%
   add_count(Species, wt = Petal.Length) %>%
   select(Species, Petal.Length, n)

Výsledek by vypadal takto:

# A tibble: 150 x 3
   Species Petal.Length     n
   <fct>          <dbl> <dbl>
 1 setosa           1.4  73.1
 2 setosa           1.4  73.1
 3 virginica        6.4  278.

Toto cvičení je součástí kurzu

Kategorická data v Tidyverse

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

learning_platform_usefulness %>%
  # Change dataset to one row per learning_platform usefulness pair with number of entries for each
  ___(___, ___)
Upravit a spustit kód