Začněte nyníZačněte zdarma

Mozaikový graf

Sloupcový graf, který jsi vytvořil/a v předchozím cvičení, umožňuje zkoumat vzory chybějících dat mezi dvěma proměnnými najednou. Mozaikový graf tento přístup rozšiřuje na více proměnných.

V tomto cvičení nejprve vytvoříš pomocnou (dummy) proměnnou, která označí, zda se Spojené státy podílely na produkci daného filmu. K tomu použiješ funkci grepl(), která zjistí, zda se řetězec předaný jako první argument nachází v objektu předaném jako druhý argument. Poté nakreslíš mozaikový graf, abys zjistil/a, zda pohlaví osobnosti koreluje s množstvím chybějících dat o výdělcích – a to zvlášť pro americké a neamerické filmy.

Data biopics i balíček VIM jsou již načteny. Pojďme na průzkumnou vizualizaci!

Poznámka: Speciální funkcedisplay_image()byla vytvořena pro zobrazení výstupu z nejnovější verze balíčkuVIM. Nezapomeň rozbalit sekciHTML Viewer.

Toto cvičení je součástí kurzu

Práce s chybějícími daty pomocí imputace v R

Zobrazit kurz

Pokyny k cvičení

  • Předej data biopics do pipeline dplyr.
  • Vytvoř pomocnou proměnnou is_US_movie, která bude mít hodnotu TRUE, pokud country obsahuje řetězec "US", a FALSE v ostatních případech.
  • Nakresli mozaikový graf zobrazující množství chybějících dat v "earnings" rozděleně podle "is_US_movie" a "sub_sex" – nezapomeň předat názvy proměnných jako řetězce.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Prepare data for plotting and draw a mosaic plot
___ %>%
	# Create a dummy variable for US-produced movies
	mutate(is_US_movie = grepl(___, ___)) %>%
	# Draw mosaic plot
	mosaicMiss(highlight = ___, 
             plotvars = c(___, ___))

# Return plot from latest VIM package - expand the HTML viewer section
display_image()
Upravit a spustit kód