Lineární regrese s neúplnými daty
Chybějící data jsou běžný problém a správná práce s nimi je nesmírně důležitá. Pokud chybějící hodnoty ignoruješ nebo je vyplníš nesprávně, modely se mohou chovat nepředvídatelně a výsledné predikce i závěry mohou být zkreslené.
V této kapitole budeš pracovat s datasetem biopics, který obsahuje informace o řadě životopisných filmů – včetně jejich tržeb, charakteristik hlavních postav a dalších proměnných. Některé hodnoty v datech však chybí. Původní data pocházejí z R balíčku fivethirtyeight, ale v tomto kurzu budeš pracovat s mírně upravenou verzí.
V tomto cvičení se seznámíš s datasetem a sestavíš lineární regresní model pro předpověď tržeb filmů. Jdeme na to!
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print first 10 observations
___(biopics, ___)