Krok 2: Identifikace zdrojů textu
V tomto krátkém cvičení načteš a prozkoumáš malý korpus recenzí pronájmů nemovitostí z Bostonu. Funkci read.csv(), která slouží k načítání souborů ve formátu CSV, už nejspíš znáš. Může to vypadat jako formalita, ale cílem této kapitoly je projít celým pracovním postupem od začátku do konce – takže začneme načtením dat!
Pak jednoduše použij str() k prozkoumání struktury datového rámce. Jde o praktickou funkci, která kompaktně zobrazí úvodní hodnoty a typy vektorů.
Nakonec použij dim() k zobrazení dimenzí datového rámce. V případě datového rámce ti konzole vypíše počet řádků a počet sloupců.
Pro průzkum dat se často hodí i funkce jako head(), tail() nebo summary() – tady ale průzkum zkrátíme, aby ses co nejdřív dostal/a k samotné analýze sentimentu!
Toto cvičení je součástí kurzu
Sentiment Analysis in R
Pokyny k cvičení
Recenze bostonských pronájmů jsou uloženy v CSV souboru, jehož umístění udává předdefinovaná proměnná bos_reviews_file.
- Načti recenze z
bos_reviews_filepomocíread.csv(). Objekt pojmenujbos_reviews. - Prozkoumej strukturu datového rámce pomocí základní funkce
str()aplikované nabos_reviews. - Zjisti, s kolika recenzemi pracuješ, zavoláním
dim()nabos_reviews.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# bos_reviews_file has been pre-defined
bos_reviews_file
# load raw text
bos_reviews <- ___
# Structure
___
# Dimensions
___