Steg 2: Identifiera textkällor
I den här övningen laddar du och undersöker ett litet korpus med hyresgästrecensioner från Boston-området. Du känner förmodligen redan till read.csv(), som används för att läsa in kommaseparerade filer. Det kan verka enkelt, men poängen med det här kapitlet är att du ska genomföra ett helt arbetsflöde från början till slut – så låt oss börja med att läsa in data!
Därefter använder du str() för att granska dataramens struktur. Det är en praktisk funktion som kompakt visar de första värdena och klasstyperna för vektorer.
Slutligen använder du dim() för att skriva ut dataramens dimensioner. För en dataram visar konsolen antalet rader och antalet kolumner.
Andra funktioner som head(), tail() och summary() används ofta vid datautforskning, men här håller vi undersökningen kort så att du snabbt kan komma igång med sentimentanalysen!
Den här övningen är en del av kursen
Sentimentanalys i R
Övningsinstruktioner
Hyresgästrecensionerna för Boston-fastigheter finns i en CSV-fil som pekas ut av den fördefinierade variabeln bos_reviews_file.
- Läs in recensionerna från
bos_reviews_filemedread.csv(). Spara objektet sombos_reviews. - Undersök dataramens struktur med hjälp av basens
str()-funktion påbos_reviews. - Ta reda på hur många recensioner du arbetar med genom att anropa
dim()påbos_reviews.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# bos_reviews_file has been pre-defined
bos_reviews_file
# load raw text
bos_reviews <- ___
# Structure
___
# Dimensions
___