Kom igångKom igång gratis

Steg 2: Identifiera textkällor

I den här övningen laddar du och undersöker ett litet korpus med hyresgästrecensioner från Boston-området. Du känner förmodligen redan till read.csv(), som används för att läsa in kommaseparerade filer. Det kan verka enkelt, men poängen med det här kapitlet är att du ska genomföra ett helt arbetsflöde från början till slut – så låt oss börja med att läsa in data!

Därefter använder du str() för att granska dataramens struktur. Det är en praktisk funktion som kompakt visar de första värdena och klasstyperna för vektorer.

Slutligen använder du dim() för att skriva ut dataramens dimensioner. För en dataram visar konsolen antalet rader och antalet kolumner.

Andra funktioner som head(), tail() och summary() används ofta vid datautforskning, men här håller vi undersökningen kort så att du snabbt kan komma igång med sentimentanalysen!

Den här övningen är en del av kursen

Sentimentanalys i R

Visa kurs

Övningsinstruktioner

Hyresgästrecensionerna för Boston-fastigheter finns i en CSV-fil som pekas ut av den fördefinierade variabeln bos_reviews_file.

  • Läs in recensionerna från bos_reviews_file med read.csv(). Spara objektet som bos_reviews.
  • Undersök dataramens struktur med hjälp av basens str()-funktion på bos_reviews.
  • Ta reda på hur många recensioner du arbetar med genom att anropa dim()bos_reviews.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# bos_reviews_file has been pre-defined
bos_reviews_file

# load raw text
bos_reviews <- ___

# Structure
___

# Dimensions
___
Redigera och kör kod