CommencerCommencez gratuitement

Étape 2 : Identifier les sources de texte

Dans ce court exercice, vous allez charger et examiner un petit corpus d'avis sur des locations autour de Boston. Vous connaissez sans doute déjà read.csv(), qui permet de charger un fichier CSV. Cela peut sembler banal, mais l'objectif de ce chapitre est de vous faire réaliser un flux de travail complet de bout en bout, alors commençons par l'ingestion des données !

Ensuite, appliquez simplement str() pour examiner la structure du data frame. C'est une fonction pratique pour afficher de façon compacte les premières valeurs et les types de classe des vecteurs.

Enfin, vous appliquerez dim() pour afficher les dimensions du data frame. Pour un data frame, la console imprimera le nombre de lignes et le nombre de colonnes.

D'autres fonctions comme head(), tail() ou summary() sont souvent utilisées pour explorer les données, mais ici nous restons concis afin que vous puissiez passer rapidement à l'analyse de sentiment !

Cet exercice fait partie du cours

<cours>Analyse de sentiments en R</cours>
Voir le cours

Instructions de l’exercice

Les avis sur les locations à Boston sont stockés dans un fichier CSV repéré par la variable prédéfinie bos_reviews_file.

  • Chargez les avis depuis bos_reviews_file avec read.csv(). Nommez l'objet bos_reviews.
  • Examinez la structure du data frame avec la fonction de base str() appliquée à bos_reviews.
  • Découvrez combien d'avis vous avez en appelant dim() sur bos_reviews.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# bos_reviews_file has been pre-defined
bos_reviews_file

# load raw text
bos_reviews <- ___

# Structure
___

# Dimensions
___
Modifier et exécuter le code