CommencezCommencez gratuitement

Étape 2 : repérer les sources de texte

Dans ce court exercice, vous allez charger et examiner un petit corpus d'évaluations de logements à louer dans la région de Boston. Vous connaissez sans doute déjà read.csv(), qui permet de charger un fichier CSV. Cela peut sembler banal, mais l'objectif de ce chapitre est de vous faire parcourir tout un enchaînement d'étapes du début à la fin, alors commençons par l'ingestion des données !

Ensuite, appliquez simplement str() pour examiner la structure du tableau de données. C'est une fonction pratique qui affiche de façon compacte les premières valeurs et les types de classes des vecteurs.

Enfin, vous utiliserez dim() pour imprimer les dimensions du tableau de données. Pour un tableau de données, la console affiche le nombre de lignes et le nombre de colonnes.

D'autres fonctions comme head(), tail() ou summary() sont souvent utilisées pour l'exploration, mais ici nous gardons l'examen bref pour que vous puissiez passer rapidement à l'analyse de sentiment, la partie la plus intéressante !

Cette activité fait partie du cours

Analyse de sentiment en R

Voir le cours

Instructions de l’exercice

Les évaluations de logements à Boston sont stockées dans un fichier CSV dont l'emplacement est donné par la variable prédéfinie bos_reviews_file.

  • Chargez les évaluations à partir de bos_reviews_file avec read.csv(). Nommez l'objet bos_reviews.
  • Examinez la structure du tableau de données avec la fonction de base str() appliquée à bos_reviews.
  • Déterminez combien d'évaluations vous avez en appelant dim() sur bos_reviews.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# bos_reviews_file has been pre-defined
bos_reviews_file

# load raw text
bos_reviews <- ___

# Structure
___

# Dimensions
___
Modifier et exécuter le code