Étape 2 : repérer les sources de texte
Dans ce court exercice, vous allez charger et examiner un petit corpus d'évaluations de logements à louer dans la région de Boston. Vous connaissez sans doute déjà read.csv(), qui permet de charger un fichier CSV. Cela peut sembler banal, mais l'objectif de ce chapitre est de vous faire parcourir tout un enchaînement d'étapes du début à la fin, alors commençons par l'ingestion des données !
Ensuite, appliquez simplement str() pour examiner la structure du tableau de données. C'est une fonction pratique qui affiche de façon compacte les premières valeurs et les types de classes des vecteurs.
Enfin, vous utiliserez dim() pour imprimer les dimensions du tableau de données. Pour un tableau de données, la console affiche le nombre de lignes et le nombre de colonnes.
D'autres fonctions comme head(), tail() ou summary() sont souvent utilisées pour l'exploration, mais ici nous gardons l'examen bref pour que vous puissiez passer rapidement à l'analyse de sentiment, la partie la plus intéressante !
Cette activité fait partie du cours
Analyse de sentiment en R
Instructions de l’exercice
Les évaluations de logements à Boston sont stockées dans un fichier CSV dont l'emplacement est donné par la variable prédéfinie bos_reviews_file.
- Chargez les évaluations à partir de
bos_reviews_fileavecread.csv(). Nommez l'objetbos_reviews. - Examinez la structure du tableau de données avec la fonction de base
str()appliquée àbos_reviews. - Déterminez combien d'évaluations vous avez en appelant
dim()surbos_reviews.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# bos_reviews_file has been pre-defined
bos_reviews_file
# load raw text
bos_reviews <- ___
# Structure
___
# Dimensions
___