Étape 2 : Identifier les sources de texte
Dans ce court exercice, vous allez charger et examiner un petit corpus d'avis sur des locations autour de Boston. Vous connaissez sans doute déjà read.csv(), qui permet de charger un fichier CSV. Cela peut sembler banal, mais l'objectif de ce chapitre est de vous faire réaliser un flux de travail complet de bout en bout, alors commençons par l'ingestion des données !
Ensuite, appliquez simplement str() pour examiner la structure du data frame. C'est une fonction pratique pour afficher de façon compacte les premières valeurs et les types de classe des vecteurs.
Enfin, vous appliquerez dim() pour afficher les dimensions du data frame. Pour un data frame, la console imprimera le nombre de lignes et le nombre de colonnes.
D'autres fonctions comme head(), tail() ou summary() sont souvent utilisées pour explorer les données, mais ici nous restons concis afin que vous puissiez passer rapidement à l'analyse de sentiment !
Cet exercice fait partie du cours
<cours>Analyse de sentiments en R</cours>Instructions de l’exercice
Les avis sur les locations à Boston sont stockés dans un fichier CSV repéré par la variable prédéfinie bos_reviews_file.
- Chargez les avis depuis
bos_reviews_fileavecread.csv(). Nommez l'objetbos_reviews. - Examinez la structure du data frame avec la fonction de base
str()appliquée àbos_reviews. - Découvrez combien d'avis vous avez en appelant
dim()surbos_reviews.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# bos_reviews_file has been pre-defined
bos_reviews_file
# load raw text
bos_reviews <- ___
# Structure
___
# Dimensions
___