Charger du texte
L'exploration de texte commence par le chargement de données textuelles dans R, ce que nous ferons avec la fonction read.csv().
Une bonne pratique consiste à examiner l'objet que vous avez lu pour repérer quelles colonnes sont importantes. La fonction str() est une façon efficace de le faire.
Si le cadre de données contient des colonnes qui ne sont pas du texte, vous pouvez créer un nouvel objet en utilisant uniquement la bonne colonne textuelle (p. ex., some_object$column_name).
Sachez qu'il s'agit de données réelles provenant de Twitter et qu'il y a donc toujours un risque qu'elles contiennent des blasphèmes ou d'autres contenus offensants (dans cet exercice, ainsi que dans tout exercice ultérieur utilisant aussi de vraies données Twitter).
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
Les données ont été chargées pour vous et sont disponibles dans coffee_data_file.
- Créez un nouvel objet
tweetsen utilisantread.csv()sur le fichiercoffee_data_file, qui contient des tweets mentionnant le café. - Examinez l'objet
tweetsavecstr()pour déterminer quelle colonne contient le texte que vous souhaitez analyser. - Créez un nouvel objet
coffee_tweetsen utilisant uniquement la colonne de texte que vous avez identifiée. Pour ce faire, utilisez l'opérateur$et le nom de la colonne.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import text data from CSV, no factors
tweets <- ___
# View the structure of tweets
___
# Isolate text from tweets
coffee_tweets <- ___