CommencezCommencez gratuitement

Charger du texte

L'exploration de texte commence par le chargement de données textuelles dans R, ce que nous ferons avec la fonction read.csv().

Une bonne pratique consiste à examiner l'objet que vous avez lu pour repérer quelles colonnes sont importantes. La fonction str() est une façon efficace de le faire.

Si le cadre de données contient des colonnes qui ne sont pas du texte, vous pouvez créer un nouvel objet en utilisant uniquement la bonne colonne textuelle (p. ex., some_object$column_name).

Sachez qu'il s'agit de données réelles provenant de Twitter et qu'il y a donc toujours un risque qu'elles contiennent des blasphèmes ou d'autres contenus offensants (dans cet exercice, ainsi que dans tout exercice ultérieur utilisant aussi de vraies données Twitter).

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

Les données ont été chargées pour vous et sont disponibles dans coffee_data_file.

  • Créez un nouvel objet tweets en utilisant read.csv() sur le fichier coffee_data_file, qui contient des tweets mentionnant le café.
  • Examinez l'objet tweets avec str() pour déterminer quelle colonne contient le texte que vous souhaitez analyser.
  • Créez un nouvel objet coffee_tweets en utilisant uniquement la colonne de texte que vous avez identifiée. Pour ce faire, utilisez l'opérateur $ et le nom de la colonne.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import text data from CSV, no factors
tweets <- ___

# View the structure of tweets
___

# Isolate text from tweets
coffee_tweets <- ___
Modifier et exécuter le code