CommencezCommencez gratuitement

Tokenisation du texte

Vous souhaitez exploiter un modèle préentraîné de Hugging Face et l'adapter avec des données de l'équipe de soutien de votre entreprise afin d'aider à classer les interactions selon le risque de désabonnement. Cela aidera l'équipe à prioriser ce qu'il faut traiter en premier et comment le faire, pour être plus proactive.

Préparez les données d'entraînement et de test pour l'ajustement fin en tokenisant le texte.

Les objets AutoTokenizer et AutoModelForSequenceClassification ont été chargés pour vous.

Cette activité fait partie du cours

Introduction aux LLM avec Python

Voir le cours

Instructions de l’exercice

  • Chargez le modèle préentraîné et le tokenizer en prévision de l'ajustement fin.
  • Tokenisez à la fois train_data["interaction"] et test_data["interaction"], en activant le remplissage (padding) et la troncature des séquences.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
Modifier et exécuter le code