Tokeniser du texte avec AutoTokenizer
Les AutoTokenizer simplifient la préparation du texte en gérant automatiquement le nettoyage, la normalisation et la tokenisation. Ils s'assurent que le texte est traité exactement comme le modèle l'attend.
Dans cet exercice, découvrez comment AutoTokenizer transforme un texte en jetons prêts pour des tâches de Machine Learning.
Cette activité fait partie du cours
Travailler avec Hugging Face
Instructions de l’exercice
- Importez la classe requise depuis
transformers, chargez le tokenizer avec la bonne méthode, et divisez le texte d'entrée en jetons.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")