使用 AutoTokenizer 进行文本分词
AutoTokenizer 可以自动完成清洗、规范化和分词,简化文本准备工作。它能确保文本的处理方式与模型的预期一致。
在本练习中,您将了解 AutoTokenizer 如何将文本转换为可用于机器学习任务的词元。
本练习是课程的一部分
使用 Hugging Face
练习说明
- 导入
transformers中所需的类,使用正确的方法加载分词器,并将输入文本切分为词元。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")