开始使用免费开始使用

使用 AutoTokenizer 进行文本分词

AutoTokenizer 可以自动完成清洗、规范化和分词,简化文本准备工作。它能确保文本的处理方式与模型的预期一致。

在本练习中,您将了解 AutoTokenizer 如何将文本转换为可用于机器学习任务的词元。

本练习是课程的一部分

使用 Hugging Face

查看课程

练习说明

  • 导入 transformers 中所需的类,使用正确的方法加载分词器,并将输入文本切分为词元。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
编辑并运行代码