การแบ่ง token ด้วย AutoTokenizer
AutoTokenizer ช่วยให้การเตรียมข้อความทำได้ง่ายขึ้น โดยจัดการทั้งการทำความสะอาด การทำให้เป็นมาตรฐาน และการแบ่ง token โดยอัตโนมัติ เพื่อให้แน่ใจว่าข้อความถูกประมวลผลตรงตามที่โมเดลคาดหวัง
ในแบบฝึกหัดนี้ ลองสำรวจว่า AutoTokenizer แปลงข้อความให้กลายเป็น token ที่พร้อมใช้งานสำหรับงาน machine learning ได้อย่างไร
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การใช้งาน Hugging Face
คำแนะนำการฝึกหัด
- Import คลาสที่จำเป็นจาก
transformersจากนั้น โหลด tokenizer ด้วยเมธอดที่ถูกต้อง แล้ว แบ่ง ข้อความนำเข้าให้เป็น token
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")