เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแบ่ง token ด้วย AutoTokenizer

AutoTokenizer ช่วยให้การเตรียมข้อความทำได้ง่ายขึ้น โดยจัดการทั้งการทำความสะอาด การทำให้เป็นมาตรฐาน และการแบ่ง token โดยอัตโนมัติ เพื่อให้แน่ใจว่าข้อความถูกประมวลผลตรงตามที่โมเดลคาดหวัง

ในแบบฝึกหัดนี้ ลองสำรวจว่า AutoTokenizer แปลงข้อความให้กลายเป็น token ที่พร้อมใช้งานสำหรับงาน machine learning ได้อย่างไร

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การใช้งาน Hugging Face

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import คลาสที่จำเป็นจาก transformers จากนั้น โหลด tokenizer ด้วยเมธอดที่ถูกต้อง แล้ว แบ่ง ข้อความนำเข้าให้เป็น token

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
แก้ไขและรันโค้ด