or
Bài tập này là một phần của khóa học
Tìm hiểu các yếu tố cốt lõi của xử lý văn bản trong Natural Language Processing (NLP). Nắm vững các kỹ thuật như tokenization, loại bỏ stop word và dấu câu, cùng chuẩn hóa văn bản với chuyển về chữ thường, stemming và lemmatization để chuẩn bị dữ liệu văn bản cho các bước phân tích và khai thác insight tiếp theo.
Biến văn bản thô thành các đặc trưng số mạnh mẽ. Tạo biểu diễn Bag-of-Words và TF-IDF để nắm bắt tầm quan trọng của từ trong toàn bộ tài liệu, sau đó khám phá word embeddings như Word2Vec và GloVe để phát hiện các mẫu ngữ nghĩa sâu. Trực quan hóa tần suất, mức độ liên quan và độ tương đồng để làm sống động dữ liệu văn bản của bạn.
Bài tập hiện tại
Khai thác sức mạnh của các mô hình đã huấn luyện sẵn để thực hiện các tác vụ phân loại văn bản nâng cao. Sử dụng các pipeline của Hugging Face cho phân tích cảm xúc, phân loại chủ đề và suy diễn ngôn ngữ tự nhiên. Đánh giá độ tương đồng ngữ nghĩa và tính đúng đắn ngữ pháp với các mô hình tối tân, mà không cần xây dựng từ đầu.
Khám phá cốt lõi của các ứng dụng NLP hiện đại với kỹ thuật phân loại token và tạo sinh văn bản. Học cách trích xuất các thực thể và cấu trúc ngữ pháp có ý nghĩa bằng NER và gán loại từ (PoS). Thành thạo cả hỏi–đáp trích xuất và hỏi–đáp tóm lược, và khám phá các tác vụ tạo sinh nâng cao gồm tóm tắt, dịch và mô hình hóa ngôn ngữ bằng các pipeline của Hugging Face.