or
Bài tập này là một phần của khóa học
Chương 1 của Nhập môn Xử lý Ngôn ngữ Tự nhiên chuẩn bị cho bạn chạy phân tích văn bản đầu tiên. Bạn sẽ khám phá regular expressions và tokenization, hai thành phần phổ biến nhất trong hầu hết các tác vụ phân tích. Với regular expressions, bạn có thể tìm kiếm bất kỳ mẫu nào bạn nghĩ đến; còn với tokenization, bạn có thể chuẩn bị và làm sạch văn bản cho các phân tích nâng cao hơn. Chương này là bước đệm cần thiết để xử lý các kỹ thuật mà chúng ta sẽ học ở những chương tiếp theo của khóa học.
Trong chương này, bạn sẽ học các cách phân tích văn bản phổ biến và được nghiên cứu nhiều nhất. Bạn sẽ xem cách tạo một text corpus, mở rộng biểu diễn bag-of-words thành ma trận TFIDF, và dùng thước đo cosine-similarity để xác định mức độ tương đồng giữa hai đoạn văn bản. Bạn sẽ củng cố nền tảng để thực hành NLP trước khi đi sâu vào các ứng dụng của NLP ở chương 3 và 4.
Chương 3 tập trung vào hai cách tiếp cận phân tích văn bản phổ biến: mô hình phân loại và topic modeling. Nếu bạn làm việc với các dự án phân tích văn bản, bạn gần như chắc chắn sẽ dùng một hoặc cả hai phương pháp này. Chương này hướng dẫn bạn cách thực hiện cả hai kỹ thuật và cung cấp góc nhìn thực tiễn về cách tiếp cận chúng.
Ở chương 4, chúng ta tìm hiểu hai trụ cột của xử lý ngôn ngữ tự nhiên: sentiment analysis và word embeddings. Đây là hai kỹ thuật phân tích mà bất kỳ ai học nền tảng phân tích văn bản cũng nên biết. Bên cạnh đó, bạn sẽ lướt qua BERT, gán nhãn từ loại (part-of-speech tagging), và named entity recognition. Gần 15 kỹ thuật phân tích khác nhau đã được đề cập trong khóa học, vì vậy chương 4 sẽ kết thúc bằng phần tổng kết lại tất cả các kỹ thuật hữu ích mà bạn sẽ học trong khóa này.
Bài tập hiện tại