Vina Blockchain
Vina Blockchain
Dang Van
Episode 271 – Xử lý ngôn ngữ tự nhiên (NLP) Phần 1 Giới thiệu tổng quát - May 1– 2019 Do Lê Quang Văn thực hiện
22 minutes Posted May 5, 2019 at 2:12 am.
0:00
22:07
Download MP3
Show notes
Xử lý ngôn ngữ tự nhiên (NLP)
Xử lý ngôn ngữ tự nhiên (NLP) là một công cụ quan trọng để hiểu và xử lý khối lượng dữ liệu khổng lồ không có cấu trúc trong thế giới ngày nay. Gần đây, học sâu đã được áp dụng rộng rãi cho nhiều nhiệm vụ NLP vì hiệu suất vượt trội mà các thuật toán học sâu đã thể hiện trong rất nhiều nhiệm vụ đầy thách thức, như phân loại hình ảnh, nhận dạng giọng nói và tạo văn bản thực tế.
Xử lý ngôn ngữ tự nhiên là gì?
Theo IBM, 2,5 exabyte (1 exabyte = 1.000.000.000 gigabyte = 1 tỷ gigabyte) dữ liệu đã được tạo ra mỗi ngày trong năm 2017 và điều này đang tăng lên. Đưa điều đó vào viễn cảnh, nếu tất cả con người trên thế giới xử lý dữ liệu đó, thì mỗi ngày chúng ta sẽ xử lý khoảng 300 MB (tương đương với 300 cuốn sách 500 trang). Trong tất cả các dữ liệu này, một phần lớn là văn bản và lời nói không có cấu trúc vì có hàng triệu email và nội dung phương tiện truyền thông xã hội được tạo và các cuộc gọi điện thoại được thực hiện mỗi ngày.
Những số liệu thống kê cung cấp một cơ sở tốt để chúng ta xác định NLP là gì. Nói một cách đơn giản, mục tiêu của NLP là làm cho máy móc hiểu ngôn ngữ mà chúng ta nói và viết. Hơn nữa, NLP có mặt khắp nơi và đã chiếm một phần lớn sinh hoạt trong cuộc sống của con người. Trợ lý ảo (VA), như Google Assistant, Cortana và Apple Siri, phần lớn là các hệ thống NLP. Nhiều nhiệm vụ NLP diễn ra khi một người hỏi Trợ lý ảo, "Bạn có thể chỉ cho tôi một nhà hàng Ý ngon gần đây không?". Đầu tiên, Trợ lý ảo cần chuyển đổi cách phát âm thành văn bản (nghĩa là lời nói thành văn bản). Tiếp theo, nó phải hiểu ngữ nghĩa của yêu cầu (ví dụ: người dùng đang tìm kiếm một nhà hàng tốt với một món ăn Ý) và hình thành một yêu cầu có cấu trúc (ví dụ: ẩm thực = Ý, xếp hạng = 3-5, khoảng cách <10 km). Sau đó, Trợ lý ảo phải tìm kiếm các nhà hàng lọc theo địa điểm và ẩm thực, và kế đó, sắp xếp các nhà hàng theo xếp hạng nhận được. Để tính xếp hạng tổng thể cho một nhà hàng, một hệ thống NLP tốt có thể xem xét cả xếp hạng và mô tả văn bản được cung cấp bởi mỗi người dùng. Cuối cùng, một khi người dùng ở nhà hàng, Trợ lý ảo có thể hỗ trợ người dùng bằng cách dịch các mục menu khác nhau từ tiếng Ý sang tiếng Anh. Ví dụ này cho thấy NLP đã trở thành một phần không thể thiếu trong cuộc sống của con người.
Nên hiểu rằng NLP là một lĩnh vực nghiên cứu cực kỳ thách thức vì các từ và ngữ nghĩa có mối quan hệ phi tuyến rất phức tạp, và thậm chí còn khó khăn hơn để nắm bắt thông tin này như một thể hiện mạnh mẽ bằng số. Để làm cho vấn đề tồi tệ hơn, mỗi ngôn ngữ có ngữ pháp, cú pháp và từ vựng đặc thù. Do đó, xử lý dữ liệu văn bản bao gồm nhiều nhiệm vụ phức tạp khác nhau như phân tích cú pháp văn bản (ví dụ: mã hóa và gốc = stemming), phân tích hình thái, định nghĩa từ ngữ và hiểu cấu trúc ngữ pháp cơ bản của ngôn ngữ. Chẳng hạn, trong hai câu này, I went to the bank = tôi đã đi đến ngân hàng và I walked along the river bank = tôi đi dọc theo bờ sông, từ bank có hai nghĩa hoàn toàn khác nhau. Để phân biệt từ bank, chúng ta cần hiểu ngữ cảnh mà từ đó đang được sử dụng. Học máy đã trở thành một yếu tố quyết định cho NLP, giúp hoàn thành các nhiệm vụ nói trên thông qua các máy móc.
Nhiệm vụ xử lý ngôn ngữ tự nhiên
• Tokenization = Mã thông báo: Mã thông báo là nhiệm vụ tách một văn bản thành các đơn vị nguyên tử = Đơn vị ý nghĩa.
Mặc dù nó có vẻ tầm thường, token hóa là một nhiệm vụ quan trọng.
• Word-sense Disambiguation = Định hướng ý nghĩa từ ngữ là nhiệm vụ xác định nghĩa chính xác của một từ.
• Named Entity Recognition = Nhận dạng thực thể được đặt tên: NER cố gắng trích xuất các thực thể (ví dụ: người, vị trí và tổ chức) từ một phần nhất định của văn bản hoặc ngữ liệu văn bản.
• Part-of-Speech (PoS) tagging = Gắn thẻ Từ loại (PoS): Gắn thẻ PoS là nhiệm vụ gán thẻ từ loại cho các từ.
• Sentence/Synopsis classification = Phân loại câu / tóm tắt: Phân loại câu hoặc tóm tắt
• Language generation = Tạo ngôn ngữ: Trong tạo ngôn ngữ, một mô hình học tập
• Question Answering (QA) = Trả lời câu hỏi