Vina Blockchain
Vina Blockchain
Dang Van
Episode 233 –- Phân tích văn bản - Mar 24 – 2019 Do Lê Quang Văn thực hiện
19 minutes Posted Mar 28, 2019 at 1:37 am.
0:00
19:55
Download MP3
Show notes
Chúng ta có rất nhiều dữ liệu có sẵn, các công cụ nguồn mở mạnh mẽ và miễn phí để tiến hành phân tích và nghiên cứu về học máy, ngôn ngữ học tính toán với văn bản đang tiến triển theo tốc độ chưa từng thấy trước đây.
Trong chương này, chúng ta sẽ đi vào chi tiết về phân tích văn bản chính xác là gì và xem xét các động lực để nghiên cứu và hiểu phân tích văn bản. Sau đây là các chủ đề chúng ta sẽ đề cập trong chương này:
● Phân tích văn bản là gì?
● Dữ liệu ở đâu?
● Tại sao BẠN nên quan tâm?
Phân tích văn bản là gì?
Nếu có một phương tiện truyền thông mà chúng ta tiếp xúc hàng ngày, đó là văn bản. Cho dù đó là tờ báo buổi sáng của chúng ta hay tin nhắn chúng ta nhận được, có khả năng bạn sẽ nhận được thông tin dưới dạng văn bản.
Hãy đặt mọi thứ vào một góc nhìn nhỏ hơn - xem xét lượng dữ liệu văn bản được xử lý bởi các công ty như Google (hơn 1 nghìn tỷ truy vấn mỗi năm), Twitter (1,6 tỷ truy vấn mỗi ngày) và WhatsApp (hơn 30 tỷ tin nhắn mỗi ngày). Đó là một nguồn tài nguyên đáng kinh ngạc, và bản chất phổ biến của văn bản là đủ lý do để chúng ta nghiêm túc thực hiện nó. Dữ liệu văn bản cũng có giá trị kinh doanh rất lớn và các công ty có thể sử dụng dữ liệu này để tạo hồ sơ khách hàng và hiểu xu hướng của khách hàng. Điều này có thể được sử dụng để cung cấp trải nghiệm cá nhân hóa hơn cho người dùng hoặc làm thông tin cho mục tiêu tiếp thị. Ví dụ, Facebook sử dụng dữ liệu văn bản rất nhiều và một trong những thuật toán chúng ta sẽ tìm hiểu sau này được phát triển tại nhóm nghiên cứu AI của Facebook.
Phân tích văn bản có thể được hiểu như kỹ thuật lượm lặt hữu ích thông tin từ văn bản. Điều này có thể được thực hiện thông qua các kỹ thuật khác nhau và chúng ta sử dụng Xử lý ngôn ngữ tự nhiên (NLP), Ngôn ngữ học tính toán (CL) và các công cụ số khác để có được thông tin này. Những công cụ số này là thuật toán học máy hoặc thuật toán truy xuất thông tin. Chúng tôi sẽ giải thích ngắn gọn, không chính thức những điều khoản này vì chúng sẽ xuất hiện trong suốt Tập tin này.
Xử lý ngôn ngữ tự nhiên (NLP) đề cập đến việc sử dụng máy tính để xử lý ngôn ngữ tự nhiên. Ví dụ, loại bỏ tất cả các lần xuất hiện của từ đó từ một phần văn bản là một ví dụ như vậy, đây chỉ là một ví dụ cơ bản.
Ngôn ngữ học tính toán (CL), như tên cho thấy, là nghiên cứu về ngôn ngữ học từ góc độ tính toán. Điều này có nghĩa là sử dụng máy tính và thuật toán để thực hiện các tác vụ ngôn ngữ như đánh dấu văn bản của bạn là một phần của lời nói (như danh từ hoặc động từ), thay vì thực hiện thủ công cho nhiệm vụ này.
Học máy (ML) là lĩnh vực nghiên cứu trong đó chúng ta sử dụng các thuật toán thống kê để dạy máy tính thực hiện một nhiệm vụ cụ thể. Việc học này xảy ra với dữ liệu và nhiệm vụ của chúng ta thường là dự đoán một giá trị mới dựa trên dữ liệu được quan sát trước đó.
Truy xuất thông tin (Information Retreiving IR ) là nhiệm vụ tìm kiếm hoặc truy xuất thông tin dựa trên truy vấn của người dùng. Các thuật toán hỗ trợ thực hiện nhiệm vụ này được gọi là thuật toán truy xuất thông tin và chúng ta sẽ bắt gặp chúng trong suốt Tập tin này.
Các công cụ tìm kiếm như Google hoặc Bing! cũng đứng trên vai của nghiên cứu được thực hiện trong Xử lý ngôn ngữ tự nhiên (NLP), Ngôn ngữ học tính toán (CL) và ảnh hưởng đến cuộc sống của chúng ta một cách chưa từng thấy. Truy xuất thông tin (IR) xây dựng trên các phương pháp thống kê trong xử lý văn bản và cho phép chúng tôi phân loại, phân cụm và truy xuất tài liệu. Các phương pháp như mô hình hóa chủ đề có thể giúp chúng ta xác định các chủ đề chính trong các nội dung lớn, không có cấu trúc của văn bản. Xác định các chủ đề này vượt ra ngoài việc tìm kiếm từ khóa và chúng ta sử dụng các mô hình thống kê để hiểu thêm về bản chất cơ bản của các nội dung văn bản. Không có sức mạnh của máy tính, chúng ta không thể thực hiện loại phân tích thống kê quy mô lớn này trên văn bản. Chúng ta sẽ tìm hiểu mô hình chủ đề chi tiết sau này trong các Tập tin kế tiếp về Xử lý ngôn ngữ tự nhiên.