Vina Blockchain
Vina Blockchain
Dang Van
Episode 234 – Dữ liệu cho Phân tích văn bản (Sketch Engine for Vietnamese) - Mar 25 – 2019 Do Lê Quang Văn thực hiện
22 minutes Posted Mar 28, 2019 at 2:15 am.
0:00
22:34
Download MP3
Show notes
Dữ liệu cho Phân tích văn bản
Mặc dù điều quan trọng là phải biết các kỹ thuật và các công cụ liên quan đến Xử lý ngôn ngữ tự nhiên (NLP), Ngôn ngữ học tính toán (CL), nhưng tất nhiên, nó là vô nghĩa khi không có bất kỳ dữ liệu nào. May mắn cho chúng ta, chúng ta có quyền truy cập vào một lượng lớn dữ liệu nếu chúng ta tìm đúng nơi. Cách dễ nhất để tìm dữ liệu văn bản để làm việc là tìm kiếm một kho văn bản (corpus/corpora).
Một kho văn bản (corpus) là một tập hợp lớn các văn bản có cấu trúc và là một cách tuyệt vời để bắt đầu phân tích văn bản. Ví dụ về các kho văn bản miễn phí là American National Corpus [ANC] hoặc British National Corpus [BNC]. Wikipedia có một danh sách hữu ích về các kho văn bản lớn nhất có sẵn trong bài viết về các văn bản văn bản. Những ngôn ngữ này không giới hạn riêng cho tiếng Anh, và cũng có cho nhiều kho văn bản khác nhau trong các ngôn ngữ châu Âu và châu Á, và có những nỗ lực không ngừng trên toàn thế giới để tạo ra các kho văn bản cho phần lớn các ngôn ngữ khác. Phòng thí nghiệm nghiên cứu của các trường đại học là một nguồn có giá trị khác để có được các kho văn bản - thực sự, một trong những kho văn bản tiếng Anh mang tính biểu tượng nhất là kho văn bản Brown Corpus, được đặt tại Đại học Brown.
Các văn bản khác nhau có xu hướng có mức độ thông tin khác nhau, thường phụ thuộc vào mục đích chính của kho văn bản đó - ví dụ, kho văn bản có chức năng chính là hỗ trợ trong quá trình dịch sẽ có cùng một câu trong nhiều ngôn ngữ. Một cách khác mà kho văn bản có thêm thông tin là thông qua chú thích. Ví dụ về chú thích trong văn bản thường bao gồm gắn thẻ Part-Of-Speech (POS) hoặc Named-Entity-Recognition (NER). Gắn thẻ POS liên quan đến việc đánh dấu từng từ trong câu với một phần của bài phát biểu (Danh từ, động từ, trạng từ, v.v.) và một văn bản được chú thích cho NER sẽ có tất cả các thực thể được đặt tên được công nhận, chẳng hạn như địa điểm, con người và thời gian.
Dự án Gutenberg có khả năng là nguồn lực tốt nhất để tải sách và chứa hơn 50.000 Sách điện tử miễn phí và nhiều tác phẩm văn học kinh điển. Các sách dạng PDF và sách điện tử cá nhân cũng là một tài nguyên, nhưng một lần nữa, điều quan trọng là phải biết bản chất pháp lý của văn bản của bạn trước khi sử dụng nó. Tải xuống một bản sao lậu, giả sử, Harry Potter từ internet và xuất bản kết quả phân tích văn bản có thể không phải là ý tưởng tốt nhất nếu bạn không thể giải thích bạn lấy văn bản từ đâu! Tương tự, phân tích văn bản trên tin nhắn văn bản riêng tư có thể không chỉ gây khó chịu cho bạn bè của bạn mà còn có thể vi phạm luật riêng tư.
Phần mềm Sketch Engine do Adam Kilgarriff thực hiện
Adam Kilgarriff và Phương Lê-Hồng
Phác thảo (Sketch) từ là bản tóm tắt tự động, dựa trên một trang của ngữ pháp của một từ và hành vi trong cộng đồng kho văn bản. Các Phác thảo (Sketch) từ lần đầu tiên được sử dụng trong quá trình sản xuất Từ điển tiếng Anh do Macmillan thực hiện. Tại thời điểm đó, bản phác thảo từ chỉ tồn tại cho tiếng Anh. Ngày nay, Công cụ phác thảo là có sẵn, một công cụ kho văn bản lấy đầu vào của bất kỳ ngôn ngữ và ngữ pháp tương ứng, kho văn bản (corpus) mẫu và tạo ra các bản phác thảo từ cho các từ của ngôn ngữ đó. Nó cũng tự động tạo ra một từ điển đồng nghĩa và 'sự khác biệt phác họa', trong đó xác định những điểm tương đồng và khác biệt giữa các từ gần giống nhau. Một kho ngữ liệu từ Internet của tiếng Việt đã được token hóa, được gắn thẻ một phần của kho văn bản và được tải vào
Công cụ phác thảo (Sketch Engine). Kết quả cho thấy các bản phác thảo từ có thể tạo điều kiện thuận lợi cho việc thục hiện từ điển tiếng Việt, như đã được thực hiện cho các ngôn ngữ khác. Bản phác thảo từ, cho tiếng Việt và nhiều ngôn ngữ khác, có thể được tìm thấy tại http://www.sketchengine.co.uk.
Để tạo bản phác thảo từ, Công cụ phác thảo cần biết cách xác định các từ được kết nối bởi quan hệ ngữ pháp.
Quan hệ ngữ pháp được định nghĩa là các biểu thức chính quy trên thẻ lời nói (POS), như phần mềm vnTagger do Tiến sĩ Lê Hồng Phương thực hiện.