Vina Blockchain
Vina Blockchain
Dang Van
Episode 275 – Xử lý Ngôn ngữ Tự nhiên – Phần V – Nhận xét Tổng quát về Word2vec - May 5– 2019 Do Lê Quang Văn thực hiện
21 minutes Posted May 7, 2019 at 9:31 am.
0:00
21:01
Download MP3
Show notes
Xử lý Ngôn ngữ Tự nhiên – Phần V – Nhận xét Tổng quát về Word2vec
1. Giới thiệu
Hệ thống dịch máy thống kê đã được phát triển trong nhiều năm và trở nên rất thành công trong thực tế. Các hệ thống này dựa trên từ điển và bảng cụm từ đòi hỏi nhiều nỗ lực để tạo ra và hiệu suất của chúng vẫn còn kém xa so với hiệu suất của các dịch giả chuyên gia con người. Trong phần này, chúng tôi đề xuất một kỹ thuật dịch máy có thể tự động hóa quá trình tạo từ điển và bảng cụm từ. Phương pháp của chúng tôi dựa trên các biểu diễn phân tán và nó có khả năng phù hợp với các kỹ thuật chính chủ yếu dựa vào số lượng thô.
Nghiên cứu của chúng tôi cho thấy có thể suy ra các mục từ điển bị thiếu bằng cách sử dụng các biểu diễn phân tán của từ và cụm từ. Chúng tôi đạt được điều này bằng cách học một phép chiếu tuyến tính giữa các không gian vectơ tương ứng với mỗi ngôn ngữ. Phương pháp bao gồm hai bước đơn giản. Đầu tiên, chúng tôi xây dựng các mô hình ngôn ngữ đơn ngữ bằng cách sử dụng số lượng lớn văn bản. Tiếp theo, chúng tôi sử dụng một từ điển song ngữ nhỏ để tìm hiểu dự đoán tuyến tính giữa các ngôn ngữ. Tại thời điểm thử nghiệm, chúng tôi có thể dịch bất kỳ từ nào đã được nhìn thấy trong các ngôn ngữ đơn ngữ bằng cách chiếu biểu diễn vectơ của nó từ không gian ngôn ngữ nguồn sang không gian ngôn ngữ đích. Khi chúng tôi có được vectơ trong không gian ngôn ngữ đích, chúng tôi xuất ra vectơ từ tương tự nhất là bản dịch.
Việc trình bày các ngôn ngữ được học bằng cách sử dụng các mô hình Skip-gram hoặc liên tục từ ngữ (CBOW) được đề xuất gần đây bởi (Mikolov et al., 2013a). Những mô hình này học cách biểu diễn từ bằng cách sử dụng một kiến trúc mạng thần kinh đơn giản nhằm dự đoán các hàng xóm của một từ. Do tính đơn giản của nó, các mô hình Skip-gram và CBOW có thể được đào tạo trên một lượng lớn dữ liệu văn bản: việc triển khai song song của chúng tôi có thể học một mô hình từ hàng tỷ từ trong vài giờ.
Phương pháp đề xuất của chúng tôi là bổ sung cho các phương pháp hiện có sử dụng sự tương đồng về hình thái từ giữa các ngôn ngữ liên quan hoặc ngữ cảnh chính xác để suy ra các bản dịch có thể (Koehn và Knight, 2002; Haghighi et al., 2008; Koehn và Knight, 2000). Mặc dù chúng tôi thấy rằng các tính năng hình thái học (ví dụ: chỉnh sửa khoảng cách giữa các cách viết từ) có thể cải thiện hiệu suất cho các ngôn ngữ liên quan (như tiếng Anh sang tiếng Tây Ban Nha), phương pháp của chúng tôi rất hữu ích để dịch giữa các ngôn ngữ khác nhau đáng kể (như tiếng Anh sang Tiếng Séc hoặc tiếng Anh sang tiếng Trung Quốc).
Một ưu điểm khác của phương pháp của chúng tôi là nó cung cấp điểm dịch cho mỗi cặp từ có thể được sử dụng theo nhiều cách. Ví dụ: chúng ta có thể gia tăng các bảng cụm từ hiện có với nhiều bản dịch ngày hơn hoặc lọc ra các lỗi từ các bảng chuyển đổi và từ điển đã biết.
2 Các mô hình Skip-gram và Túi từ tiếp tục (Continuous Bag-of-Words)
Các đại diện phân tán cho các từ đã được đề xuất trong và đã trở nên cực kỳ thành công. Ưu điểm chính là việc biểu diễn các từ tương tự gần với không gian, điều này giúp cho việc khái quát hóa các tiểu thuyết dễ dàng hơn và ước lượng mô hình mạnh mẽ hơn. Công việc tiếp theo thành công bao gồm các ứng dụng cho mô hình hóa ngôn ngữ chính trị và cho các nhiệm vụ NLP khác như học từ đại diện, nhận dạng thực thể, định hướng, phân tích cú pháp và gắn thẻ.
Gần đây, người ta đã chứng minh rằng các từ được phân phối của các từ nắm bắt đáng ngạc nhiên nhiều quy tắc truyền thống và có nhiều loại tương đồng giữa các từ có thể được biểu thị dưới dạng bản dịch tuyến tính (Mikolov et al., 2013c). Chẳng hạn, các hoạt động của vectơ King - Man + Woman, vectơ kết quả rất giống với vector thể hiện “queen” (Nữ hoàng).
Hai mô hình cụ thể để học cách biểu diễn từ có thể được đào tạo hiệu quả trên một lượng lớn dữ liệu văn bản là các mô hình Skip-gram và CBOW được giới thiệu. Trong mô hình CBOW, mục tiêu đào tạo của mô hình CBOW là kết hợp các biểu diễn của các từ xung quanh để dự đoán từ ở giữa. Các kiến trúc mô hình của hai phươn