Show notes
Học Máy – Đơn giản nó là gì?Học Máy cho phép các máy tính tìm các mẫu (pattern) trong dữ liệu và sau đó sử dụng các mẫu này để đưa ra quyết định thay vì được lập trình rõ ràng để thực hiện một nhiệm vụ nhất định.Quy trình làm việc khá đơn giản:● Bạn có dữ liệu chứa (contains) các mẫu.● Bạn cung cấp cho nó một thuật toán ML để tìm (find) các mẫu và tạo mô hình.● Mô hình nhận ra (recognise) các mẫu này khi được trình bày với dữ liệu mới.Nhà khoa học dữ liệu là ai?Nhà khoa học dữ liệu là người đảm trách "công việc quyến rũ nhất thế kỷ 21".Chuyển nhanh đến năm 2019, Nhà khoa học dữ liệu là người có kỹ năng đa ngành từ toán học, thống kê, học máy, khoa học máy tính, lập trình và chuyên môn về lĩnh vực kinh doanh. Đúng vậy, Steven Geringer gọi những nhà khoa học dữ liệu là Kỳ lân (Unicorn), giống như trong 'quái thú thần thoại có sức mạnh ma thuật mà người ta đồn là tồn tại, nhưng thực sự không bao giờ được nhìn thấy trong tự nhiên' Đúng, các nhà khoa học dữ liệu có thể làm những điều như vậy!Các giai đoạn chính được mô tả dưới đây:1. Định nghĩa vấn đề: Xác định vấn đề kinh doanh mà bạn yêu cầu một câu trả lời.2. Nhập dữ liệu: Xác định và thu thập dữ liệu bạn muốn cho vấn đề đặt ra.3. Chuẩn bị dữ liệu: Vì dữ liệu là thô và không có cấu trúc, nên hiếm khi ở dạng chính xác được xử lý. Nó thường liên quan đến việc điền các giá trị bị thiếu hoặc xóa các bản ghi trùng lặp hoặc bình thường hóa và sửa các lỗi khác trong dữ liệu, như các biểu diễn khác nhau của cùng một giá trị trong một cột chẳng hạn. Đây là nơi diễn ra quá trình khai thác tính năng, xây dựng và lựa chọn.4. Phân chia dữ liệu: Phân chia các tập hợp dữ liệu thành ba nhóm, để (1) huấn luyện mô hình, (2) kiểm tra mô hình và (3) xác nhận cách thức thực hiện đối với dữ liệu mới.5. Đào tạo mô hình: Sử dụng tập hợp con của dữ liệu huấn luyện mô hình để cho phép thuật toán học máy nhận ra các mẫu trong đó.6. Đánh giá mô hình ứng viên: Đánh giá hiệu suất của mô hình bằng cách sử dụng các tập hợp con dữ liệu kiểm tra mô hình và dữ liệu xác thực để hiểu mức độ chính xác của dự đoán. Đây là một quá trình lặp lại và các thuật toán khác nhau có thể được kiểm tra cho đến khi bạn có được một Mô hình đủ tính chất để trả lời câu hỏi của bạn.7. Triển khai mô hình: Sau khi mô hình được tạo và được chọn, nó thường được hiển thị thông qua một số loại API và được nhúng trong các khung ra quyết định như là một phần của giải pháp phân tích.8. Giám sát hiệu suất: Mô hình được theo dõi liên tục để quan sát cách nó hoạt động trong thế giới thực và được hiệu chỉnh tương ứng. Dữ liệu mới được thu thập để tăng dần nó.Mô hình dữ liệu và dữ liệu có cấu trúc● Dữ liệu có cấu trúc● Dữ liệu bán cấu trúc: ● Dữ liệu phi cấu trúc: Orange là một công cụ trực quan hóa dữ liệu nguồn mở, học máy và bộ công cụ khai thác dữ liệu. Nó có tính năng lập trình trực quan để phân tích dữ liệu khám phá và trực quan hóa dữ liệu tương tác , và cũng có thể được sử dụng làm thư viện Python. Năm 1996, Đại học Ljubljana và Viện Jožef Stefan bắt đầu phát triển ML, một khung học máy trong C ++.Mô tả Orange là gói phần mềm lập trình trực quan dựa trên thành phần để trực quan hóa dữ liệu , học máy , khai thác dữ liệu và phân tích dữ liệu .Các thành phần Orange được gọi là các widget và chúng bao gồm từ trực quan hóa dữ liệu đơn giản, lựa chọn tập hợp con và tiền xử lý, đến đánh giá thực nghiệm các thuật toán học tập và mô hình dự đoán .Lập trình trực quan được thực hiện thông qua một giao diện trong đó các luồng công việc được tạo bằng cách liên kết các widget được xác định trước hoặc do người dùng thiết kế, trong khi người dùng nâng cao có thể sử dụng Orange làm thư viện Python để thao tác dữ liệu và thay đổi widget.Tính năng Orange bao gồm một giao diện canvas mà người dùng đặt các widget và tạo ra một quy trình phân tích dữ liệu. Các widget cung cấp các chức năng cơ bản như đọc dữ liệu, hiển thị bảng dữ liệu, chọn tính năng, dự đoán đào tạo, so sánh thuật toán học tập, trực quan hóa các yếu tố dữ liệu,

