Bài 2 đã giới thiệu 3 loại hình Machine Learning (ML). Giờ hãy cùng xem xét các thuật toán cụ thể làm nền tảng cho từng loại hình đó. Bạn không cần phải hiểu tường tận toán học đằng sau mỗi thuật toán; điều quan trọng là bạn nắm được chức năng của từng thuật toán, cũng như biết khi nào chúng phát huy hiệu quả và khi nào thì không.
Các thuật toán Học có giám sát (Supervised Learning)
Thuật toán Machine Learning (ML) đơn giản nhất. Nó tìm một đường thẳng (hoặc mặt phẳng) khớp nhất với dữ liệu của bạn.
Chức năng: Dự đoán một giá trị số liên tục dựa trên các đặc trưng đầu vào.
Ví dụ: Dự đoán giá nhà dựa trên diện tích (số feet vuông). Thuật toán tìm ra phương trình đường thẳng: giá = $200 × diện_tích + $50.000. Mỗi feet vuông tăng thêm sẽ làm tăng khoảng $200 vào giá dự đoán.
Khi nào nên dùng: Các mối quan hệ có tính tuyến tính (hoặc gần như tuyến tính), tập dữ liệu quy mô nhỏ đến trung bình, hoặc khi bạn cần kết quả dễ diễn giải (mỗi đặc trưng đều có một hệ số rõ ràng).
Khi nào không hiệu quả: Các mối quan hệ phức tạp, phi tuyến tính. Nếu giá nhà tăng theo hàm mũ dựa trên diện tích thay vì tăng tuyến tính, hồi quy tuyến tính sẽ không nắm bắt được đường cong đó.
Cây quyết định (Decision Tree)
Một cấu trúc dạng lưu đồ giúp đưa ra quyết định bằng cách đặt ra chuỗi các câu hỏi về dữ liệu.
Chức năng: Phân chia dữ liệu dựa trên giá trị của các đặc trưng, tạo thành một cây quyết định dẫn đến kết quả dự đoán.
Ví dụ: Liệu khách hàng này có rời bỏ dịch vụ không?
Mở ChatGPT (chat.openai.com), Claude (claude.ai) hoặc Gemini (gemini.google.com) và bắt đầu một cuộc trò chuyện mới. Sao chép câu lệnh (prompt) này:
Hợp đồng có phải dạng thanh toán theo tháng không?
├── CÓ → Thời gian sử dụng < 12 tháng?
│ ├── CÓ → RỦI RO CAO (83% rời bỏ)
│ └── KHÔNG → RỦI RO TRUNG BÌNH (45% rời bỏ)
└── KHÔNG → RỦI RO THẤP (12% rời bỏ)
Cách điền thông tin chi tiết của bạn: Thay thế các phần trong ngoặc vuông [] bằng thông tin cụ thể từ tình huống thực tế của bạn. Đầu vào mơ hồ sẽ cho ra kết quả mơ hồ - hãy cung cấp thông tin cụ thể.
Những gì bạn sẽ thấy: Chỉ trong vài giây, AI sẽ trả về một phản hồi có cấu trúc dựa trên câu lệnh trên. Hãy đọc kỹ và coi đó là bản nháp, không phải là câu trả lời cuối cùng.
Cách xử lý kết quả: Lưu lại phản hồi vào file ghi chú. Hãy chọn ra một gợi ý mang lại hiệu quả cao nhất và thực hiện nó ngay trong tuần này - đừng cố gắng làm tất cả mọi thứ cùng lúc.
Nếu kết quả chưa phù hợp: Nếu các gợi ý có vẻ quá chung chung, hãy nhập thêm yêu cầu: "Hãy đưa ra gợi ý cụ thể hơn dựa trên bối cảnh thực tế của tôi. Bỏ qua những lời khuyên chung chung". Nếu hệ thống bỏ sót các chi tiết quan trọng bạn đã cung cấp, hãy thêm yêu cầu: "Bạn đã bỏ sót [X] trong bối cảnh của tôi - hãy thực hiện lại với [X] là yếu tố ràng buộc chính".
Ưu điểm: Hoàn toàn có thể diễn giải được - bạn có thể truy xuất ngược lại từng dự đoán thông qua lộ trình ra quyết định. Các bên liên quan không chuyên về kỹ thuật cũng có thể hiểu và kiểm chứng được logic này.
Nhược điểm: Dễ xảy ra hiện tượng quá khớp (overfitting) — cây quyết định có thể trở nên quá phức tạp đến mức nó chỉ "học thuộc lòng" dữ liệu huấn luyện thay vì học các quy luật tổng quát. Một cái cây có 100 tầng sẽ khớp hoàn hảo với dữ liệu huấn luyện nhưng lại thất bại khi xử lý dữ liệu mới.
Kiểm tra nhanh: Một cây quyết định dùng để xét duyệt khoản vay có 200 tầng và phân loại chính xác tuyệt đối mọi mẫu dữ liệu huấn luyện. Liệu như vậy có tốt không?
Đáp án: Không - đó là hiện tượng quá khớp. Cây 200 tầng đã ghi nhớ toàn bộ dữ liệu huấn luyện, bao gồm cả các nhiễu và đặc điểm bất thường trong đó. Nó sẽ hoạt động rất kém khi xử lý những hồ sơ vay mới.
Cách khắc phục: Giới hạn độ sâu của cây (thường chỉ cần 5-20 tầng), quy định số lượng mẫu tối thiểu cho mỗi lá, hoặc bỏ bớt các nhánh không cần thiết. Những cái cây đơn giản hơn thường có khả năng tổng quát hóa tốt hơn.
Random Forest
Một mô hình kết hợp gồm nhiều cây quyết định cùng bỏ phiếu để đưa ra dự đoán cuối cùng.
Cách thức hoạt động: Xây dựng hàng trăm cây quyết định, mỗi cây được huấn luyện trên một tập con ngẫu nhiên của dữ liệu và các đặc trưng. Dự đoán cuối cùng được đưa ra dựa trên kết quả bỏ phiếu đa số (đối với bài toán phân loại) hoặc giá trị trung bình (đối với bài toán hồi quy) của tất cả các cây.
Tại sao nó tốt hơn một cây quyết định đơn lẻ: Các cây quyết định đơn lẻ thường gặp vấn đề quá khớp. Tuy nhiên, nếu bạn xây dựng 500 cây, mỗi cây sử dụng dữ liệu huấn luyện và các đặc trưng hơi khác nhau, thì các sai số của chúng sẽ triệt tiêu lẫn nhau. Mô hình kết hợp này có độ chính xác và độ ổn định cao hơn bất kỳ cây đơn lẻ nào.
Sự đánh đổi: Khó diễn giải hơn so với một cây quyết định đơn lẻ (rất khó để truy xuất quy trình bỏ phiếu của 500 cây), nhưng lại có độ chính xác cao hơn đáng kể. Đối với hầu hết các bài toán sử dụng dữ liệu có cấu trúc, Random Forest thường là lựa chọn khởi đầu mặc định.
Được lấy cảm hứng một phần từ cơ chế hoạt động của các nơ-ron sinh học. Chúng bao gồm các lớp node được kết nối với nhau, có chức năng chuyển đổi dữ liệu đầu vào thành đầu ra.
Chức năng: Học các mô hình phức tạp và phi tuyến tính từ khối lượng dữ liệu khổng lồ. Chúng đặc biệt hiệu quả với hình ảnh, văn bản và âm thanh - những dạng dữ liệu phi cấu trúc mà các thuật toán truyền thống thường gặp khó khăn khi xử lý.
Điểm mấu chốt: Mạng nơ-ron tự học các đặc trưng của dữ liệu. Với thuật toán truyền thống, bạn phải tự xác định các đặc trưng (ví dụ: phát hiện cạnh đối với hình ảnh, tần suất từ đối với văn bản). Ngược lại, mạng nơ-ron tự động khám phá các đặc trưng phù hợp từ dữ liệu thô. Đây là lý do tại sao chúng chiếm ưu thế trong các lĩnh vực thị giác máy tính, xử lý ngôn ngữ tự nhiên (NLP) và nhận dạng giọng nói.
Sự đánh đổi: Đòi hỏi nhiều dữ liệu và tài nguyên tính toán hơn so với các thuật toán truyền thống. Quá trình huấn luyện cũng phức tạp hơn (cần thiết kế kiến trúc cẩn thận và tinh chỉnh các siêu tham số). Khả năng giải thích thấp - chúng thường được ví như "hộp đen" vì rất khó để giải thích tường tận lý do tại sao mô hình lại đưa ra một dự đoán cụ thể nào đó.
Học không giám sát: Phân cụm K-Means
Cách thức hoạt động: Nhóm các điểm dữ liệu thành K cụm dựa trên sự tương đồng. Bạn xác định số lượng nhóm (K) mong muốn; thuật toán sẽ tự động xác định điểm dữ liệu nào thuộc về nhóm nào.
Ví dụ: Phân khúc khách hàng.
Khi đưa dữ liệu mua hàng vào thuật toán K-Means với K=4, hệ thống có thể phát hiện ra các nhóm sau:
Cụm 1: Khách hàng giá trị cao, mua sắm thường xuyên (khách hàng VIP)
Cụm 2: Khách hàng mua sắm theo mùa (mua vào dịp lễ hoặc đợt giảm giá)
Cụm 3: Khách hàng chỉ mua khi có giảm giá (chỉ mua trong các chương trình khuyến mãi)
Cụm 4: Khách hàng mua một lần (không quay lại)
Thách thức: Bạn phải chọn giá trị K (số lượng cụm). Nếu chọn quá ít cụm, kết quả sẽ bị đơn giản hóa quá mức; nếu chọn quá nhiều, các nhóm có ý nghĩa sẽ bị chia nhỏ. Các kỹ thuật như "phương pháp khuỷu tay" (elbow method) giúp xác định giá trị K phù hợp, nhưng việc đưa ra quyết định cuối cùng vẫn luôn đòi hỏi sự cân nhắc và đánh giá.
Lựa chọn thuật toán phù hợp
Kiểu dữ liệu
Thuật toán khởi đầu tốt nhất
Lý do
Dữ liệu dạng bảng, phân loại
Random Forest hoặc XGBoost
Độ chính xác cao, xử lý được các loại đặc trưng hỗn hợp
Dữ liệu dạng bảng, hồi quy
Hồi quy tuyến tính → Random Forest
Hãy bắt đầu đơn giản, rồi thêm sự phức tạp nếu cần
Hình ảnh
Convolutional Neural Network (CNN)
Tự động học các đặc trưng không gian
Văn bản / NLP
Transformer Neural Network
Ghi nhận các mô hình ngôn ngữ và ngữ cảnh
Tìm các nhóm (không có nhãn)
K-Means
Các cụm đơn giản, nhanh chóng và dễ diễn giải
Cần khả năng giải thích
Cây quyết định
Mọi dự đoán đều có thể truy xuất được nguồn gốc
Kiểm tra nhanh: CEO của bạn hỏi: "Tại sao mô hình lại đánh dấu khách hàng này là có nguy cơ rời bỏ cao?" Bạn đã sử dụng Neural Network. Liệu bạn có thể giải thích điều đó không?
Đáp án: Có lẽ là không, nếu xét trên khía cạnh kinh doanh. Neural Network hoạt động như một "hộp đen" - chúng có thể xác định các đặc trưng quan trọng nhất nhưng lại không thể hiển thị quy trình ra quyết định cụ thể như cây quyết định (decision tree). Nếu yêu cầu khả năng giải thích (để tuân thủ quy định, báo cáo cho ban lãnh đạo, hoặc các quyết định ảnh hưởng trực tiếp đến khách hàng), hãy sử dụng những mô hình dựa trên định dạng cây. Nếu độ chính xác thuần túy quan trọng hơn khả năng giải thích (như trong nhận diện hình ảnh, xử lý giọng nói), thì mạng nơ-ron là lựa chọn phù hợp.
Những điểm chính cần lưu ý
Hồi quy tuyến tính: Đơn giản nhất, tốt nhất cho các tập dữ liệu nhỏ và cho kết quả dễ giải thích
Cây quyết định (Decision trees): Hoàn toàn dễ giải thích nhưng dễ bị quá khớp (overfitting) - cần giới hạn độ sâu của cây
Random forest: Mô hình kết hợp nhiều cây, độ chính xác cao hơn nhưng khó giải thích hơn - lựa chọn mặc định cho dữ liệu có cấu trúc
Neural Network: Vượt trội trong xử lý hình ảnh, văn bản và âm thanh - đòi hỏi nhiều dữ liệu và tài nguyên tính toán hơn, khó giải thích hơn
K-means: Phân nhóm dữ liệu chưa được gán nhãn - bạn tự chọn số lượng nhóm
Đối với dữ liệu có cấu trúc/dạng bảng, các phương pháp dựa trên cây (như XGBoost, Random forest) thường mang lại hiệu quả tốt hơn so với Deep Learning
Câu 1:
Đối với dữ liệu có cấu trúc/dạng bảng (bảng tính, cơ sở dữ liệu), nhóm thuật toán nào thường vượt trội hơn so với Deep Learning?
GIẢI THÍCH:
Đây là một trong những bài học thực tiễn quan trọng nhất trong lĩnh vực Machine Learning (ML): Việc lựa chọn thuật toán phù hợp phụ thuộc vào loại dữ liệu. Với dữ liệu hình ảnh → Convolutional Neural Network (CNN). Với văn bản → mạng nơ-ron Transformer. Với âm thanh → Recurrent Neural Network (RNN). Với dữ liệu dạng bảng (hồ sơ khách hàng, dữ liệu tài chính, chỉ số cảm biến, bảng tính) → XGBoost, LightGBM hoặc Random Forest. Các cuộc thi trên Kaggle liên tục cho thấy những mô hình dựa trên định dạng cây chiếm ưu thế đối với dữ liệu có cấu trúc. Deep Learning tuy mạnh mẽ nhưng không phải lúc nào cũng vượt trội hơn mọi phương pháp khác.
Câu 2:
Bạn đang xây dựng một mô hình để dự đoán giá nhà (một giá trị số liên tục) dựa trên các đặc trưng như diện tích, số phòng ngủ và vị trí. Bạn có 500 điểm dữ liệu. Thuật toán nào là điểm khởi đầu tốt nhất?
GIẢI THÍCH:
Hồi quy tuyến tính là điểm khởi đầu phù hợp vì ba lý do: (1) tập dữ liệu nhỏ — 500 điểm dữ liệu là quá ít đối với mạng nơ-ron, (2) bài toán hồi quy — bạn đang dự đoán một giá trị số liên tục, (3) khả năng diễn giải — các hệ số cho biết mỗi phòng ngủ tăng thêm sẽ cộng thêm $X vào giá dự đoán, và mỗi foot vuông diện tích sẽ cộng thêm $Y. Luôn bắt đầu với mô hình đơn giản nhất có khả năng hoạt động hiệu quả. Nếu hồi quy tuyến tính đạt độ chính xác 85% còn mạng nơ-ron đạt 87%, thì mức cải thiện 2% đó hiếm khi xứng đáng với sự gia tăng về độ phức tạp, chi phí tính toán và việc mất đi khả năng diễn giải mô hình.
Câu 3:
Bạn có một tập dữ liệu gồm 10.000 hồ sơ khách hàng với 20 đặc trưng và cần dự đoán xem liệu mỗi khách hàng có rời bỏ dịch vụ hay không. Sếp của bạn muốn hiểu TẠI SAO mô hình lại dự đoán một khách hàng cụ thể sẽ rời bỏ dịch vụ. Thuật toán nào phù hợp nhất?
GIẢI THÍCH:
Yêu cầu "giải thích TẠI SAO" khiến tính diễn giải trở thành yếu tố thiết yếu. Cây quyết định hiển thị chính xác lộ trình ra quyết định: "NẾU hợp đồng là loại thanh toán theo tháng VÀ thời gian sử dụng < 6 tháng VÀ phí hàng tháng > 70 USD, THÌ nguy cơ rời bỏ dịch vụ cao". Điều này rất dễ giải thích cho các bên liên quan trong doanh nghiệp. Random forest có độ chính xác cao hơn (việc kết hợp nhiều cây giúp giảm sai số) nhưng lại khó truy vết từng dự đoán riêng lẻ hơn. Mạng nơ-ron hoạt động như một "hộp đen" - chúng có thể dự đoán chính xác, nhưng việc giải thích lý do cho sếp của bạn gần như là bất khả thi. Đối với dữ liệu có cấu trúc đi kèm yêu cầu về tính diễn giải, các mô hình dựa trên định dạng cây là lựa chọn tối ưu.
Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây: