Tìm hiểu về 3 loại Machine Learning: Học có giám sát, học không giám sát và học tăng cường

Ba loại hình Machine Learning - học có giám sát, học không giám sát và học tăng cường. Các thuật ngữ chính và trường hợp áp dụng cho từng loại.

Ba phương thức Machine Learning

Machine Learning nghe có vẻ như chỉ là một khái niệm duy nhất, nhưng thực tế lại bao gồm ba phương pháp khác biệt về bản chất. Mỗi phương pháp giải quyết một loại vấn đề khác nhau, và việc biết cách lựa chọn phương pháp phù hợp là một trong những kỹ năng quan trọng nhất trong lĩnh vực Machine Learning.

Học có giám sát (Supervised Learning): Học từ các ví dụ

Cách thức hoạt động: Bạn cung cấp cho thuật toán dữ liệu đã được gán nhãn - bao gồm các dữ liệu đầu vào đi kèm với kết quả đầu ra tương ứng chính xác. Thuật toán sẽ học các quy luật liên kết giữa đầu vào và đầu ra, sau đó dự đoán kết quả cho những dữ liệu đầu vào mới.

Ví dụ minh họa: Một giáo viên cho học sinh xem 1.000 bức ảnh chụp chó và mèo, trong đó mỗi bức ảnh đều có chú thích (nhãn) rõ ràng. Sau khi đã tiếp xúc với đủ số lượng ví dụ, học sinh có thể nhận diện được những con vật mới mà mình chưa từng thấy trước đó. Các nhãn dán chính là yếu tố đóng vai trò "giám sát" trong quá trình này.

Hai nhiệm vụ chính:

Tác vụ Những gì nó dự báo Ví dụ
Phân loại Một danh mục (rời rạc) Email → có phải là thư rác hay không
Hồi quy Một con số (liên tục) Đặc điểm ngôi nhà → giá bán

Phân loại (Classification) dự đoán xem một đối tượng thuộc về nhóm nào. Ví dụ: Email này có phải là thư rác không? Khối u này là ác tính hay lành tính? Khách hàng này có khả năng rời bỏ dịch vụ không? Kết quả đầu ra là một nhãn - một trong số các tùy chọn đã được xác định trước.

Hồi quy (Regression) dự đoán một giá trị số. Ví dụ: Ngôi nhà này sẽ được bán với giá bao nhiêu? Chúng ta sẽ bán được bao nhiêu sản phẩm trong quý tới? Nhiệt độ dự kiến ​​vào ngày mai là bao nhiêu? Kết quả đầu ra là một con số trên thang đo liên tục.

Học có giám sát (Supervised learning) chiếm ưu thế trong các ứng dụng Machine Learning (ML) thực tế. Hầu hết các vấn đề kinh doanh - như dự đoán, phân loại, dự báo - đều là những bài toán học có giám sát. Nếu bạn có dữ liệu lịch sử với các kết quả đã biết, phương pháp học có giám sát sẽ được áp dụng.

Kiểm tra nhanh: Một công ty bất động sản muốn dự đoán giá nhà dựa trên diện tích, số phòng ngủ, vị trí và tuổi thọ của ngôi nhà. Đây là bài toán phân loại hay hồi quy? Đó là hồi quy - vì kết quả đầu ra là một con số liên tục (giá cả), chứ không phải là một nhóm hay danh mục. Mô hình sẽ học mối quan hệ giữa các đặc trưng (diện tích, số phòng ngủ, vị trí, tuổi thọ) và biến mục tiêu (giá cả). Nếu câu hỏi là "liệu ngôi nhà này sẽ bán được với giá trên hay dưới 500.000 USD?" - thì đó sẽ là bài toán phân loại (hai nhóm: trên hoặc dưới mức giá đó).

Học không giám sát (Unsupervised Learning): Tìm kiếm các quy luật ẩn

Cách thức hoạt động: Bạn cung cấp cho thuật toán dữ liệu không có nhãn. Không có đáp án đúng/sai định sẵn. Thuật toán sẽ tự tìm ra cấu trúc, quy luật và các nhóm dữ liệu.

Ví dụ minh họa: Bạn đổ 10.000 bức ảnh lên bàn mà không có nhãn dán nào. Bạn nhờ ai đó sắp xếp chúng. Họ có thể nhóm ảnh theo chủ đề (con người, phong cảnh, đồ ăn), theo tông màu, theo thời điểm trong ngày hoặc theo một quy luật nào đó mà họ nhận thấy. Không ai bảo họ phải tạo ra những nhóm cụ thể nào - chính họ là người tự khám phá ra cấu trúc đó.

Hai nhiệm vụ chính:

Tác vụ Công dụng Ví dụ
Phân cụm Nhóm các điểm dữ liệu tương đồng Phân khúc khách hàng
Giảm chiều dữ liệu Đơn giản hóa dữ liệu phức tạp trong khi vẫn bảo toàn các mô hình Trực quan hóa dữ liệu đa chiều

Phân cụm tìm ra các nhóm tự nhiên. Cung cấp dữ liệu mua hàng của khách hàng cho thuật toán phân cụm, và nó có thể phát hiện ra các phân khúc như "người mua thường xuyên giá trị cao", "người mua theo mùa", "người mua chỉ khi có giảm giá" và "người mua một lần". Không ai định nghĩa các nhóm này - thuật toán đã tìm ra chúng.

Giảm chiều dữ liệu nén dữ liệu có nhiều đặc trưng thành ít chiều hơn trong khi vẫn giữ lại các mẫu quan trọng. Nếu bạn có dữ liệu khách hàng với 50 biến, giảm chiều dữ liệu có thể tiết lộ rằng chỉ có 5 yếu tố cơ bản thực sự quan trọng. Điều này hữu ích cho cả việc trực quan hóa và giúp các thuật toán khác chạy nhanh hơn.

Học tăng cường: Học từ hậu quả

Cách hoạt động: Một agent thực hiện các hành động trong một môi trường, nhận được phần thưởng hoặc hình phạt, và học cách tối đa hóa phần thưởng tích lũy theo thời gian.

Ví dụ tương tự: Một đứa trẻ học đi xe đạp. Không có sách hướng dẫn với các ví dụ được dán nhãn. Chúng thử các thao tác (nghiêng sang trái, nghiêng sang phải, đạp mạnh hơn), nhận phản hồi (giữ thăng bằng = tốt, ngã = xấu), và dần dần học được cách giữ thăng bằng.

Khái niệm chính:

  • Agent: Người học (thuật toán đưa ra quyết định)
  • Môi trường: Thế giới mà agent hoạt động
  • Hành động: Những gì agent thực hiện ở mỗi bước
  • Thưởng/phạt: Phản hồi về việc hành động đó tốt hay xấu
  • Chính sách: Chiến lược mà agent phát triển theo thời gian

Ứng dụng học tăng cường: Trí tuệ nhân tạo (AI) trong game (AlphaGo, các chương trình cờ vua), robot (robot kho hàng học cách nhặt đồ vật), xe tự hành (học cách điều hướng), tối ưu hóa tài nguyên (làm mát trung tâm dữ liệu, đấu thầu quảng cáo).

Tại sao nó khác biệt: Học có giám sát cần dữ liệu được gắn nhãn. Học không giám sát cần dữ liệu có cấu trúc để khám phá. Học tăng cường cần một môi trường nơi agent có thể thực hiện hành động và nhận phản hồi. Không cần tập dữ liệu - dữ liệu được tạo ra thông qua tương tác.

Kiểm tra nhanh: Một nền tảng stream video điều chỉnh ảnh thumbnail để tối đa hóa tỷ lệ nhấp chuột. Nó thử các ảnh thumbnail khác nhau, đo lường hình ảnh nào được nhấp và dần dần học được phong cách hình ảnh nào hoạt động tốt nhất cho từng loại nội dung. Đây là loại Machine Learning nào?

Đáp án: Học tăng cường - nền tảng thực hiện các hành động (hiển thị các hình thu nhỏ khác nhau), nhận phần thưởng (lượt nhấp chuột) và học một chiến lược tối đa hóa phần thưởng (tỷ lệ nhấp chuột). Không có tập dữ liệu được gắn nhãn về "thumbnail chính xác" - hệ thống học hỏi từ hành vi người dùng theo thời gian.

Những thuật ngữ chính

Thuật ngữ Ý nghĩa
Tính năng Một biến đầu vào (diện tích, độ tuổi, giá trị pixel)
Nhãn/Mục tiêu Kết quả đầu ra mà mô hình dự đoán (giá, danh mục)
Dữ liệu huấn luyện Dữ liệu được sử dụng để huấn luyện mô hình
Dữ liệu kiểm thử Dữ liệu được giữ lại để đánh giá hiệu suất mô hình
Mô hình Mối quan hệ toán học đã học được giữa các đặc điểm và mục tiêu
Dự đoán/Suy luận Sử dụng mô hình đã được huấn luyện trên dữ liệu mới

Công cụ phân loại bài toán Machine Learning (ML)

Hãy mở ChatGPT, Claude hoặc Gemini và dán nội dung sau:

Hãy đóng vai trò là công cụ phân loại bài toán Machine Learning (ML) giúp tôi. Tôi sẽ mô tả 3 bài toán ML tiềm năng; bạn hãy xác định đúng loại hình học tập và loại tác vụ cho từng bài toán đó. Với mỗi vấn đề tôi mô tả, hãy đưa ra:

1. Loại hình Machine Learning: có giám sát / không giám sát / học tăng cường / không phải Machine Learning (ML)
2. Loại tác vụ: phân loại / hồi quy / phân cụm / giảm chiều dữ liệu / phát hiện bất thường / gợi ý / học chính sách / không có
3. Các "đặc trưng" cho vấn đề này trông như thế nào (liệt kê 5 ứng viên)
4. "Nhãn" hoặc mục tiêu trông như thế nào (hoặc "không có nhãn — học từ cấu trúc/phần thưởng")
5. Quy mô tập dữ liệu tối thiểu (ước tính số hàng, yêu cầu về nhãn)
6. Chỉ số đánh giá thực sự quan trọng (độ chính xác/accuracy thường là cái bẫy — hãy đề xuất precision/recall/F1/MAE/NDCG hoặc chỉ số kinh doanh)
7. Lý do duy nhất có khả năng cao nhất khiến dự án thất bại khi triển khai thực tế
8. Một giải pháp thay thế đơn giản hơn (không dùng ML) mà tôi nên thử trước

Ba vấn đề của tôi:

Vấn đề 1:
- Điều tôi muốn dự đoán hoặc khám phá: []
- Dữ liệu tôi có: []
- Hành động thực hiện dựa trên kết quả đầu ra: []

Vấn đề 2:
- Điều tôi muốn dự đoán hoặc khám phá: []
- Dữ liệu tôi có: []
- Hành động thực hiện dựa trên kết quả đầu ra: []

Vấn đề 3:
- Điều tôi muốn dự đoán hoặc khám phá: []
- Dữ liệu tôi có: []
- Hành động thực hiện dựa trên kết quả đầu ra: []

QUY TẮC BẮT BUỘC:
- Nếu vấn đề thực chất là tác vụ dùng hệ thống quy tắc, hãy nêu rõ điều đó và từ chối cố gắng ép buộc nó vào khuôn khổ Machine Learning
- Tuyệt đối không đề xuất độ chính xác (accuracy) làm chỉ số đánh giá cho các lớp dữ liệu mất cân bằng (gian lận, bệnh tật, sự kiện hiếm gặp) — hãy đề xuất precision/recall/F1 hoặc PR-AUC và giải thích lý do
- Nếu mục tiêu chứa thuộc tính được bảo vệ hoặc rò rỉ dữ liệu (sử dụng kết quả đầu ra làm đặc trưng đầu vào), hãy cảnh báo ngay lập tức
- Nếu tác vụ ảnh hưởng đến khả năng tiếp cận việc làm / nhà ở / tín dụng / chăm sóc sức khỏe / tư pháp của con người, hãy lưu ý các yêu cầu quản trị bổ sung — kiểm tra tác động chênh lệch, con người xem xét lại, và nhật ký kiểm toán
- Mặc định giữ thái độ hoài nghi — hầu hết các "vấn đề ML" trong kinh doanh sẽ được giải quyết tốt hơn bằng SQL, một quy tắc đơn giản, hoặc con người trong 6 tháng đầu tiên

Cách điền thông tin chi tiết: Thay thế mỗi phần [] và các nội dung giữ chỗ trong ngoặc bằng thông tin cụ thể từ tình huống thực tế của bạn. Đầu vào mơ hồ sẽ cho ra kết quả mơ hồ - hãy đưa ra thông tin cụ thể.

Những gì bạn sẽ nhận được: Chẩn đoán rõ ràng về từng vấn đề - bao gồm loại hình Machine Learning, tác vụ, các đặc trưng, nhãn, chỉ số đo lường, dạng lỗi thường gặp, và một giải pháp thay thế đơn giản hơn để thử nghiệm trước.

Cách xử lý kết quả: Lưu lại phản hồi vào file ghi chú. Chọn ra một gợi ý mang lại hiệu quả cao nhất và thực hiện ngay trong tuần này - đừng cố gắng làm tất cả mọi thứ cùng lúc.

Nếu kết quả chưa phù hợp: Nếu các gợi ý có vẻ quá chung chung, hãy gửi thêm yêu cầu: "Hãy đưa ra gợi ý cụ thể hơn cho bối cảnh thực tế của tôi. Bỏ qua những lời khuyên chung chung". Nếu hệ thống bỏ qua các chi tiết quan trọng mà bạn đã cung cấp, hãy thêm yêu cầu: "Bạn đã bỏ sót [X] trong bối cảnh của tôi - hãy thực hiện lại với [X] là yếu tố ràng buộc chính".

Những điểm chính cần ghi nhớ

  • Ba loại hình Machine Learning: học có giám sát (dữ liệu có nhãn → dự đoán), học không giám sát (dữ liệu không nhãn → tìm ra các quy luật/mẫu hình), học tăng cường (hành động + phần thưởng → chiến lược tối ưu)
  • Học có giám sát bao gồm hai tác vụ: phân loại (dự đoán danh mục/nhóm) và hồi quy (dự đoán giá trị số)
  • Học không giám sát bao gồm hai tác vụ: phân cụm (tìm các nhóm dữ liệu) và giảm chiều dữ liệu (đơn giản hóa dữ liệu)
  • Học tăng cường học thông qua quá trình thử và sai trong một môi trường cụ thể - không cần bộ dữ liệu có nhãn
  • Học có giám sát chiếm ưu thế trong các ứng dụng Machine Learning (ML) thực tế tại doanh nghiệp - nếu bạn có dữ liệu lịch sử kèm kết quả đầu ra, hãy bắt đầu với phương pháp này
  • Câu 1:

    Một chiếc xe tự lái học cách di chuyển bằng cách nhận điểm số (phần thưởng) khi giữ đúng làn đường và bị phạt khi chệch hướng. Qua hàng triệu lượt chạy mô phỏng, khả năng của xe dần được cải thiện. Đây là loại hình Machine Learning (ML) nào?

    GIẢI THÍCH:

    Học tăng cường khác với học có giám sát ở chỗ không có bộ dữ liệu chứa "câu trả lời đúng". Chiếc xe không học từ các ví dụ được gán nhãn về cách lái xe chuẩn - nó học thông qua việc thực hành và nhận phản hồi. Mỗi hành động đều dẫn đến những hệ quả nhất định (được thưởng khi giữ đúng làn, bị phạt khi va chạm), và thuật toán sẽ học xem chuỗi hành động nào giúp tối đa hóa tổng phần thưởng. Đây chính là cách AlphaGo học chơi cờ vây giỏi hơn bất kỳ con người nào - không phải bằng cách nghiên cứu các ván đấu, mà bằng cách tự đấu với chính mình qua hàng triệu ván cờ.

  • Câu 2:

    Một nhà bán lẻ trực tuyến có dữ liệu mua hàng của 100.000 khách hàng nhưng không có nhãn hay danh mục phân loại nào. Họ muốn tìm ra các nhóm khách hàng tự nhiên để thực hiện tiếp thị mục tiêu. Đây là loại hình Machine Learning (ML) nào?

    GIẢI THÍCH:

    Không có nhãn dữ liệu nào tồn tại, vì vậy không thể áp dụng học có giám sát. Thay vào đó, các thuật toán phân cụm không giám sát (như K-Means) sẽ phân tích tần suất mua hàng, giá trị đơn hàng trung bình, danh mục sản phẩm và thời điểm mua để phát hiện ra các nhóm khách hàng tự nhiên. Nhà bán lẻ có thể tìm thấy 4-6 nhóm khách hàng riêng biệt mà trước đó họ không hề hay biết - từ đó xây dựng các chiến dịch tiếp thị nhắm mục tiêu cụ thể cho từng nhóm. Điểm mấu chốt ở đây là: Thuật toán tìm ra cấu trúc dữ liệu mà con người có thể không nhận thấy hoặc phải mất hàng tháng mới xác định được nếu làm thủ công.

  • Câu 3:

    Một ngân hàng muốn phát hiện các giao dịch thẻ tín dụng gian lận theo thời gian thực. Họ có dữ liệu giao dịch trong 5 năm đã được gán nhãn là 'hợp lệ' hoặc 'gian lận'. Đây là loại hình Machine Learning (ML) nào?

    GIẢI THÍCH:

    Đây là bài toán phân loại có giám sát điển hình trong sách giáo khoa. Dữ liệu được gán nhãn (hợp lệ/gian lận) đóng vai trò là sự "giám sát" - mô hình học cách nhận diện gian lận từ hàng nghìn ví dụ. Thách thức chính: Các lớp dữ liệu bị mất cân bằng nghiêm trọng (gian lận có thể chỉ chiếm 0,1% tổng số giao dịch), vì vậy chỉ dựa vào độ chính xác (accuracy) sẽ gây hiểu lầm. Ngân hàng quan tâm đến độ nhạy (recall - phát hiện được tất cả các vụ gian lận) hơn là độ chính xác (precision - chấp nhận một số trường hợp báo động giả). Chúng ta sẽ đề cập đến vấn đề này trong Bài 5.

Thứ Năm, 01/10/2026 07:30
5 ★ 1 👨 3
Xác thực tài khoản!

Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:

Số điện thoại chưa đúng định dạng!
Số điện thoại này đã được xác thực!
Bạn có thể dùng Sđt này đăng nhập tại đây!
Lỗi gửi SMS, liên hệ Admin
0 Bình luận
Sắp xếp theo
❖ Machine Learning