Skip to Main Content
Lesson 011 • Beginner • 7 phút

Supervised, Unsupervised và Reinforcement Learning

Bài học giúp bạn hiểu ba hướng học quan trọng trong Machine Learning: học có giám sát, học không giám sát và học tăng cường, cùng ví dụ thực tế để biết mỗi cách học phù hợp với loại bài toán nào.

Minh họa Supervised, Unsupervised và Reinforcement Learning

Mục tiêu bài học

Sau bài này, bạn sẽ hiểu ba cách học phổ biến trong Machine Learning: học có giám sát, học không giám sát và học tăng cường. Bạn cũng sẽ biết mỗi cách học phù hợp với loại bài toán nào trong thực tế.

Bức tranh tổng quan

Machine Learning là cách giúp máy tính học từ dữ liệu. Nhưng không phải mô hình nào cũng học theo cùng một cách. Tùy vào dữ liệu có nhãn hay không, và tùy vào mục tiêu của bài toán, ta có thể chia Machine Learning thành nhiều hướng khác nhau.

Ba hướng học quan trọng nhất bạn nên nắm trước là: Supervised Learning, Unsupervised LearningReinforcement Learning.

Ba cách học chính trong Machine Learning

01 Supervised Learning

Mô hình học từ dữ liệu có nhãn, tức là dữ liệu đầu vào đã đi kèm đáp án đúng.

02 Unsupervised Learning

Mô hình học từ dữ liệu không có nhãn và tự tìm ra mẫu, nhóm hoặc cấu trúc ẩn trong dữ liệu.

03 Reinforcement Learning

Mô hình học bằng cách thử hành động, nhận phần thưởng hoặc hình phạt, rồi dần tối ưu chiến lược để đạt kết quả tốt hơn.

04 Chọn cách học theo bài toán

Nếu có đáp án đúng, thường dùng học có giám sát. Nếu muốn khám phá mẫu ẩn, dùng học không giám sát. Nếu cần học qua hành động và phản hồi, dùng học tăng cường.

05 Ứng dụng thực tế

Ba cách học này xuất hiện trong phân loại email, gợi ý khách hàng, phát hiện nhóm hành vi, robot, game AI và nhiều hệ thống thông minh khác.

Supervised Learning là gì?

Supervised Learning, hay học có giám sát, là cách học mà mô hình được huấn luyện bằng dữ liệu đã có đáp án đúng. Nói đơn giản, mô hình được học từ các ví dụ đã được gắn nhãn.

Ví dụ, nếu bạn muốn huấn luyện mô hình nhận diện ảnh chó và mèo, bạn cần cung cấp nhiều ảnh đã được gắn nhãn sẵn: ảnh này là chó, ảnh kia là mèo. Mô hình học từ những ví dụ đó, rồi dự đoán nhãn cho ảnh mới.

Ví dụ về Supervised Learning

  • Phân loại email là spam hoặc không spam.
  • Dự đoán giá nhà dựa trên dữ liệu giao dịch trước đây.
  • Nhận diện ảnh là chó, mèo, xe hơi hoặc cây cối.
  • Phân loại bình luận là tích cực, tiêu cực hoặc trung lập.
  • Dự đoán khách hàng có khả năng rời bỏ dịch vụ hay không.

Ghi nhớ nhanh

Supervised Learning giống như học với bài tập có đáp án. Mô hình nhìn vào ví dụ đã biết kết quả đúng, sau đó học cách dự đoán cho dữ liệu mới.

Unsupervised Learning là gì?

Unsupervised Learning, hay học không giám sát, là cách học mà mô hình được cung cấp dữ liệu không có nhãn. Không có đáp án đúng được đưa sẵn. Mô hình phải tự tìm ra mẫu, nhóm hoặc cấu trúc ẩn trong dữ liệu.

Ví dụ, bạn có dữ liệu hành vi của hàng nghìn khách hàng nhưng chưa biết họ thuộc nhóm nào. Mô hình có thể tự tìm ra các nhóm khách hàng có hành vi tương tự nhau, như nhóm thường mua sản phẩm giá rẻ, nhóm mua sản phẩm cao cấp, hoặc nhóm chỉ xem sản phẩm nhưng ít mua.

Ví dụ về Unsupervised Learning

  • Phân nhóm khách hàng theo hành vi mua hàng.
  • Phát hiện các mẫu bất thường trong dữ liệu.
  • Nhóm tài liệu có nội dung giống nhau.
  • Khám phá chủ đề trong một tập văn bản lớn.
  • Giảm chiều dữ liệu để dễ trực quan hóa hoặc phân tích.

Ví dụ thực tế: phân nhóm khách hàng

  • Một cửa hàng có dữ liệu lịch sử mua hàng của khách.
  • Dữ liệu chưa có nhãn như “khách VIP”, “khách mới” hay “khách dễ rời bỏ”.
  • Mô hình tự tìm các nhóm khách hàng có hành vi giống nhau.
  • Doanh nghiệp dùng kết quả đó để thiết kế chiến dịch marketing phù hợp hơn.

Reinforcement Learning là gì?

Reinforcement Learning, hay học tăng cường, là cách học dựa trên hành động và phản hồi. Mô hình, thường gọi là agent, tương tác với một môi trường. Nó thử các hành động khác nhau, nhận phần thưởng nếu làm tốt và bị phạt nếu làm sai.

Qua nhiều lần thử, agent học được chiến lược nào giúp nó nhận được phần thưởng cao hơn. Cách học này thường được dùng trong game, robot, xe tự lái, tối ưu chiến lược và các bài toán ra quyết định liên tục.

Ví dụ về Reinforcement Learning

  • AI học cách chơi game bằng cách thử nhiều chiến lược khác nhau.
  • Robot học cách di chuyển trong môi trường thật hoặc mô phỏng.
  • Xe tự lái học cách ra quyết định trong một số môi trường mô phỏng.
  • Hệ thống tối ưu quảng cáo học cách chọn nội dung để đạt hiệu quả tốt hơn.
  • AI học cách điều khiển tài nguyên trong hệ thống phức tạp.

Flow học tăng cường

01 Agent quan sát môi trường

Agent nhận thông tin về trạng thái hiện tại, ví dụ vị trí trong game hoặc trạng thái robot.

02 Agent chọn hành động

Agent quyết định làm gì tiếp theo, ví dụ đi trái, đi phải, nhảy, dừng hoặc tăng tốc.

03 Môi trường phản hồi

Sau hành động, môi trường thay đổi và trả về phần thưởng hoặc hình phạt.

04 Agent học từ kết quả

Agent ghi nhớ hành động nào có lợi và hành động nào gây kết quả xấu.

05 Chiến lược được cải thiện

Sau nhiều lần thử, agent dần chọn hành động tốt hơn để đạt mục tiêu.

So sánh nhanh ba cách học

  • Supervised Learning: dùng khi dữ liệu có nhãn và có đáp án đúng để mô hình học theo.
  • Unsupervised Learning: dùng khi dữ liệu chưa có nhãn và ta muốn mô hình tự tìm mẫu hoặc nhóm.
  • Reinforcement Learning: dùng khi hệ thống cần học bằng cách thử hành động và nhận phản hồi từ môi trường.

Chọn cách học nào cho đúng?

Không có cách học nào luôn tốt nhất cho mọi bài toán. Điều quan trọng là bạn phải hiểu bài toán của mình đang có loại dữ liệu nào và kết quả mong muốn là gì.

Nếu bạn có dữ liệu lịch sử kèm kết quả đúng, như email đã được gắn nhãn spam hoặc không spam, Supervised Learning thường là lựa chọn phù hợp. Nếu bạn có nhiều dữ liệu nhưng chưa biết nên chia nhóm thế nào, Unsupervised Learning có thể giúp khám phá cấu trúc bên trong. Nếu bài toán liên quan đến hành động liên tục và phản hồi, Reinforcement Learning có thể là hướng phù hợp hơn.

Ví dụ dễ nhớ

  • Học có giám sát: giáo viên đưa bài tập kèm đáp án mẫu.
  • Học không giám sát: bạn tự quan sát nhiều ví dụ rồi tự tìm điểm giống và khác nhau.
  • Học tăng cường: bạn chơi một trò chơi, thử nhiều cách và học từ điểm thưởng hoặc lỗi sai.

Key concepts

  • Supervised Learning: học có giám sát, học từ dữ liệu có nhãn.
  • Unsupervised Learning: học không giám sát, học từ dữ liệu không có nhãn.
  • Reinforcement Learning: học tăng cường, học từ hành động và phần thưởng.
  • Label: nhãn hoặc đáp án đúng đi kèm dữ liệu.
  • Agent: thực thể ra quyết định trong học tăng cường.
  • Environment: môi trường mà agent tương tác.
  • Reward: phần thưởng giúp agent biết hành động nào tốt hơn.

AI Engineer cần hiểu gì?

Với vai trò AI Engineer, bạn cần biết bài toán của mình thuộc loại nào trước khi chọn hướng giải quyết. Không phải cứ có AI là dùng cùng một kỹ thuật. Mỗi kỹ thuật phù hợp với một loại dữ liệu và mục tiêu khác nhau.

Khi nhận một yêu cầu xây ứng dụng AI, hãy hỏi: dữ liệu có nhãn không, có đáp án đúng không, mục tiêu là dự đoán, phân nhóm hay tối ưu hành động, và kết quả có cần kiểm soát chặt chẽ không.

Điểm cần nhớ

  • Machine Learning có nhiều cách học khác nhau.
  • Supervised Learning học từ dữ liệu có nhãn.
  • Unsupervised Learning học từ dữ liệu không có nhãn.
  • Reinforcement Learning học từ hành động, phần thưởng và hình phạt.
  • Chọn cách học phụ thuộc vào dữ liệu, mục tiêu và bối cảnh bài toán.
  • AI Engineer cần hiểu bài toán trước khi chọn mô hình hoặc kỹ thuật.

Kết luận

Supervised Learning, Unsupervised Learning và Reinforcement Learning là ba hướng học quan trọng trong Machine Learning. Hiểu ba hướng này giúp bạn biết cách nhìn bài toán AI rõ hơn, chọn đúng cách tiếp cận hơn và xây dựng sản phẩm AI thực tế hơn.