Skip to Main Content
Lesson 007 • Beginner • 6 phút

Chúng ta thu thập dữ liệu như thế nào?

Bài học giúp bạn hiểu cách dữ liệu được thu thập từ thế giới thực, cách thông tin như hình ảnh, âm thanh, văn bản, cảm biến, website và API được chuyển thành dữ liệu để máy tính và mô hình AI có thể học.

Minh họa cách chúng ta thu thập dữ liệu cho AI

Mục tiêu bài học

Sau bài này, bạn sẽ hiểu dữ liệu được thu thập như thế nào, vì sao máy tính cần chuyển thông tin từ thế giới thực thành dữ liệu số, và vì sao chất lượng dữ liệu đầu vào ảnh hưởng trực tiếp đến chất lượng của mô hình AI.

Bức tranh tổng quan

Con người có thể quan sát thế giới bằng mắt, tai, xúc giác, vị giác và nhiều trải nghiệm khác. Bộ não của chúng ta xử lý rất nhiều tín hiệu cùng lúc để hiểu môi trường xung quanh.

Máy tính thì không hiểu thế giới theo cách tự nhiên như con người. Để máy tính học được, chúng ta cần thu thập thông tin từ thế giới thực, chuyển chúng thành dữ liệu số, sau đó dùng dữ liệu này để huấn luyện hoặc cải thiện mô hình AI.

Flow thu thập dữ liệu cho AI

01 Quan sát thế giới thực

Dữ liệu bắt đầu từ những sự kiện, hình ảnh, âm thanh, văn bản, hành vi người dùng hoặc tín hiệu từ môi trường xung quanh.

02 Thu thập bằng công cụ

Hệ thống có thể thu thập dữ liệu bằng cảm biến, camera, microphone, website, ứng dụng, API, form nhập liệu hoặc log hệ thống.

03 Chuyển thành dữ liệu số

Hình ảnh, âm thanh, văn bản và video đều được chuyển thành dữ liệu mà máy tính có thể lưu trữ, xử lý và phân tích.

04 Làm sạch và tổ chức dữ liệu

Dữ liệu thô thường cần được làm sạch, loại bỏ lỗi, chuẩn hóa định dạng và sắp xếp lại trước khi dùng cho AI.

05 Dùng để huấn luyện hoặc cải thiện AI

Mô hình AI sử dụng dữ liệu để tìm mẫu, học quy luật, nhận dạng đối tượng, dự đoán kết quả hoặc tạo nội dung mới.

Máy tính nhìn dữ liệu như thế nào?

Với con người, một bức ảnh có thể là hình một con mèo, một người đang cười hoặc một chữ số viết tay. Nhưng với máy tính, bức ảnh đó là tập hợp rất nhiều con số.

Ví dụ, trong một ảnh đen trắng, mỗi điểm ảnh có thể có giá trị từ 0 đến 255. Giá trị này mô tả độ sáng tối của pixel. Khi tập hợp nhiều pixel lại, máy tính có thể biểu diễn toàn bộ bức ảnh bằng một ma trận số.

Đây là lý do dữ liệu hình ảnh, âm thanh, video và văn bản đều cần được chuyển thành dạng số trước khi máy tính có thể xử lý.

Ví dụ: dữ liệu chữ số viết tay

Một ví dụ kinh điển trong học máy là bài toán nhận diện chữ số viết tay. Mục tiêu là huấn luyện máy tính nhận ra một ảnh đang chứa số 0, 1, 2, 3, 4, 5, 6, 7, 8 hay 9.

Với con người, việc nhận ra số 3 có vẻ rất dễ. Nhưng mỗi người viết số 3 hơi khác nhau. Máy tính cần nhìn vào các giá trị pixel, học ra các mẫu chung, rồi dự đoán ảnh đó thuộc về chữ số nào.

Ghi nhớ nhanh

Máy tính không nhìn thế giới giống con người. Nó cần dữ liệu được biểu diễn dưới dạng số để có thể lưu trữ, xử lý, so sánh và học ra các mẫu.

Nguồn dữ liệu đến từ đâu?

Trong thực tế, dữ liệu có thể đến từ rất nhiều nguồn khác nhau. Một hệ thống AI càng thực tế thì nguồn dữ liệu càng đa dạng.

  • Cảm biến: nhiệt độ, vị trí, tốc độ, độ ẩm, chuyển động.
  • Camera: hình ảnh, video, ảnh vệ tinh, ảnh sản phẩm.
  • Microphone: giọng nói, âm thanh, cuộc gọi, ghi âm.
  • Văn bản: tài liệu, email, chat, bài viết, bình luận, review.
  • Website: hành vi người dùng, lượt click, lịch sử tìm kiếm, form đăng ký.
  • API: dữ liệu từ hệ thống khác như thanh toán, vận chuyển, CRM, ERP.
  • Log hệ thống: lỗi, hoạt động người dùng, trạng thái server, request API.

Web scraping, API và dữ liệu lớn

Một số dữ liệu được thu thập trực tiếp từ người dùng, ví dụ như form đăng ký, lịch sử mua hàng hoặc nội dung người dùng nhập vào ứng dụng.

Một số dữ liệu khác có thể được thu thập thông qua API. API cho phép một hệ thống lấy dữ liệu từ hệ thống khác theo cách có kiểm soát. Ví dụ, một ứng dụng có thể gọi API thời tiết, API bản đồ, API thanh toán hoặc API mạng xã hội.

Ngoài ra, nhiều tổ chức còn phân tích dữ liệu lớn từ website, ứng dụng, cảm biến, giao dịch và hệ thống nội bộ để tìm ra mẫu hành vi và cải thiện sản phẩm.

Ví dụ thực tế

  • Một ứng dụng thương mại điện tử thu thập dữ liệu đơn hàng, lượt xem sản phẩm, lịch sử tìm kiếm và đánh giá của khách hàng.
  • Một chatbot nội bộ có thể dùng dữ liệu từ tài liệu công ty, email hướng dẫn, chính sách nhân sự và cơ sở dữ liệu câu hỏi thường gặp.
  • Một hệ thống nhận diện hình ảnh cần thu thập nhiều ảnh mẫu để học cách phân biệt đối tượng.
  • Một ứng dụng phân tích giọng nói cần dữ liệu âm thanh để học cách nhận diện lời nói.

Vì sao chất lượng dữ liệu quan trọng?

Trong khoa học dữ liệu và AI có một câu rất nổi tiếng: nếu dữ liệu đầu vào kém chất lượng, kết quả đầu ra cũng sẽ kém chất lượng.

Một mô hình AI không thể học tốt nếu dữ liệu bị thiếu, sai, nhiễu, thiên lệch hoặc không đại diện cho vấn đề thực tế. Vì vậy, việc thu thập dữ liệu không chỉ là lấy càng nhiều càng tốt, mà còn phải đảm bảo dữ liệu phù hợp, rõ ràng và có chất lượng.

Key concepts

  • Data Collection: quá trình thu thập dữ liệu từ thế giới thực hoặc hệ thống số.
  • Sensor Data: dữ liệu từ cảm biến như nhiệt độ, vị trí, chuyển động.
  • Pixel: điểm ảnh, đơn vị nhỏ nhất trong hình ảnh số.
  • Binary: cách máy tính lưu trữ thông tin bằng 0 và 1.
  • API: cách các hệ thống trao đổi dữ liệu với nhau.
  • Data Quality: mức độ chính xác, đầy đủ và phù hợp của dữ liệu.
  • Garbage In, Garbage Out: dữ liệu đầu vào kém sẽ tạo ra kết quả đầu ra kém.

AI Engineer cần hiểu gì?

Khi xây ứng dụng AI, bạn không nên chỉ tập trung vào model. Bạn cần hiểu dữ liệu đến từ đâu, được thu thập bằng cách nào, có đáng tin cậy không và có phù hợp với bài toán hay không.

Một AI Engineer giỏi cần biết cách đặt câu hỏi về dữ liệu: dữ liệu này có đại diện cho người dùng thật không, có bị thiếu không, có bị sai lệch không, có cần làm sạch không và có thể dùng an toàn không.

Điểm cần nhớ

  • Dữ liệu là nguyên liệu để AI học và tạo ra kết quả.
  • Máy tính cần chuyển thông tin thành dạng số để xử lý.
  • Hình ảnh, âm thanh, văn bản và video đều có thể được biểu diễn thành dữ liệu số.
  • Dữ liệu có thể đến từ cảm biến, camera, microphone, website, API, log và người dùng.
  • Dữ liệu thô thường cần được làm sạch và chuẩn hóa trước khi dùng cho AI.
  • Chất lượng dữ liệu ảnh hưởng trực tiếp đến chất lượng mô hình AI.

Kết luận

Thu thập dữ liệu là một bước nền tảng trong quá trình xây dựng AI. AI không tự nhiên hiểu thế giới, mà cần dữ liệu để học ra mẫu và thực hiện nhiệm vụ. Vì vậy, trước khi nghĩ đến model phức tạp, bạn cần hiểu dữ liệu đến từ đâu, được biểu diễn như thế nào và có đủ chất lượng để dùng cho bài toán thực tế hay không.