FESK.COMBàn học toàn cầu của bạn
Gửi thư
Thống kê và dữ liệu

Xử lý dữ liệu thiếu: vì sao xoá dòng và điền trung bình đều có thể làm sai kết luận

Bảng hỏi 600 người, sau khi phần mềm tự loại mọi dòng có ô trống chỉ còn 410. Ba cơ chế dữ liệu thiếu, cái giá của xoá dòng và điền trung bình, điền khuyết bội và cách báo cáo để phản biện tin được.

Xử lý dữ liệu thiếu: vì sao xoá dòng và điền trung bình đều có thể làm sai kết luận

Một khảo sát 600 sinh viên về áp lực học tập. Khi chạy hồi quy, phần mềm báo N = 410. Gần một phần ba mẫu biến mất vì mỗi người thiếu ít nhất một câu, thường là câu về thu nhập gia đình hoặc điểm trung bình. Tệ hơn, những người bỏ trống câu điểm trung bình lại chính là nhóm có điểm thấp. Kết quả trên 410 người còn lại mô tả một nhóm sinh viên “đẹp” hơn thực tế.

Dữ liệu thiếu có mặt trong gần như mọi nghiên cứu thực nghiệm. Vấn đề không phải là có thiếu hay không, mà là thiếu vì sao, và cách xử lý của bạn có phù hợp với lý do đó không.

Ba cơ chế dữ liệu thiếu

Cơ chếÝ nghĩaVí dụ
MCAR (thiếu hoàn toàn ngẫu nhiên)Việc thiếu không liên quan tới bất kỳ biến nào, quan sát được hay khôngMột số phiếu bị ướt mất trang do mưa
MAR (thiếu ngẫu nhiên có điều kiện)Việc thiếu liên quan tới các biến đã quan sát, không liên quan tới giá trị bị thiếu khi đã tính các biến đóSinh viên năm cuối hay bỏ câu thu nhập hơn, và năm học có trong dữ liệu
MNAR (thiếu không ngẫu nhiên)Việc thiếu phụ thuộc vào chính giá trị bị thiếu, kể cả sau khi tính các biến quan sátSinh viên điểm thấp không muốn khai điểm

Điểm khó: dữ liệu không thể chứng minh là MAR hay MNAR, vì bạn không nhìn thấy giá trị bị thiếu. MCAR có thể bị bác bỏ một phần (người thiếu khác người không thiếu ở các biến đã quan sát), nhưng không bao giờ được chứng minh chắc chắn. Kiểm định MCAR của Little thường được báo cáo, nhưng kết quả không có ý nghĩa không chứng minh dữ liệu là MCAR.

Cái giá của xoá dòng

Hầu hết phần mềm mặc định loại mọi quan sát thiếu bất kỳ biến nào trong mô hình (listwise deletion, phân tích ca đầy đủ). Hai hậu quả:

  • Mất độ mạnh: từ 600 còn 410 là mất gần một phần ba thông tin, kể cả những câu trả lời đầy đủ khác của 190 người.
  • Thiên lệch nếu dữ liệu không phải MCAR: nhóm còn lại không đại diện cho nhóm ban đầu, như ví dụ mở đầu.

Xoá dòng vẫn chấp nhận được khi tỷ lệ thiếu rất nhỏ và có lý do tin là gần MCAR, hoặc trong một số tình huống đặc biệt khi việc thiếu chỉ phụ thuộc biến độc lập. Nhưng nó không nên là lựa chọn mặc định không suy nghĩ.

Vì sao điền trung bình là ý tưởng tồi

Điền mọi ô trống bằng trung bình của biến nghe có vẻ trung lập. Thực ra nó:

  • Thu hẹp phương sai giả tạo: hàng trăm người có đúng cùng một giá trị.
  • Làm yếu tương quan giữa biến đó và các biến khác.
  • Làm sai số chuẩn nhỏ đi, khiến kết quả có vẻ chính xác hơn thực tế.

Mang giá trị lần đo trước ra điền (last observation carried forward) trong nghiên cứu theo dõi cũng có vấn đề tương tự: nó giả định người bỏ cuộc giữ nguyên trạng thái, điều hiếm khi đúng.

Điền khuyết bội và ước lượng hợp lý cực đại đầy đủ

Hai phương pháp được khuyến nghị rộng rãi khi dữ liệu có thể là MAR:

Điền khuyết bội (multiple imputation): tạo ra nhiều bộ dữ liệu hoàn chỉnh, mỗi bộ điền các giá trị thiếu bằng dự đoán từ các biến khác cộng thêm yếu tố ngẫu nhiên phản ánh độ không chắc chắn. Chạy phân tích trên từng bộ, rồi gộp kết quả theo quy tắc Rubin. Những điểm người làm hay sai:

  • Mô hình điền khuyết phải chứa mọi biến trong mô hình phân tích, kể cả biến phụ thuộc. Nghe ngược đời nhưng đây là yêu cầu; bỏ biến phụ thuộc ra làm các liên hệ bị kéo về 0.
  • Thêm biến phụ trợ: biến không có trong mô hình phân tích nhưng dự đoán được giá trị thiếu hoặc khả năng thiếu. Chúng làm giả định MAR hợp lý hơn.
  • Số bộ điền khuyết: một quy tắc kinh nghiệm phổ biến là ít nhất bằng phần trăm quan sát có thiếu; ví dụ 30% thiếu thì khoảng 30 bộ. Vài bộ như khuyến nghị cũ thường không đủ.
  • Kiểm tra giá trị điền có hợp lý: không có tuổi âm, phân phối không quá khác dữ liệu quan sát.

Ước lượng hợp lý cực đại đầy đủ (FIML): dùng mọi thông tin có sẵn của từng người trực tiếp trong ước lượng, không tạo bộ dữ liệu mới. Phổ biến trong mô hình phương trình cấu trúc và mô hình hỗn hợp.

Khi nghi ngờ MNAR: phân tích độ nhạy

Không phương pháp chuẩn nào xử lý triệt để MNAR. Cách trung thực là phân tích độ nhạy: giả sử người thiếu điểm có điểm thấp hơn người cùng đặc điểm 0,5 rồi 1 điểm, và xem kết luận có đổi không. Nếu kết luận vững dưới các giả định hợp lý, bạn có thể tự tin hơn; nếu không, hãy nói rõ trong phần hạn chế.

Công cụ

  • R: gói mice là lựa chọn phổ biến nhất cho điền khuyết bội; lavaan hỗ trợ FIML.
  • Python: statsmodels có công cụ điền khuyết bội; các công cụ điền khuyết trong thư viện học máy thường tạo một bộ dữ liệu duy nhất, phù hợp cho dự đoán hơn là suy luận thống kê.
  • SPSS: có mô-đun điền khuyết bội và gộp kết quả tự động cho nhiều phân tích.
  • Stata: bộ lệnh mi.

Áp dụng: quy trình và cách báo cáo

  1. Mô tả: tỷ lệ thiếu từng biến, số người có dữ liệu đầy đủ, mẫu hình thiếu (thiếu rải rác hay theo khối).
  2. So sánh người có và không có dữ liệu thiếu ở các biến quan sát được, để đánh giá MCAR có hợp lý không.
  3. Chọn phương pháp chính dựa trên lập luận về cơ chế thiếu, không dựa trên kết quả nào đẹp hơn.
  4. Thực hiện điền khuyết bội hoặc FIML với biến phụ trợ phù hợp.
  5. Phân tích độ nhạy: so với phân tích ca đầy đủ và thử giả định MNAR.
  6. Báo cáo: phương pháp, phần mềm, số bộ điền khuyết, các biến trong mô hình điền khuyết, và kết quả phân tích độ nhạy.

Câu mẫu: “Có 32% người tham gia thiếu ít nhất một biến. Người thiếu dữ liệu có tỷ lệ là sinh viên năm cuối cao hơn. Chúng tôi dùng điền khuyết bội bằng phương trình chuỗi (gói mice, 40 bộ), mô hình điền khuyết gồm mọi biến phân tích, biến phụ thuộc và ba biến phụ trợ. Kết quả phân tích ca đầy đủ tương tự và được trình bày ở Bảng S3.”

Việc làm ngay: trước lần phân tích tiếp theo, chạy một bảng mô tả tỷ lệ thiếu cho mọi biến và so sánh N trong từng mô hình với tổng mẫu. Nếu chênh lệch vượt vài phần trăm, bạn cần một phương án xử lý có lập luận, thay vì để phần mềm lặng lẽ quyết định.

Câu hỏi thường gặp

MCAR, MAR và MNAR khác nhau thế nào?

MCAR là thiếu hoàn toàn ngẫu nhiên; MAR là thiếu liên quan tới các biến đã quan sát; MNAR là thiếu phụ thuộc vào chính giá trị bị thiếu. Cơ chế quyết định phương pháp xử lý phù hợp.

Có nên điền giá trị thiếu bằng trung bình không?

Không nên cho phân tích suy luận. Điền trung bình thu hẹp phương sai, làm yếu tương quan và làm sai số chuẩn nhỏ giả tạo.

Điền khuyết bội cần bao nhiêu bộ dữ liệu?

Quy tắc kinh nghiệm phổ biến là số bộ ít nhất bằng phần trăm quan sát có thiếu, ví dụ 30% thiếu thì khoảng 30 bộ. Vài bộ thường không đủ để kết quả ổn định.

Có đưa biến phụ thuộc vào mô hình điền khuyết không?

Có. Mô hình điền khuyết phải chứa mọi biến trong mô hình phân tích, kể cả biến phụ thuộc, nếu không các liên hệ ước lượng sẽ bị kéo về 0.

Tỷ lệ thiếu bao nhiêu thì phải xử lý?

Không có ngưỡng an toàn tuyệt đối. Điều quan trọng là cơ chế thiếu; ngay cả tỷ lệ thiếu nhỏ cũng gây thiên lệch nếu việc thiếu liên quan mạnh tới giá trị bị thiếu.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

🧭
Bạn đang ở chặng nào của đường học vị?
Nhập chỗ bạn đang đứng và đích bạn nhắm — công cụ trả về số năm, chi phí và việc phải làm từng chặng.
Xem lộ trình của tôi →
Miễn phí, không cần tài khoản. Xem tất cả công cụ

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.

hoặc
info@fesk.com