FESK.COMBàn học toàn cầu của bạn
Gửi thư
Thống kê và dữ liệu

Kiểm định phi tham số: không phải phao cứu sinh mỗi khi dữ liệu “không chuẩn”

Shapiro–Wilk báo p < 0,05 là nhiều người chuyển ngay sang Mann–Whitney. Nhưng kiểm định chuẩn thường hỏi sai câu, và Mann–Whitney không so sánh trung vị như nhiều sách viết.

Kiểm định phi tham số: không phải phao cứu sinh mỗi khi dữ liệu “không chuẩn”

Một học viên cao học có hai nhóm, mỗi nhóm 180 người, đo điểm hài lòng trên thang 0–100. Kiểm định Shapiro–Wilk cho p = 0,003 ở một nhóm. Cô chuyển sang Mann–Whitney, rồi viết “trung vị nhóm A cao hơn có ý nghĩa thống kê”. Phản biện hỏi lại hai điều: vì sao bỏ kiểm định t với cỡ mẫu lớn như vậy, và vì sao trung vị hai nhóm bằng nhau mà kết luận lại là trung vị khác nhau.

Kiểm định phi tham số là công cụ tốt, nhưng thường được dùng theo phản xạ, không theo lý do. Hiểu chúng thực sự kiểm tra điều gì giúp bạn chọn đúng và viết kết quả đúng.

Kiểm định phân phối chuẩn thường trả lời sai câu hỏi

Giả định của kiểm định t là phân phối lấy mẫu của trung bình xấp xỉ chuẩn, hoặc sai số của mô hình xấp xỉ chuẩn, không phải từng điểm dữ liệu phải chuẩn. Với cỡ mẫu vừa và lớn, định lý giới hạn trung tâm làm cho giả định này thường được đáp ứng dù dữ liệu gốc lệch.

Nghịch lý của Shapiro–Wilk và Kolmogorov–Smirnov:

  • Với mẫu nhỏ, chúng có ít năng lực, nên thường “không phát hiện” lệch chuẩn đúng lúc bạn cần lo nhất.
  • Với mẫu lớn, chúng phát hiện cả những lệch rất nhỏ không ảnh hưởng gì đến kiểm định t, đúng lúc bạn ít cần lo nhất.

Vì vậy, thay vì dựa vào giá trị p của kiểm định chuẩn, hãy nhìn dữ liệu: biểu đồ tần suất, biểu đồ Q-Q, và hỏi câu cụ thể hơn. Có giá trị ngoại lai cực đoan không? Có dồn trần hay dồn sàn không? Cỡ mẫu mỗi nhóm bao nhiêu?

Mann–Whitney không phải là “kiểm định trung vị”

Mann–Whitney U (còn gọi là kiểm định tổng hạng Wilcoxon) kiểm tra xem một giá trị chọn ngẫu nhiên từ nhóm A có xu hướng lớn hơn một giá trị chọn ngẫu nhiên từ nhóm B hay không. Nó chỉ trở thành phép so sánh trung vị khi hai phân phối có cùng hình dạng và chỉ lệch vị trí. Khi hình dạng khác nhau, hai nhóm có thể cùng trung vị mà Mann–Whitney vẫn có ý nghĩa, như ví dụ ở đầu bài.

Cách báo cáo an toàn: nêu trung vị và khoảng tứ phân vị của mỗi nhóm để mô tả, rồi viết kết quả kiểm định theo nghĩa “phân phối điểm của nhóm A có xu hướng cao hơn”. Kèm một cỡ hiệu ứng phù hợp, chẳng hạn xác suất ưu thế (probability of superiority) hoặc tương quan hạng biserial.

Bảng đối chiếu các kiểm định phổ biến

Tình huốngKiểm định tham sốTương ứng phi tham sốCỡ hiệu ứng đi kèm
Hai nhóm độc lậpt độc lập (ưu tiên Welch)Mann–Whitney UTương quan hạng biserial, xác suất ưu thế
Hai lần đo trên cùng ngườit ghép cặpWilcoxon hạng có dấuTương quan hạng biserial ghép cặp
Ba nhóm độc lập trở lênANOVA một yếu tố (hoặc Welch)Kruskal–WallisEpsilon bình phương
Ba lần đo trở lên trên cùng ngườiANOVA đo lặpFriedmanKendall W
Tương quan hai biếnPearsonSpearman, Kendall tauChính hệ số tương quan

Lưu ý: với hai nhóm độc lập, kiểm định t của Welch không cần giả định phương sai bằng nhau và nên là lựa chọn mặc định thay vì t của Student.

Khi nào phi tham số thật sự là lựa chọn tốt

  • Dữ liệu thứ bậc thật sự: xếp hạng, thang ít bậc mà khoảng cách giữa các bậc không đều.
  • Mẫu rất nhỏ và phân phối lệch rõ, có giá trị ngoại lai không thể loại bỏ vì chúng là dữ liệu thật.
  • Kết cục có giá trị cực đoan mà trung bình không mô tả tốt, như thời gian nằm viện, số lần vắng học.
  • Câu hỏi nghiên cứu vốn là về thứ hạng hoặc xu hướng lớn hơn, không phải về trung bình.

Những lựa chọn khác ngoài “tham số hay phi tham số”

Khi dữ liệu lệch, bạn còn nhiều cách giữ lại thông tin về độ lớn hiệu ứng:

  1. Biến đổi dữ liệu, như lấy logarit cho biến lệch phải (thu nhập, thời gian). Nhớ diễn giải kết quả trên thang đã biến đổi, hoặc chuyển ngược cho người đọc.
  2. Bootstrap khoảng tin cậy cho chênh lệch trung bình hay trung vị, không dựa vào giả định phân phối.
  3. Phương pháp vững như trung bình cắt tỉa (trimmed mean) và kiểm định Yuen.
  4. Mô hình phù hợp với kiểu dữ liệu: hồi quy Poisson hoặc nhị thức âm cho dữ liệu đếm, hồi quy thứ bậc cho thang Likert từng câu, mô hình gamma cho biến dương lệch phải.

Điểm yếu lớn của kiểm định phi tham số là chúng khó mở rộng: khó điều chỉnh biến gây nhiễu, khó mô hình hoá tương tác. Khi câu hỏi phức tạp hơn so sánh hai nhóm, một mô hình phù hợp thường tốt hơn.

Áp dụng thực tế: quy trình chọn kiểm định cho hai nhóm

  1. Vẽ biểu đồ hộp và biểu đồ tần suất cho từng nhóm, không bắt đầu bằng Shapiro–Wilk.
  2. Xác định kiểu dữ liệu: liên tục, đếm, thứ bậc.
  3. Nếu liên tục, mỗi nhóm khoảng vài chục quan sát trở lên và không có ngoại lai cực đoan: dùng t của Welch, báo chênh lệch trung bình và khoảng tin cậy.
  4. Nếu mẫu nhỏ, lệch mạnh hoặc thứ bậc: dùng Mann–Whitney, báo trung vị, khoảng tứ phân vị và cỡ hiệu ứng hạng.
  5. Nếu cần điều chỉnh thêm biến: chọn mô hình hồi quy phù hợp kiểu dữ liệu.
  6. Ghi lý do chọn trong phần Phương pháp bằng một câu, không chỉ ghi “do dữ liệu không phân phối chuẩn”.

Việc làm tiếp theo: tìm trong luận văn hoặc bài báo của bạn câu “do dữ liệu không tuân theo phân phối chuẩn nên chúng tôi dùng…”. Mở lại biểu đồ dữ liệu và cỡ mẫu từng nhóm, rồi tự hỏi lựa chọn đó có còn đứng vững không, và cách viết kết quả đã đúng với điều kiểm định thật sự đo chưa.

Câu hỏi thường gặp

Dữ liệu không phân phối chuẩn thì có bắt buộc dùng kiểm định phi tham số không?

Không bắt buộc. Với cỡ mẫu vừa và lớn, kiểm định t thường vẫn đáng tin nhờ định lý giới hạn trung tâm. Hãy xem biểu đồ, cỡ mẫu và giá trị ngoại lai trước khi quyết định.

Mann–Whitney có so sánh trung vị không?

Chỉ khi hai phân phối cùng hình dạng. Nói chung nó kiểm tra xem giá trị của một nhóm có xu hướng lớn hơn nhóm kia không, nên hãy viết kết quả theo nghĩa đó.

Có nên dùng kiểm định Shapiro–Wilk để kiểm tra phân phối chuẩn?

Có thể tham khảo, nhưng đừng dựa hoàn toàn vào nó. Với mẫu nhỏ nó thiếu năng lực, với mẫu lớn nó quá nhạy; biểu đồ Q-Q thường hữu ích hơn.

Kruskal–Wallis có ý nghĩa thì làm gì tiếp?

Làm so sánh sau giữa từng cặp nhóm, chẳng hạn kiểm định Dunn với hiệu chỉnh cho so sánh bội, và báo cỡ hiệu ứng cho từng cặp.

Kiểm định phi tham số có cần cỡ hiệu ứng không?

Có. Hãy báo tương quan hạng biserial, xác suất ưu thế, epsilon bình phương hoặc Kendall W tuỳ kiểm định, không chỉ báo giá trị p.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

🧭
Bạn đang ở chặng nào của đường học vị?
Nhập chỗ bạn đang đứng và đích bạn nhắm — công cụ trả về số năm, chi phí và việc phải làm từng chặng.
Xem lộ trình của tôi →
Miễn phí, không cần tài khoản. Xem tất cả công cụ

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.

hoặc
info@fesk.com