Một học viên cao học có hai nhóm, mỗi nhóm 180 người, đo điểm hài lòng trên thang 0–100. Kiểm định Shapiro–Wilk cho p = 0,003 ở một nhóm. Cô chuyển sang Mann–Whitney, rồi viết “trung vị nhóm A cao hơn có ý nghĩa thống kê”. Phản biện hỏi lại hai điều: vì sao bỏ kiểm định t với cỡ mẫu lớn như vậy, và vì sao trung vị hai nhóm bằng nhau mà kết luận lại là trung vị khác nhau.
Kiểm định phi tham số là công cụ tốt, nhưng thường được dùng theo phản xạ, không theo lý do. Hiểu chúng thực sự kiểm tra điều gì giúp bạn chọn đúng và viết kết quả đúng.
Kiểm định phân phối chuẩn thường trả lời sai câu hỏi
Giả định của kiểm định t là phân phối lấy mẫu của trung bình xấp xỉ chuẩn, hoặc sai số của mô hình xấp xỉ chuẩn, không phải từng điểm dữ liệu phải chuẩn. Với cỡ mẫu vừa và lớn, định lý giới hạn trung tâm làm cho giả định này thường được đáp ứng dù dữ liệu gốc lệch.
Nghịch lý của Shapiro–Wilk và Kolmogorov–Smirnov:
- Với mẫu nhỏ, chúng có ít năng lực, nên thường “không phát hiện” lệch chuẩn đúng lúc bạn cần lo nhất.
- Với mẫu lớn, chúng phát hiện cả những lệch rất nhỏ không ảnh hưởng gì đến kiểm định t, đúng lúc bạn ít cần lo nhất.
Vì vậy, thay vì dựa vào giá trị p của kiểm định chuẩn, hãy nhìn dữ liệu: biểu đồ tần suất, biểu đồ Q-Q, và hỏi câu cụ thể hơn. Có giá trị ngoại lai cực đoan không? Có dồn trần hay dồn sàn không? Cỡ mẫu mỗi nhóm bao nhiêu?
Mann–Whitney không phải là “kiểm định trung vị”
Mann–Whitney U (còn gọi là kiểm định tổng hạng Wilcoxon) kiểm tra xem một giá trị chọn ngẫu nhiên từ nhóm A có xu hướng lớn hơn một giá trị chọn ngẫu nhiên từ nhóm B hay không. Nó chỉ trở thành phép so sánh trung vị khi hai phân phối có cùng hình dạng và chỉ lệch vị trí. Khi hình dạng khác nhau, hai nhóm có thể cùng trung vị mà Mann–Whitney vẫn có ý nghĩa, như ví dụ ở đầu bài.
Cách báo cáo an toàn: nêu trung vị và khoảng tứ phân vị của mỗi nhóm để mô tả, rồi viết kết quả kiểm định theo nghĩa “phân phối điểm của nhóm A có xu hướng cao hơn”. Kèm một cỡ hiệu ứng phù hợp, chẳng hạn xác suất ưu thế (probability of superiority) hoặc tương quan hạng biserial.
Bảng đối chiếu các kiểm định phổ biến
| Tình huống | Kiểm định tham số | Tương ứng phi tham số | Cỡ hiệu ứng đi kèm |
|---|---|---|---|
| Hai nhóm độc lập | t độc lập (ưu tiên Welch) | Mann–Whitney U | Tương quan hạng biserial, xác suất ưu thế |
| Hai lần đo trên cùng người | t ghép cặp | Wilcoxon hạng có dấu | Tương quan hạng biserial ghép cặp |
| Ba nhóm độc lập trở lên | ANOVA một yếu tố (hoặc Welch) | Kruskal–Wallis | Epsilon bình phương |
| Ba lần đo trở lên trên cùng người | ANOVA đo lặp | Friedman | Kendall W |
| Tương quan hai biến | Pearson | Spearman, Kendall tau | Chính hệ số tương quan |
Lưu ý: với hai nhóm độc lập, kiểm định t của Welch không cần giả định phương sai bằng nhau và nên là lựa chọn mặc định thay vì t của Student.
Khi nào phi tham số thật sự là lựa chọn tốt
- Dữ liệu thứ bậc thật sự: xếp hạng, thang ít bậc mà khoảng cách giữa các bậc không đều.
- Mẫu rất nhỏ và phân phối lệch rõ, có giá trị ngoại lai không thể loại bỏ vì chúng là dữ liệu thật.
- Kết cục có giá trị cực đoan mà trung bình không mô tả tốt, như thời gian nằm viện, số lần vắng học.
- Câu hỏi nghiên cứu vốn là về thứ hạng hoặc xu hướng lớn hơn, không phải về trung bình.
Những lựa chọn khác ngoài “tham số hay phi tham số”
Khi dữ liệu lệch, bạn còn nhiều cách giữ lại thông tin về độ lớn hiệu ứng:
- Biến đổi dữ liệu, như lấy logarit cho biến lệch phải (thu nhập, thời gian). Nhớ diễn giải kết quả trên thang đã biến đổi, hoặc chuyển ngược cho người đọc.
- Bootstrap khoảng tin cậy cho chênh lệch trung bình hay trung vị, không dựa vào giả định phân phối.
- Phương pháp vững như trung bình cắt tỉa (trimmed mean) và kiểm định Yuen.
- Mô hình phù hợp với kiểu dữ liệu: hồi quy Poisson hoặc nhị thức âm cho dữ liệu đếm, hồi quy thứ bậc cho thang Likert từng câu, mô hình gamma cho biến dương lệch phải.
Điểm yếu lớn của kiểm định phi tham số là chúng khó mở rộng: khó điều chỉnh biến gây nhiễu, khó mô hình hoá tương tác. Khi câu hỏi phức tạp hơn so sánh hai nhóm, một mô hình phù hợp thường tốt hơn.
Áp dụng thực tế: quy trình chọn kiểm định cho hai nhóm
- Vẽ biểu đồ hộp và biểu đồ tần suất cho từng nhóm, không bắt đầu bằng Shapiro–Wilk.
- Xác định kiểu dữ liệu: liên tục, đếm, thứ bậc.
- Nếu liên tục, mỗi nhóm khoảng vài chục quan sát trở lên và không có ngoại lai cực đoan: dùng t của Welch, báo chênh lệch trung bình và khoảng tin cậy.
- Nếu mẫu nhỏ, lệch mạnh hoặc thứ bậc: dùng Mann–Whitney, báo trung vị, khoảng tứ phân vị và cỡ hiệu ứng hạng.
- Nếu cần điều chỉnh thêm biến: chọn mô hình hồi quy phù hợp kiểu dữ liệu.
- Ghi lý do chọn trong phần Phương pháp bằng một câu, không chỉ ghi “do dữ liệu không phân phối chuẩn”.
Việc làm tiếp theo: tìm trong luận văn hoặc bài báo của bạn câu “do dữ liệu không tuân theo phân phối chuẩn nên chúng tôi dùng…”. Mở lại biểu đồ dữ liệu và cỡ mẫu từng nhóm, rồi tự hỏi lựa chọn đó có còn đứng vững không, và cách viết kết quả đã đúng với điều kiểm định thật sự đo chưa.
Câu hỏi thường gặp
Dữ liệu không phân phối chuẩn thì có bắt buộc dùng kiểm định phi tham số không?
Không bắt buộc. Với cỡ mẫu vừa và lớn, kiểm định t thường vẫn đáng tin nhờ định lý giới hạn trung tâm. Hãy xem biểu đồ, cỡ mẫu và giá trị ngoại lai trước khi quyết định.
Mann–Whitney có so sánh trung vị không?
Chỉ khi hai phân phối cùng hình dạng. Nói chung nó kiểm tra xem giá trị của một nhóm có xu hướng lớn hơn nhóm kia không, nên hãy viết kết quả theo nghĩa đó.
Có nên dùng kiểm định Shapiro–Wilk để kiểm tra phân phối chuẩn?
Có thể tham khảo, nhưng đừng dựa hoàn toàn vào nó. Với mẫu nhỏ nó thiếu năng lực, với mẫu lớn nó quá nhạy; biểu đồ Q-Q thường hữu ích hơn.
Kruskal–Wallis có ý nghĩa thì làm gì tiếp?
Làm so sánh sau giữa từng cặp nhóm, chẳng hạn kiểm định Dunn với hiệu chỉnh cho so sánh bội, và báo cỡ hiệu ứng cho từng cặp.
Kiểm định phi tham số có cần cỡ hiệu ứng không?
Có. Hãy báo tương quan hạng biserial, xác suất ưu thế, epsilon bình phương hoặc Kendall W tuỳ kiểm định, không chỉ báo giá trị p.