Một nhóm giáo viên đo điểm của 40 học sinh trước và sau một học kỳ áp dụng phương pháp mới, rồi so sánh hai cột điểm bằng t-test độc lập. Kết quả p = 0,12, “không có ý nghĩa”. Khi phân tích lại bằng t-test ghép cặp, đúng với thiết kế vì cùng một học sinh được đo hai lần, p nhỏ hơn 0,01. Cùng một dữ liệu, chỉ khác phép thử, kết luận đảo ngược.
Chọn kiểm định không phải là tra một bảng cho xong. Nó bắt đầu từ thiết kế nghiên cứu: đo cái gì, trên ai, bao nhiêu lần. Trả lời đúng năm câu hỏi dưới đây, phép thử gần như tự lộ ra.
Câu 1: biến kết quả thuộc loại nào?
- Liên tục: điểm số, huyết áp, thời gian, thu nhập.
- Nhị phân: đỗ hay trượt, có bệnh hay không.
- Phân loại nhiều mức: nhóm ngành, loại trường.
- Thứ bậc: mức độ hài lòng 1 đến 5, giai đoạn bệnh.
- Đếm hoặc thời gian đến sự kiện: cần các mô hình riêng (Poisson, hồi quy Cox), nằm ngoài bảng tra cơ bản.
Câu 2: so sánh bao nhiêu nhóm?
Hai nhóm hay từ ba nhóm trở lên. Với từ ba nhóm, đừng chạy nhiều t-test giữa từng cặp: với ba nhóm là ba phép so sánh, với năm nhóm là mười phép so sánh, và xác suất có ít nhất một kết quả “có ý nghĩa” do ngẫu nhiên tăng nhanh. Dùng ANOVA hoặc phép thử tương ứng rồi mới so sánh sau (post hoc) có hiệu chỉnh.
Câu 3: các quan sát độc lập hay ghép cặp?
Đây là câu hỏi quan trọng nhất và bị bỏ qua nhiều nhất. Dữ liệu là ghép cặp (paired) khi:
- Cùng một người được đo nhiều lần (trước và sau, nhiều thời điểm).
- Hai người được ghép theo thiết kế (cặp song sinh, ca bệnh và ca chứng được ghép theo tuổi và giới).
- Hai phần của cùng một đơn vị (mắt trái và mắt phải, hai bên hàm).
Học sinh trong cùng lớp, bệnh nhân trong cùng bệnh viện cũng không hoàn toàn độc lập. Khi có cấu trúc cụm như vậy, cần mô hình đa cấp hoặc sai số chuẩn hiệu chỉnh theo cụm, không chỉ là một phép thử đơn giản.
Câu 4: giả định về phân phối có hợp lý không?
Các phép thử tham số như t-test giả định trung bình có phân phối xấp xỉ chuẩn. Hai điều người mới hay hiểu sai:
- Giả định là về phân phối của trung bình (hoặc phần dư), không phải dữ liệu thô phải chuẩn hoàn hảo. Với cỡ mẫu mỗi nhóm vài chục trở lên, t-test khá vững với phân phối lệch vừa phải.
- Kiểm định chuẩn (Shapiro-Wilk) không phải trọng tài tốt: với mẫu lớn, nó báo “không chuẩn” vì những lệch rất nhỏ không đáng kể; với mẫu nhỏ, nó không đủ mạnh để phát hiện lệch lớn. Hãy nhìn histogram và biểu đồ Q-Q.
Khi dữ liệu lệch nặng, mẫu nhỏ, hoặc là thứ bậc, dùng phép thử phi tham số. Chú ý: Mann-Whitney không so sánh trung vị theo nghĩa hẹp mà so sánh xu hướng một nhóm có giá trị lớn hơn nhóm kia; khi báo cáo, mô tả đúng điều đó.
Câu 5: bạn muốn biết điều gì?
So sánh khác biệt giữa các nhóm, hay đo mức độ liên hệ giữa hai biến, hay dự đoán? Hai biến liên tục trên cùng người thì dùng tương quan (Pearson cho quan hệ tuyến tính, Spearman cho quan hệ đơn điệu hoặc dữ liệu thứ bậc). Muốn kiểm soát biến gây nhiễu thì cần hồi quy, không phải một phép thử hai biến.
Bảng tra nhanh
| Biến kết quả | Thiết kế | Tham số | Phi tham số / thay thế |
|---|---|---|---|
| Liên tục | 2 nhóm độc lập | t-test Welch | Mann-Whitney U |
| Liên tục | 2 phép đo ghép cặp | t-test ghép cặp | Wilcoxon dấu hạng |
| Liên tục | ≥3 nhóm độc lập | ANOVA một yếu tố (Welch nếu phương sai khác) | Kruskal-Wallis |
| Liên tục | ≥3 phép đo trên cùng người | ANOVA đo lặp hoặc mô hình hỗn hợp | Friedman |
| Nhị phân / phân loại | Nhóm độc lập | Chi bình phương | Fisher chính xác khi tần số kỳ vọng nhỏ |
| Nhị phân | Ghép cặp | McNemar | McNemar chính xác |
| Hai biến liên tục | Liên hệ | Tương quan Pearson | Tương quan Spearman |
Vì sao bảng ghi “t-test Welch” thay vì t-test Student? Welch không giả định hai nhóm có phương sai bằng nhau, và khi phương sai thật sự bằng nhau thì nó cho kết quả gần như y hệt. Nhiều nhà thống kê khuyên dùng Welch làm mặc định; R đã dùng Welch là mặc định trong hàm t.test.
Với chi bình phương, quy tắc hay dùng là chuyển sang Fisher khi hơn 20% số ô có tần số kỳ vọng dưới 5. Lưu ý là tần số kỳ vọng, không phải tần số quan sát.
Những thứ không nên làm
- Chạy thử nhiều phép thử rồi chọn phép cho p nhỏ nhất. Đó là một dạng p-hacking; hãy chọn phép thử trong kế hoạch phân tích trước khi xem kết quả.
- Dùng kiểm định một phía chỉ vì kết quả hai phía không đạt ngưỡng. Kiểm định một phía chỉ hợp lý khi được xác định trước và khi khác biệt theo hướng ngược lại thực sự không có ý nghĩa với câu hỏi.
- Kiểm định chuẩn rồi chuyển phép thử một cách máy móc, bỏ qua thiết kế.
Áp dụng: ví dụ từ đầu đến cuối
Câu hỏi: chương trình ôn thi mới có làm tăng tỷ lệ đỗ không? 120 học sinh, 60 học chương trình mới, 60 học chương trình cũ, phân nhóm ngẫu nhiên. Biến kết quả: đỗ hay trượt. Trả lời năm câu: nhị phân, hai nhóm, độc lập, không cần giả định chuẩn, muốn so sánh tỷ lệ. Phép thử: chi bình phương (hoặc Fisher nếu tần số kỳ vọng nhỏ). Báo cáo: tỷ lệ đỗ mỗi nhóm, chênh lệch tỷ lệ kèm khoảng tin cậy 95%, và giá trị p. Nếu các học sinh đến từ nhiều lớp khác nhau, cân nhắc thêm hồi quy logistic có yếu tố lớp.
Bước tiếp theo: viết năm câu trả lời cho nghiên cứu của bạn thành năm dòng trong kế hoạch phân tích, trước khi mở phần mềm. Nếu dòng thứ ba có chữ “ghép cặp” hoặc “cụm”, hãy dừng lại kiểm tra kỹ phép thử bạn định dùng.
Câu hỏi thường gặp
Khi nào dùng t-test ghép cặp thay cho t-test độc lập?
Khi hai phép đo đến từ cùng một người hoặc từ các cặp được ghép theo thiết kế, ví dụ điểm trước và sau can thiệp trên cùng học sinh.
Dữ liệu không chuẩn thì có dùng t-test được không?
Với cỡ mẫu mỗi nhóm vài chục trở lên, t-test khá vững với lệch vừa phải. Khi mẫu nhỏ và dữ liệu lệch nặng hoặc là thứ bậc, dùng Mann-Whitney hoặc Wilcoxon.
Khi nào dùng Fisher thay cho chi bình phương?
Khi hơn khoảng 20% số ô có tần số kỳ vọng dưới 5, thường gặp với mẫu nhỏ. Chú ý là tần số kỳ vọng chứ không phải tần số quan sát.
Có nên chạy nhiều t-test cho ba nhóm không?
Không. Nhiều phép so sánh làm tăng xác suất kết quả dương tính giả. Dùng ANOVA hoặc Kruskal-Wallis, sau đó so sánh từng cặp có hiệu chỉnh.
Vì sao nên dùng t-test Welch?
Welch không đòi hai nhóm có phương sai bằng nhau và cho kết quả gần như y hệt t-test Student khi phương sai bằng nhau, nên an toàn hơn khi dùng làm mặc định.