Một luận văn có 27 bảng chéo, mỗi bảng kèm một dòng “χ² = …, p < 0,05, như vậy có mối liên hệ”. Hội đồng hỏi: trong bảng 5 × 4 về nghề nghiệp và mức độ hài lòng, chính xác nhóm nào khác nhóm nào? Tác giả không trả lời được, vì kiểm định khi bình phương tổng thể chỉ nói “có khác biệt ở đâu đó”, không nói ở đâu.
Kiểm định khi bình phương (chi-square) đơn giản và hữu ích cho hai biến phân loại. Nhưng để dùng cho đúng, bạn cần biết nó so sánh gì, điều kiện nào làm nó không đáng tin, và cách đọc tiếp sau khi có giá trị p.
Kiểm định so sánh cái gì
Kiểm định độc lập so sánh tần số quan sát trong từng ô với tần số kỳ vọng nếu hai biến không liên quan gì. Tần số kỳ vọng của một ô bằng tổng hàng nhân tổng cột chia tổng cỡ mẫu.
Ví dụ giả định: 200 sinh viên, 100 học trực tuyến và 100 học trực tiếp; tổng cộng 152 người đạt, 48 người không đạt.
| Đạt | Không đạt | Tổng | |
|---|---|---|---|
| Trực tuyến | 70 (kỳ vọng 76) | 30 (kỳ vọng 24) | 100 |
| Trực tiếp | 82 (kỳ vọng 76) | 18 (kỳ vọng 24) | 100 |
| Tổng | 152 | 48 | 200 |
Mỗi ô đóng góp (quan sát − kỳ vọng)² / kỳ vọng. Hai ô “đạt” mỗi ô góp 36/76 ≈ 0,47; hai ô “không đạt” mỗi ô góp 36/24 = 1,5. Tổng χ² ≈ 3,95 với 1 bậc tự do, p ≈ 0,047. Để ý: ô “không đạt” đóng góp nhiều hơn dù chênh lệch tuyệt đối như nhau, vì tần số kỳ vọng nhỏ hơn.
Điều kiện áp dụng: tần số kỳ vọng, không phải tần số quan sát
Phép xấp xỉ khi bình phương kém chính xác khi tần số kỳ vọng nhỏ. Quy tắc thường dùng: không ô nào có tần số kỳ vọng dưới 1 và không quá 20% số ô có tần số kỳ vọng dưới 5. Nhiều người kiểm nhầm trên tần số quan sát. Phần mềm như SPSS thường in dòng chú thích về số ô có kỳ vọng dưới 5; hãy đọc dòng đó.
Khi điều kiện không đạt:
- Với bảng 2 × 2: dùng kiểm định chính xác Fisher.
- Với bảng lớn hơn: gộp các nhóm nhỏ có ý nghĩa gần nhau (gộp “rất không hài lòng” với “không hài lòng”), hoặc dùng Fisher mở rộng hay kiểm định Monte Carlo nếu phần mềm hỗ trợ.
- Không gộp nhóm chỉ để đạt ý nghĩa thống kê; quyết định gộp phải dựa trên ý nghĩa nội dung và nên nêu rõ.
Hiệu chỉnh liên tục Yates cho bảng 2 × 2 hay bị tranh luận vì quá thận trọng; nhiều nhà thống kê khuyên dùng Fisher khi mẫu nhỏ và bỏ qua Yates khi mẫu lớn. Dù chọn gì, hãy nói rõ.
Sau giá trị p: tìm ô tạo ra khác biệt
Với bảng lớn hơn 2 × 2, kiểm định tổng thể có ý nghĩa chỉ là điểm bắt đầu. Công cụ hữu ích nhất là phần dư chuẩn hoá hiệu chỉnh (adjusted standardized residuals) của từng ô. Giá trị tuyệt đối lớn hơn khoảng 2 cho thấy ô đó có nhiều hoặc ít hơn kỳ vọng một cách đáng chú ý. Khi xem nhiều ô cùng lúc, hãy dùng ngưỡng chặt hơn hoặc hiệu chỉnh cho so sánh bội.
Trong SPSS, bật tuỳ chọn “Adjusted standardized” trong mục Cells của Crosstabs. Trong R, đối tượng kết quả của chisq.test có thành phần stdres.
Cỡ hiệu ứng: Cramér V và phi
Với cỡ mẫu lớn, liên hệ rất yếu vẫn cho p nhỏ. Hãy báo cỡ hiệu ứng:
- Phi cho bảng 2 × 2.
- Cramér V cho bảng lớn hơn: căn bậc hai của χ² chia cho n nhân (số hàng hoặc số cột nhỏ hơn trừ 1).
Ở ví dụ trên, Cramér V = √(3,95 / 200) ≈ 0,14, một liên hệ yếu. Với bảng 2 × 2, cách trình bày dễ hiểu nhất thường là chênh lệch tỷ lệ kèm khoảng tin cậy: 70% so với 82%, chênh 12 điểm phần trăm.
Những tình huống không dùng khi bình phương độc lập
| Tình huống | Nên dùng |
|---|---|
| Cùng một người đo hai lần (trước/sau), kết cục có/không | McNemar |
| Một biến là thứ bậc, muốn kiểm tra xu hướng | Kiểm định xu hướng (Cochran–Armitage) hoặc hồi quy thứ bậc |
| Muốn điều chỉnh thêm biến khác | Hồi quy logistic hoặc Cochran–Mantel–Haenszel |
| Dữ liệu là phần trăm hay trung bình, không phải số đếm | Không dùng χ²; chuyển về số đếm hoặc chọn kiểm định khác |
| Một người chọn nhiều đáp án trong câu hỏi nhiều lựa chọn | Các quan sát không độc lập; cần phân tích riêng từng lựa chọn hoặc phương pháp chuyên biệt |
Đừng chạy 27 bảng rồi báo các bảng có ý nghĩa
Chạy hàng chục bảng chéo và chỉ báo những bảng có p < 0,05 là một dạng p-hacking. Với 27 phép thử độc lập, trung bình khoảng một phép sẽ “có ý nghĩa” chỉ do ngẫu nhiên. Hãy xác định trước những liên hệ chính cần kiểm định theo câu hỏi nghiên cứu, báo đầy đủ kết quả của chúng, và coi phần còn lại là khám phá.
Áp dụng thực tế: mẫu trình bày một bảng chéo
- Bảng có số đếm và phần trăm theo hàng (hoặc cột, tuỳ câu hỏi), ghi rõ phần trăm tính theo chiều nào.
- Kiểm tra tần số kỳ vọng; chọn χ² hoặc Fisher và nêu lý do.
- Báo χ², bậc tự do, n, giá trị p và Cramér V.
- Với bảng lớn: nêu các ô có phần dư chuẩn hoá hiệu chỉnh nổi bật.
- Viết một câu diễn giải bằng tỷ lệ, không chỉ “có mối liên hệ”.
Mẫu câu: “Tỷ lệ đạt ở nhóm học trực tiếp cao hơn nhóm trực tuyến (82% so với 70%; χ²(1, N = 200) = 3,95; p = 0,047; phi = 0,14).”
Việc làm tiếp theo: chọn bảng chéo lớn nhất trong bài của bạn, bật phần dư chuẩn hoá hiệu chỉnh và xem ô nào thật sự tạo ra khác biệt. Viết lại câu diễn giải để người đọc biết chính xác nhóm nào khác nhóm nào.
Câu hỏi thường gặp
Khi nào dùng kiểm định khi bình phương?
Khi muốn kiểm tra liên hệ giữa hai biến phân loại với các quan sát độc lập, dữ liệu là số đếm và tần số kỳ vọng đủ lớn trong các ô.
Tần số kỳ vọng dưới 5 thì làm sao?
Với bảng 2 × 2, dùng kiểm định chính xác Fisher. Với bảng lớn hơn, cân nhắc gộp các nhóm gần nghĩa hoặc dùng phương pháp chính xác, Monte Carlo nếu phần mềm hỗ trợ.
Kiểm định khi bình phương có ý nghĩa thì kết luận thế nào?
Chỉ biết có liên hệ ở đâu đó trong bảng. Hãy xem phần dư chuẩn hoá hiệu chỉnh để biết ô nào khác kỳ vọng, và báo cỡ hiệu ứng như Cramér V.
Cramér V bao nhiêu là liên hệ mạnh?
Ngưỡng tham khảo phụ thuộc số bậc tự do và bối cảnh ngành. Hãy diễn giải cùng với chênh lệch tỷ lệ cụ thể thay vì chỉ gắn nhãn mạnh hay yếu.
Dữ liệu trước và sau trên cùng một người có dùng khi bình phương được không?
Không nên, vì các quan sát không độc lập. Với kết cục có/không đo hai lần trên cùng người, hãy dùng kiểm định McNemar.