Chạy mô hình lần đầu, p = 0,08. Bạn nhận ra có ba người trả lời quá nhanh, loại đi, p = 0,06. Thêm biến giới tính làm biến kiểm soát, vì “về lý thuyết cũng hợp lý”, p = 0,04. Không bước nào là gian lận. Nhưng xác suất bạn tìm được một kết quả “có ý nghĩa” khi thực tế không có hiệu ứng nào đã tăng lên rất nhiều so với mức 5% mà bạn nghĩ mình đang dùng.
Đó là p-hacking: thử nhiều cách phân tích rồi dừng ở cách cho p nhỏ hơn 0,05. Các nhà thống kê gọi hiện tượng rộng hơn là “khu vườn những lối rẽ” (garden of forking paths): mỗi lựa chọn hợp lý là một lối rẽ, và nếu lối rẽ được chọn sau khi nhìn dữ liệu, giá trị p mất ý nghĩa ban đầu.
Vì sao vài lựa chọn nhỏ lại gây hậu quả lớn
Ngưỡng 0,05 có nghĩa là nếu không có hiệu ứng thật, bạn chỉ có khoảng 5% khả năng thấy kết quả “có ý nghĩa” ở một phép kiểm định được định trước. Nếu bạn thử 20 phép kiểm định độc lập, khả năng ít nhất một phép cho p < 0,05 là khoảng 64%. Các lựa chọn phân tích trong thực tế không độc lập hoàn toàn nên con số thật thấp hơn, nhưng các mô phỏng kinh điển trong tâm lý học cho thấy chỉ vài lựa chọn linh hoạt kết hợp đã đủ đẩy tỷ lệ dương tính giả lên nhiều lần mức danh nghĩa.
Bảy thói quen hay gặp và cách sửa
| Thói quen | Trông như thế nào | Cách làm minh bạch |
|---|---|---|
| Dừng thu mẫu tuỳ ý | Kiểm tra p sau mỗi 20 người, dừng khi đạt | Định cỡ mẫu trước bằng phân tích công suất, hoặc dùng thiết kế tuần tự có hiệu chỉnh |
| Loại ngoại lai sau khi xem kết quả | Thử nhiều ngưỡng loại, giữ ngưỡng “đẹp” | Định quy tắc loại trước; báo cáo kết quả có và không loại |
| Chọn biến kiểm soát linh hoạt | Thêm bớt biến tới khi hệ số có ý nghĩa | Chọn biến kiểm soát dựa trên lý thuyết trước khi phân tích |
| Chọn biến kết cục | Đo năm kết cục, báo cáo một | Chỉ định kết cục chính; báo cáo mọi kết cục đã đo |
| Chia nhóm con sau khi thấy dữ liệu | “Hiệu ứng chỉ có ở nữ sinh năm hai” | Gắn nhãn khám phá, hiệu chỉnh so sánh bội, cần lặp lại |
| HARKing | Viết giả thuyết sau khi thấy kết quả, trình bày như đã dự đoán | Tách rõ giả thuyết định trước và phát hiện khám phá |
| Làm tròn có lợi | Báo cáo p = 0,054 là “p = 0,05” hay “gần có ý nghĩa” | Báo cáo giá trị p chính xác, kèm cỡ hiệu ứng và khoảng tin cậy |
HARKing: kể lại câu chuyện ngược
HARKing (Hypothesizing After the Results are Known) là viết phần mở đầu sao cho kết quả bất ngờ trông như được dự đoán từ đầu. Nó hấp dẫn vì bài đọc trơn tru hơn, và đôi khi được người hướng dẫn khuyến khích với ý tốt: “viết cho gọn câu chuyện”. Vấn đề là người đọc sẽ đánh giá bằng chứng mạnh hơn thực tế, vì một dự đoán được xác nhận có sức nặng hơn một phát hiện tình cờ.
Cách viết trung thực không làm bài yếu đi: “Chúng tôi không dự đoán hiệu ứng này. Một cách giải thích khả dĩ là… Kết quả cần được kiểm định ở mẫu độc lập.”
So sánh bội và cách hiệu chỉnh
Khi kiểm định nhiều giả thuyết cùng lúc, cần tính tới việc một số kết quả “có ý nghĩa” sẽ xuất hiện do ngẫu nhiên:
- Bonferroni: chia α cho số phép kiểm định. Đơn giản, bảo thủ, hợp khi số phép ít.
- Holm: biến thể từng bước của Bonferroni, luôn ít nhất mạnh bằng Bonferroni.
- Benjamini–Hochberg: kiểm soát tỷ lệ phát hiện sai (FDR), hợp khi có nhiều phép kiểm định và chấp nhận một tỷ lệ nhỏ dương tính giả, như trong nghiên cứu gen.
Quan trọng hơn chọn phương pháp: khai báo đã làm bao nhiêu phép kiểm định. Hiệu chỉnh cho 5 phép trong khi thực tế đã thử 30 không giải quyết được gì.
Báo cáo để người đọc tự đánh giá
- Cỡ hiệu ứng (d, r, tỷ số chênh…) và khoảng tin cậy 95%, không chỉ giá trị p.
- Mọi biến kết cục đã đo, mọi điều kiện thí nghiệm, mọi tiêu chí loại trừ.
- Một câu kiểu: “Chúng tôi báo cáo cách xác định cỡ mẫu, mọi trường hợp bị loại, mọi điều kiện và mọi biến đo lường.” Nhiều nhà nghiên cứu tâm lý học dùng câu này như một cam kết chuẩn.
- Phân tích độ nhạy: kết quả với và không có ngoại lai, với các tập biến kiểm soát khác nhau.
Phân tích đa vũ trụ: biến điểm yếu thành điểm mạnh
Nếu có nhiều cách xử lý dữ liệu đều hợp lý, thay vì chọn một, hãy chạy tất cả và báo cáo phân bố kết quả. Phương pháp này có tên phân tích đa vũ trụ (multiverse analysis) hoặc đường cong đặc tả (specification curve). Nếu hiệu ứng xuất hiện ở hầu hết các cách xử lý, kết luận vững hơn nhiều so với một mô hình duy nhất. Nếu nó chỉ xuất hiện ở số ít, bạn và người đọc đều cần biết điều đó.
Danh sách tự kiểm trước khi viết phần kết quả
- Kế hoạch phân tích có được viết ra trước khi xem dữ liệu không? Nếu không, tôi có gắn nhãn khám phá cho những gì quyết định sau không?
- Tôi đã thử bao nhiêu mô hình trước khi chọn mô hình này? Có ghi lại không?
- Cỡ mẫu được định trước hay được quyết định khi thấy kết quả?
- Kết quả chính có còn đứng vững khi thay đổi một lựa chọn hợp lý không?
- Tôi có báo cáo mọi kết cục đã đo không?
Một mẹo thực tế: giữ một file nhật ký phân tích, ghi ngày và từng mô hình đã chạy, kể cả những mô hình “thất bại”. Nó mất năm phút mỗi buổi, nhưng giúp bạn trả lời trung thực câu hỏi của phản biện và của chính mình.
Việc tiếp theo: với phân tích đang làm, viết ra ba lựa chọn hợp lý khác nhau ở bước loại ngoại lai và biến kiểm soát, chạy cả ba và xem kết luận có thay đổi không. Kết quả sẽ cho bạn biết nên viết phần thảo luận chắc chắn đến mức nào.
Câu hỏi thường gặp
P-hacking là gì?
Là thử nhiều cách phân tích dữ liệu rồi báo cáo cách cho kết quả có ý nghĩa thống kê, khiến tỷ lệ dương tính giả cao hơn nhiều so với mức danh nghĩa. Nó thường xảy ra không có chủ ý, qua các lựa chọn nhỏ sau khi xem dữ liệu.
Loại ngoại lai có phải p-hacking không?
Không, nếu quy tắc loại được định trước và áp dụng nhất quán. Nó thành vấn đề khi bạn thử nhiều ngưỡng và chọn ngưỡng cho kết quả mong muốn.
HARKing là gì?
Là đưa ra giả thuyết sau khi biết kết quả rồi trình bày như thể đã dự đoán từ trước. Cách làm đúng là nói rõ phát hiện này nằm ngoài dự đoán và cần kiểm định thêm.
Khi nào cần hiệu chỉnh Bonferroni?
Khi kiểm định nhiều giả thuyết cùng lúc mà mỗi giả thuyết đều có thể dẫn tới kết luận. Với số phép kiểm định lớn, phương pháp kiểm soát tỷ lệ phát hiện sai như Benjamini–Hochberg thường hợp lý hơn.
p = 0,06 có được viết là “gần có ý nghĩa” không?
Nên tránh. Hãy báo cáo giá trị p chính xác cùng cỡ hiệu ứng và khoảng tin cậy, để người đọc đánh giá độ mạnh của bằng chứng.