Một nghiên cứu trên 20.000 học sinh báo cáo chương trình đọc sách buổi sáng làm tăng điểm đọc hiểu, p < 0,001. Nghe rất ấn tượng, cho tới khi nhìn con số: tăng 0,4 điểm trên thang 100, cỡ hiệu ứng khoảng 0,03 độ lệch chuẩn. Một nghiên cứu khác trên 30 học sinh báo cáo tăng 9 điểm, p = 0,09, và bị coi là “không có kết quả”. Nếu phải chọn chương trình để thử tiếp, phần lớn nhà giáo dục sẽ chọn chương trình thứ hai.
Giá trị p trả lời câu hỏi “dữ liệu có khớp với giả thuyết không có tác động không”. Nó phụ thuộc vừa vào độ lớn tác động vừa vào cỡ mẫu, nên không thể dùng để so độ lớn. Cỡ hiệu ứng trả lời câu hỏi người đọc thật sự quan tâm: tác động lớn đến đâu.
Cỡ hiệu ứng có đơn vị và không có đơn vị
Cỡ hiệu ứng tốt nhất thường là cỡ hiệu ứng giữ đơn vị gốc: tăng 9 điểm, giảm 5 mmHg huyết áp, thêm 12 điểm phần trăm tỷ lệ đỗ. Người đọc hiểu ngay và tự đánh giá được ý nghĩa thực tiễn. Cỡ hiệu ứng chuẩn hoá (d, r, η²) cần thiết khi thang đo không có ý nghĩa tự thân (điểm của một bảng hỏi tự xây dựng), khi so sánh nhiều nghiên cứu dùng thang đo khác nhau, hoặc khi đưa vào phân tích gộp. Hãy báo cáo cả hai khi có thể.
Các họ cỡ hiệu ứng chính
| Loại so sánh | Chỉ số | Cách hiểu |
|---|---|---|
| Hai trung bình | Cohen d, Hedges g | Chênh lệch trung bình tính theo đơn vị độ lệch chuẩn |
| Hai biến liên tục | Hệ số tương quan r, R² | Mức độ liên hệ; R² là tỷ lệ phương sai được giải thích |
| ANOVA | η², η² từng phần, ω² | Tỷ lệ phương sai của biến kết quả gắn với yếu tố |
| Kết quả nhị phân | Chênh lệch nguy cơ, tỷ số nguy cơ (RR), tỷ số chênh (OR) | So sánh khả năng xảy ra sự kiện giữa các nhóm |
| Can thiệp lâm sàng | Số cần điều trị (NNT) | Số người cần can thiệp để thêm một người có kết quả tốt |
Cohen d và Hedges g
Cohen d bằng chênh lệch hai trung bình chia độ lệch chuẩn gộp. Ví dụ: nhóm can thiệp trung bình 72 điểm, nhóm đối chứng 66, SD gộp 12, d = 6 / 12 = 0,5. Hedges g là bản hiệu chỉnh thiên lệch của d khi mẫu nhỏ; với vài chục người mỗi nhóm, hai con số gần như trùng, nhưng phân tích gộp thường dùng g.
Một cách diễn đạt dễ hiểu hơn cho d là xác suất vượt trội: xác suất một người chọn ngẫu nhiên từ nhóm can thiệp có điểm cao hơn một người chọn ngẫu nhiên từ nhóm đối chứng. Với phân phối chuẩn, d = 0,5 tương ứng khoảng 64%, d = 0,2 khoảng 56%, d = 0,8 khoảng 71%. Nói với hội đồng “64% khả năng một học sinh học chương trình mới làm tốt hơn” thường dễ hiểu hơn “d = 0,5”.
Chú ý với thiết kế đo lặp: d có thể tính theo SD của điểm gốc hoặc theo SD của điểm chênh, và hai cách cho con số rất khác nhau. Luôn ghi rõ công thức đã dùng.
r, R² và eta bình phương
r = 0,3 nghe nhỏ vì R² = 0,09, tức “chỉ giải thích 9% phương sai”. Nhưng trong nghiên cứu về hành vi con người, nhiều liên hệ đã được xác lập vững chắc có r chỉ ở mức 0,1 đến 0,3. Bình phương làm mọi liên hệ trông nhỏ hơn cảm nhận; đừng chỉ báo cáo R² để kết luận “yếu”.
Với ANOVA, η² là tỷ lệ tổng phương sai gắn với yếu tố. Phần mềm thường báo η² từng phần, loại bỏ phương sai của các yếu tố khác nên thường lớn hơn và không so sánh trực tiếp được giữa các thiết kế. ω² ít thiên lệch hơn η² với mẫu nhỏ. Ghi rõ bạn báo cáo chỉ số nào.
Tỷ số chênh không phải tỷ số nguy cơ
Khi sự kiện hiếm (dưới khoảng 10%), OR và RR gần bằng nhau. Khi sự kiện phổ biến, OR phóng đại RR. Ví dụ: tỷ lệ đỗ nhóm A là 80%, nhóm B là 60%. RR = 0,8 / 0,6 ≈ 1,33. Odds nhóm A = 0,8 / 0,2 = 4, nhóm B = 0,6 / 0,4 = 1,5, OR ≈ 2,67. Viết “khả năng đỗ gấp 2,67 lần” là sai; đó là odds gấp 2,67 lần. Chênh lệch tuyệt đối là 20 điểm phần trăm, tương ứng NNT = 1 / 0,2 = 5: cứ năm học sinh học theo cách A thì có thêm một em đỗ.
Hồi quy logistic cho ra OR, nên lỗi diễn giải này cực kỳ phổ biến. Khi có thể, báo cáo kèm tỷ lệ tuyệt đối từng nhóm: “từ 60% lên 80%” rõ hơn mọi tỷ số.
Ngưỡng nhỏ, vừa, lớn: điểm tựa cuối cùng, không phải thước đo
Quy ước quen thuộc của Jacob Cohen cho d là 0,2 nhỏ, 0,5 vừa, 0,8 lớn; cho r là 0,1, 0,3, 0,5. Chính Cohen coi đây là mốc dùng khi không có gì tốt hơn. Ba cách đọc thận trọng hơn:
- So với nghiên cứu cùng loại trong ngành: trong giáo dục, các tổng hợp lớn cho thấy nhiều can thiệp được đánh giá nghiêm túc có tác động dưới 0,2, nên 0,25 có thể là đáng kể. Một thuốc giảm đau d = 0,25 so với giả dược thì có thể không đáng dùng.
- So với chi phí và quy mô: tác động nhỏ của một can thiệp rẻ, áp dụng cho hàng triệu người có thể quan trọng hơn tác động lớn của can thiệp đắt, khó nhân rộng.
- So với ngưỡng có ý nghĩa thực tiễn đã được xác định trong ngành, ví dụ mức thay đổi tối thiểu người bệnh cảm nhận được trên một thang đo.
Nghiên cứu nhỏ được công bố thường có cỡ hiệu ứng phóng đại do thiên lệch công bố, nên một d = 0,8 từ nghiên cứu 20 người cần được đọc với dè dặt.
Chuyển đổi giữa các chỉ số
Khi tổng hợp tài liệu, bạn thường gặp các bài báo cáo chỉ số khác nhau. Một số công thức gần đúng hay dùng (giả định hai nhóm cỡ bằng nhau, phân phối xấp xỉ chuẩn):
- Từ d sang r: r = d / √(d² + 4). Ví dụ d = 0,5 cho r ≈ 0,24.
- Từ r sang d: d = 2r / √(1 − r²).
- Từ OR sang d: d ≈ ln(OR) × √3 / π ≈ ln(OR) × 0,55. Ví dụ OR = 2,67 cho d ≈ 0,54.
Đây là xấp xỉ; khi làm phân tích gộp, dùng công cụ chuyên dụng (gói metafor, esc trong R) và ghi rõ chuyển đổi nào đã áp dụng.
Áp dụng: báo cáo cỡ hiệu ứng kèm khoảng tin cậy
Cỡ hiệu ứng là một ước lượng, nên cũng cần khoảng tin cậy. d = 0,5 với khoảng 0,1 đến 0,9 nói điều rất khác so với d = 0,5 với khoảng 0,4 đến 0,6. Danh sách kiểm:
- Báo cáo cỡ hiệu ứng theo đơn vị gốc cho kết quả chính.
- Thêm cỡ hiệu ứng chuẩn hoá phù hợp với phép phân tích, ghi rõ công thức.
- Kèm khoảng tin cậy 95% cho cả hai.
- Với kết quả nhị phân: tỷ lệ từng nhóm, chênh lệch tuyệt đối, rồi mới đến tỷ số.
- Diễn giải độ lớn bằng so sánh trong ngành, không chỉ bằng nhãn nhỏ vừa lớn.
Câu mẫu: “Nhóm can thiệp cao hơn nhóm đối chứng 6,0 điểm (khoảng tin cậy 95%: 1,7 đến 10,3), d = 0,50 (0,14 đến 0,86), lớn hơn trung vị của các can thiệp đọc hiểu tương tự trong các tổng quan gần đây.”
Cỡ hiệu ứng cũng là đầu vào cho việc tính cỡ mẫu trước khi thu dữ liệu, nội dung được trình bày trong một bài riêng.
Việc làm tiếp: mở phần kết quả của bản thảo, tìm mọi câu chỉ có giá trị p, và bổ sung cho mỗi câu một cỡ hiệu ứng theo đơn vị gốc kèm khoảng tin cậy. Sau đó tự hỏi: so với các nghiên cứu cùng loại, con số này lớn hay nhỏ?
Câu hỏi thường gặp
Cỡ hiệu ứng là gì?
Là con số cho biết độ lớn của tác động hoặc mức độ liên hệ, như chênh lệch trung bình, Cohen d, hệ số tương quan hay tỷ số chênh. Khác với giá trị p, nó không phụ thuộc trực tiếp vào cỡ mẫu.
Cohen d bằng 0,5 nghĩa là gì?
Trung bình hai nhóm chênh nhau nửa độ lệch chuẩn, tương đương khoảng 64% khả năng một người ngẫu nhiên ở nhóm này cao hơn một người ngẫu nhiên ở nhóm kia. Lớn hay nhỏ cần so với các nghiên cứu cùng loại trong ngành.
Tỷ số chênh khác tỷ số nguy cơ thế nào?
Tỷ số nguy cơ so sánh xác suất, tỷ số chênh so sánh odds. Khi sự kiện phổ biến, tỷ số chênh lớn hơn đáng kể tỷ số nguy cơ nên không được đọc như số lần tăng khả năng.
Partial eta squared khác eta squared thế nào?
Eta bình phương tính trên tổng phương sai, còn eta bình phương từng phần loại bỏ phương sai của các yếu tố khác nên thường lớn hơn. Hai chỉ số không so sánh trực tiếp được với nhau.
Có cần báo cáo khoảng tin cậy cho cỡ hiệu ứng không?
Có. Cỡ hiệu ứng là một ước lượng, và khoảng tin cậy cho biết nó chính xác đến đâu. Cùng d bằng 0,5 nhưng khoảng rộng hay hẹp dẫn tới kết luận rất khác nhau.