Một phân tích gộp về một phương pháp dạy học kết luận hiệu ứng trung bình là 0,45 độ lệch chuẩn, khoảng tin cậy hẹp, giá trị p rất nhỏ. Nhìn vào biểu đồ rừng thì thấy các nghiên cứu gốc trải từ âm 0,2 đến dương 1,3, và I² là 85%. Con số 0,45 đúng về mặt tính toán, nhưng nó mô tả trung bình của những thứ rất khác nhau. Câu hỏi quan trọng hơn là vì sao chúng khác nhau, và bài báo không trả lời.
Phân tích gộp (meta-analysis) là phương pháp thống kê kết hợp kết quả của nhiều nghiên cứu. Làm tốt, nó cho ước lượng chính xác hơn bất kỳ nghiên cứu đơn lẻ nào. Làm vội, nó khoác áo chắc chắn cho một mớ bằng chứng không đồng nhất. Bài này tập trung vào phần thống kê: gộp như thế nào và đọc kết quả ra sao.
Bước đầu: đưa mọi nghiên cứu về cùng một thước đo
Các nghiên cứu gốc báo kết quả bằng nhiều cách: trung bình và độ lệch chuẩn, tỷ lệ, tỷ số chênh, hệ số tương quan. Muốn gộp, cần một cỡ hiệu ứng chung:
| Loại kết cục | Cỡ hiệu ứng thường dùng | Lưu ý |
|---|---|---|
| Liên tục, cùng thang đo | Chênh lệch trung bình (MD) | Dễ diễn giải nhất, giữ nguyên đơn vị |
| Liên tục, khác thang đo | Chênh lệch trung bình chuẩn hoá (SMD, Hedges g) | Hedges g hiệu chỉnh sai lệch khi mẫu nhỏ |
| Nhị phân | Tỷ số chênh (OR), tỷ số nguy cơ (RR) | Gộp trên thang log, trình bày lại trên thang gốc |
| Tương quan | r, gộp sau biến đổi Fisher z | Chuyển ngược về r khi báo cáo |
Nhiều nghiên cứu không báo đủ số liệu, và bạn phải tính cỡ hiệu ứng từ giá trị t, F, p hay từ số liệu trong hình. Ghi lại cách tính cho từng nghiên cứu; đây là nơi lỗi nhập liệu hay xảy ra nhất.
Trọng số: nghiên cứu lớn nói to hơn
Phân tích gộp không lấy trung bình cộng đơn giản. Mỗi nghiên cứu được gán trọng số theo độ chính xác, thường là nghịch đảo phương sai: 1 chia bình phương sai số chuẩn.
Ví dụ giả định với ba nghiên cứu:
- Nghiên cứu A: g = 0,20, sai số chuẩn 0,10 → trọng số 100.
- Nghiên cứu B: g = 0,50, sai số chuẩn 0,20 → trọng số 25.
- Nghiên cứu C: g = 0,35, sai số chuẩn 0,15 → trọng số khoảng 44.
Ước lượng gộp = tổng (g × trọng số) chia tổng trọng số ≈ 48,1 / 169,4 ≈ 0,28. Sai số chuẩn gộp = 1 chia căn tổng trọng số ≈ 0,077, nên khoảng tin cậy 95% khoảng 0,13 đến 0,43. Trung bình cộng đơn giản là 0,35; con số gộp thấp hơn vì nghiên cứu A, chính xác nhất, kéo về phía nó.
Mô hình cố định hay mô hình ngẫu nhiên
| Mô hình hiệu ứng cố định | Mô hình hiệu ứng ngẫu nhiên | |
|---|---|---|
| Giả định | Mọi nghiên cứu ước lượng cùng một hiệu ứng thật | Hiệu ứng thật khác nhau giữa các nghiên cứu, phân bố quanh một trung bình |
| Câu hỏi trả lời | Hiệu ứng chung của các nghiên cứu này là bao nhiêu | Trung bình của phân phối hiệu ứng là bao nhiêu |
| Trọng số | Nghiên cứu lớn chiếm ưu thế rõ | Trọng số đồng đều hơn giữa nghiên cứu lớn và nhỏ |
| Khoảng tin cậy | Hẹp hơn | Rộng hơn khi có dị biệt |
Trong khoa học xã hội, giáo dục, y tế công cộng, nơi các nghiên cứu khác nhau về đối tượng, bối cảnh, cách đo, giả định hiệu ứng cố định hiếm khi hợp lý; mô hình ngẫu nhiên thường là lựa chọn mặc định. Đừng chọn mô hình sau khi xem mô hình nào cho kết quả đẹp hơn. Khi số nghiên cứu ít, cân nhắc các phương pháp ước lượng phương sai giữa nghiên cứu tốt hơn (như REML) và hiệu chỉnh Hartung–Knapp cho khoảng tin cậy.
Đọc biểu đồ rừng
Biểu đồ rừng (forest plot) là hình trung tâm của mọi phân tích gộp:
- Mỗi dòng một nghiên cứu: ô vuông là ước lượng, kích thước ô tỷ lệ với trọng số, đường ngang là khoảng tin cậy.
- Đường thẳng đứng ở giá trị không có hiệu ứng (0 với chênh lệch, 1 với tỷ số).
- Hình thoi ở cuối là ước lượng gộp; độ rộng của hình thoi là khoảng tin cậy.
- Nhiều biểu đồ có thêm khoảng dự báo (prediction interval): phạm vi hiệu ứng có thể gặp ở một nghiên cứu mới. Đây thường là con số hữu ích nhất cho người làm thực tiễn, và hay bị bỏ qua.
Hãy nhìn độ chồng lấn của các đường ngang trước khi nhìn hình thoi. Nếu các khoảng tin cậy gần như không chồng lên nhau, câu chuyện là dị biệt, không phải trung bình.
Dị biệt: Q, I² và tau bình phương
- Kiểm định Q: kiểm tra dị biệt có vượt quá mức ngẫu nhiên không. Năng lực thấp khi ít nghiên cứu, nên p không có ý nghĩa không chứng minh đồng nhất.
- I²: tỷ lệ biến thiên quan sát được do khác biệt thật giữa các nghiên cứu, không phải do sai số lấy mẫu. Ở ví dụ ba nghiên cứu trên, I² chỉ khoảng 3%.
- Tau bình phương: phương sai của hiệu ứng thật, trên cùng thang với cỡ hiệu ứng. Nó cho biết độ lớn tuyệt đối của dị biệt.
Hiểu lầm hay gặp: I² không đo hiệu ứng khác nhau bao nhiêu, mà đo tỷ lệ. Với nhiều nghiên cứu lớn và chính xác, I² có thể cao dù các hiệu ứng thật chỉ chênh nhau chút ít. Vì vậy hãy báo cả tau và khoảng dự báo, đừng chỉ báo I² rồi gắn nhãn thấp, vừa, cao.
Giải thích dị biệt: phân tích nhóm con và hồi quy gộp
Khi dị biệt lớn, hãy tìm nguyên nhân bằng các biến đã định trước trong kế hoạch: bậc học, thời lượng can thiệp, chất lượng nghiên cứu. Phân tích nhóm con (subgroup analysis) so sánh ước lượng gộp giữa các nhóm; hồi quy gộp (meta-regression) dùng biến liên tục. Cả hai là quan sát ở cấp nghiên cứu, nên dễ bị gây nhiễu, và với ít nghiên cứu thì năng lực rất thấp. Hãy coi chúng là gợi ý, không phải bằng chứng nhân quả.
Thiên lệch công bố và biểu đồ phễu
Nghiên cứu nhỏ với kết quả không có ý nghĩa ít được đăng hơn. Khi đó, tập nghiên cứu bạn gộp bị lệch về phía hiệu ứng lớn.
- Biểu đồ phễu (funnel plot): trục ngang là cỡ hiệu ứng, trục dọc là độ chính xác. Không có thiên lệch, các điểm tạo hình phễu cân đối. Một góc dưới trống (thiếu nghiên cứu nhỏ có hiệu ứng nhỏ) là dấu hiệu cần lưu ý.
- Kiểm định Egger kiểm tra độ bất cân xứng; cần khoảng mười nghiên cứu trở lên mới có ý nghĩa.
- Bất cân xứng không chắc là do thiên lệch công bố; nghiên cứu nhỏ có thể khác thật (đối tượng khác, can thiệp kỹ hơn).
- Các phương pháp hiệu chỉnh như trim-and-fill cho thấy kết quả nhạy đến đâu, nhưng không “sửa” được dữ liệu thiếu.
Cách phòng tốt nhất là tìm tài liệu xám, luận án, đăng ký thử nghiệm ngay từ bước tìm kiếm.
Áp dụng thực tế: bảng kiểm phần thống kê của một phân tích gộp
- Chọn cỡ hiệu ứng phù hợp kết cục; ghi cách tính cho từng nghiên cứu, có người thứ hai kiểm tra.
- Chọn mô hình trước khi xem kết quả, nêu lý do; mặc định hiệu ứng ngẫu nhiên khi bối cảnh đa dạng.
- Vẽ biểu đồ rừng, báo ước lượng gộp, khoảng tin cậy và khoảng dự báo.
- Báo Q, I², tau; nếu dị biệt lớn, phân tích nhóm con đã định trước.
- Phân tích độ nhạy: bỏ lần lượt từng nghiên cứu, bỏ nghiên cứu nguy cơ sai lệch cao.
- Vẽ biểu đồ phễu và kiểm định bất cân xứng khi đủ số nghiên cứu.
Công cụ: gói metafor và meta trong R, mô-đun phân tích gộp trong JASP và jamovi cho người thích giao diện.
Việc làm tiếp theo: mở một phân tích gộp trong ngành của bạn, bỏ qua con số gộp và nhìn biểu đồ rừng trước. Hỏi xem các nghiên cứu có đồng thuận không, khoảng dự báo rộng đến đâu, và tác giả đã giải thích dị biệt chưa. Bạn sẽ đọc phân tích gộp theo cách hoàn toàn khác.
Câu hỏi thường gặp
Phân tích gộp (meta-analysis) là gì?
Là phương pháp thống kê kết hợp cỡ hiệu ứng từ nhiều nghiên cứu, gán trọng số theo độ chính xác, để có ước lượng chung và đánh giá mức độ khác biệt giữa các nghiên cứu.
Nên dùng mô hình hiệu ứng cố định hay ngẫu nhiên?
Khi các nghiên cứu khác nhau về đối tượng, bối cảnh hay cách đo, mô hình ngẫu nhiên thường hợp lý hơn. Hãy chọn trước khi xem kết quả và nêu lý do.
I² bao nhiêu là dị biệt cao?
Không nên chỉ dựa vào ngưỡng. I² đo tỷ lệ biến thiên do khác biệt thật, không đo độ lớn; hãy báo thêm tau và khoảng dự báo để người đọc thấy hiệu ứng dao động bao nhiêu.
Biểu đồ rừng đọc thế nào?
Mỗi dòng là một nghiên cứu với ô vuông là ước lượng và đường ngang là khoảng tin cậy; hình thoi cuối cùng là ước lượng gộp. Nhìn độ chồng lấn trước khi nhìn hình thoi.
Biểu đồ phễu bất cân xứng có chắc là thiên lệch công bố không?
Không chắc. Nghiên cứu nhỏ có thể khác thật về đối tượng hay can thiệp. Hãy coi đó là tín hiệu cần xem xét và dùng phân tích độ nhạy.