FESK.COMBàn học toàn cầu của bạn
Gửi thư
Thống kê và dữ liệu

ANOVA và so sánh sau: chọn Tukey, Games-Howell hay Bonferroni, đọc tương tác đúng

F có ý nghĩa mới chỉ là nửa câu trả lời. Cách kiểm giả định, khi nào dùng Welch ANOVA, chọn phép so sánh sau phù hợp, đọc tương tác trong ANOVA hai yếu tố và xử lý thiết kế đo lặp.

ANOVA và so sánh sau: chọn Tukey, Games-Howell hay Bonferroni, đọc tương tác đúng

Một nghiên cứu so sánh ba phương pháp dạy từ vựng, mỗi nhóm 40 sinh viên. ANOVA cho F(2, 117) = 6,1, p = 0,003. Tác giả viết “ba phương pháp khác nhau có ý nghĩa” rồi dừng. Người đọc vẫn chưa biết điều duy nhất họ quan tâm: phương pháp nào tốt hơn phương pháp nào, và hơn bao nhiêu. Có thể chỉ phương pháp C khác hai phương pháp còn lại, còn A và B gần như như nhau.

ANOVA là một chuỗi quyết định: kiểm giả định, chọn biến thể phù hợp, chọn cách so sánh từng cặp, báo cáo cỡ hiệu ứng. Mỗi bước có lựa chọn mặc định hợp lý, và có những lỗi quen thuộc cần tránh.

Trước khi chạy: giả định và biến thể

ANOVA một yếu tố giả định các quan sát độc lập, phần dư xấp xỉ chuẩn trong mỗi nhóm, và phương sai các nhóm tương đương. Trong thực tế:

  • Độc lập đến từ thiết kế; nếu cùng một người xuất hiện ở nhiều điều kiện, đó là thiết kế đo lặp.
  • Chuẩn: với vài chục người mỗi nhóm, ANOVA khá vững. Xem biểu đồ Q-Q của phần dư thay vì dựa vào kiểm định chuẩn.
  • Phương sai bằng nhau quan trọng hơn, nhất là khi cỡ nhóm chênh lệch. Nếu nhóm nhỏ có phương sai lớn, ANOVA cổ điển dễ cho dương tính giả.

Lựa chọn an toàn khi nghi ngờ phương sai khác nhau là Welch ANOVA, tương tự như t-test Welch cho hai nhóm. Khi phương sai thật sự bằng nhau, kết quả gần như trùng với ANOVA cổ điển. Nhiều phần mềm báo cả hai; hãy nói rõ bạn dùng cái nào.

Kế hoạch trước hay khám phá sau

Có hai cách đi từ F sang so sánh cụ thể:

  1. So sánh có kế hoạch (planned contrasts): bạn xác định từ trước một vài so sánh có cơ sở lý thuyết, ví dụ “hai phương pháp mới so với phương pháp truyền thống”. Ít phép so sánh, độ mạnh cao hơn.
  2. So sánh sau (post hoc): so sánh mọi cặp, cần hiệu chỉnh để kiểm soát sai lầm loại I.

Nếu giả thuyết của bạn đã rõ từ đầu, so sánh có kế hoạch thường là cách trung thực và mạnh hơn. Ghi chúng vào kế hoạch phân tích trước khi xem dữ liệu.

Chọn phép so sánh sau

Phép thửKhi nào dùngGhi chú
Tukey HSDSo sánh mọi cặp, phương sai tương đươngLựa chọn mặc định phổ biến; cân bằng tốt giữa kiểm soát sai lầm và độ mạnh
Games-HowellSo sánh mọi cặp, phương sai hoặc cỡ nhóm khác nhauĐi cùng Welch ANOVA
BonferroniMột số ít so sánh chọn trướcĐơn giản nhưng bảo thủ khi số so sánh nhiều
HolmNhư BonferroniLuôn mạnh hơn hoặc bằng Bonferroni, vẫn kiểm soát sai lầm tổng thể
DunnettMọi nhóm so với một nhóm đối chứngKhông so các nhóm điều trị với nhau

Với ba nhóm và phương sai tương đương, Tukey gần như luôn là lựa chọn hợp lý. Tránh chạy nhiều t-test không hiệu chỉnh rồi gọi đó là “so sánh sau”: với năm nhóm là mười cặp, và khả năng có ít nhất một kết quả dương tính giả vượt xa 5%.

ANOVA hai yếu tố: đọc tương tác trước

Khi có hai yếu tố, ví dụ phương pháp dạy (A, B) và trình độ đầu vào (thấp, cao), ANOVA cho ba kết quả: hiệu ứng chính của phương pháp, hiệu ứng chính của trình độ, và tương tác. Nguyên tắc: đọc tương tác trước.

Nếu tương tác có ý nghĩa, hiệu ứng chính có thể gây hiểu lầm. Ví dụ: phương pháp A giúp nhóm trình độ thấp tăng 8 điểm nhưng làm nhóm trình độ cao giảm 2 điểm so với B. Hiệu ứng chính “trung bình” của A có thể dương và có ý nghĩa, nhưng nói “A tốt hơn B” là sai với một nửa số sinh viên. Khi đó hãy phân tích hiệu ứng đơn (simple effects): so A với B riêng trong từng nhóm trình độ.

Luôn vẽ biểu đồ trung bình theo hai yếu tố. Hai đường song song gợi ý không có tương tác; hai đường cắt nhau gợi ý tương tác mạnh, đáng chú ý nhất khi hướng tác động đảo ngược.

Thiết kế đo lặp và thiết kế trước sau

Khi cùng một người được đo ở nhiều thời điểm, dùng ANOVA đo lặp. Giả định đặc thù ở đây là tính cầu (sphericity); nếu vi phạm, dùng hiệu chỉnh Greenhouse-Geisser mà phần mềm thường báo sẵn. Với dữ liệu thiếu ở một số thời điểm hoặc khoảng cách đo không đều, mô hình hỗn hợp (mixed model) linh hoạt hơn và giữ lại được nhiều người hơn.

Với thiết kế hai nhóm có đo trước và đo sau, nhiều người chạy ANOVA hỗn hợp 2 × 2 hoặc so sánh điểm chênh. Trong thử nghiệm ngẫu nhiên, cách thường được khuyến nghị là ANCOVA: điểm sau là biến phụ thuộc, điểm trước là biến hiệp biến. Cách này thường cho ước lượng chính xác hơn và xử lý tốt hiện tượng hồi quy về trung bình.

Báo cáo cỡ hiệu ứng

Cùng với F và p, báo cáo cỡ hiệu ứng tổng thể (η² hoặc ω²; ω² ít thiên lệch hơn với mẫu nhỏ) và, quan trọng hơn, chênh lệch trung bình kèm khoảng tin cậy cho các so sánh cụ thể. Câu “phương pháp C cao hơn A trung bình 5,2 điểm (khoảng tin cậy 95% đã hiệu chỉnh Tukey: 1,4 đến 9,0)” có ích cho người đọc hơn mọi giá trị F.

Áp dụng: quy trình và câu báo cáo mẫu

  1. Vẽ biểu đồ hộp hoặc biểu đồ điểm của biến kết quả theo nhóm.
  2. Xem độ lệch chuẩn từng nhóm và cỡ nhóm; nếu SD lớn nhất gấp đôi SD nhỏ nhất và cỡ nhóm lệch, ưu tiên Welch.
  3. Chạy ANOVA (cổ điển hoặc Welch), ghi F, bậc tự do, p, ω².
  4. Chạy so sánh có kế hoạch hoặc so sánh sau phù hợp.
  5. Báo cáo chênh lệch trung bình và khoảng tin cậy đã hiệu chỉnh cho từng cặp quan trọng.
  6. Với hai yếu tố: kiểm tương tác, vẽ biểu đồ tương tác, phân tích hiệu ứng đơn nếu cần.

Câu mẫu: “Điểm từ vựng khác nhau giữa ba phương pháp, Welch F(2, 76,4) = 6,3, p = 0,003, ω² = 0,08. So sánh Games-Howell cho thấy phương pháp C cao hơn A 5,2 điểm (khoảng tin cậy 95%: 1,4 đến 9,0) và cao hơn B 4,6 điểm (0,7 đến 8,5); A và B không khác biệt rõ (0,6 điểm; −3,1 đến 4,3).” Chú ý bậc tự do lẻ của Welch là bình thường.

Bước tiếp theo: với phân tích ANOVA sắp làm, viết ra trước bạn sẽ dùng so sánh có kế hoạch hay so sánh sau, phép nào, và vì sao. Một dòng trong kế hoạch phân tích giúp tránh câu hỏi khó nhất của phản biện: “các so sánh này được chọn trước hay sau khi xem dữ liệu?”.

Câu hỏi thường gặp

Khi nào dùng Welch ANOVA?

Khi nghi ngờ phương sai các nhóm khác nhau, nhất là khi cỡ nhóm không đều. Khi phương sai bằng nhau, Welch ANOVA cho kết quả gần như trùng với ANOVA cổ điển nên an toàn khi dùng mặc định.

Tukey và Bonferroni khác nhau thế nào?

Tukey được thiết kế để so sánh mọi cặp và cân bằng tốt giữa kiểm soát sai lầm và độ mạnh. Bonferroni đơn giản, phù hợp khi chỉ có ít so sánh chọn trước, và trở nên quá bảo thủ khi số so sánh nhiều.

ANOVA có ý nghĩa nhưng so sánh sau không có cặp nào có ý nghĩa thì sao?

Điều này có thể xảy ra vì hai phép thử trả lời hai câu hỏi khác nhau. Hãy báo cáo trung thực, kèm chênh lệch trung bình và khoảng tin cậy của từng cặp.

Tương tác có ý nghĩa thì đọc hiệu ứng chính thế nào?

Thận trọng. Khi có tương tác, hiệu ứng chính là trung bình có thể che mất việc tác động khác nhau giữa các nhóm. Hãy phân tích hiệu ứng đơn trong từng mức của yếu tố kia.

Thiết kế trước sau hai nhóm nên phân tích bằng gì?

Với thử nghiệm ngẫu nhiên, ANCOVA với điểm sau là biến phụ thuộc và điểm trước là hiệp biến thường được khuyến nghị vì cho ước lượng chính xác hơn so với phân tích điểm chênh.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

🧭
Bạn đang ở chặng nào của đường học vị?
Nhập chỗ bạn đang đứng và đích bạn nhắm — công cụ trả về số năm, chi phí và việc phải làm từng chặng.
Xem lộ trình của tôi →
Miễn phí, không cần tài khoản. Xem tất cả công cụ

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.

hoặc
info@fesk.com