FESK.COMBàn học toàn cầu của bạn
Gửi thư
Thống kê và dữ liệu

Hồi quy logistic cho kết cục có/không: đọc tỷ số chênh mà không nói quá

Khi kết cục là đậu hay rớt, bỏ học hay không, hồi quy tuyến tính không còn dùng được. Cách đọc hệ số logistic, đổi sang tỷ số chênh, tránh nhầm “chênh” với “nguy cơ” và kiểm tra mô hình cho đủ.

Hồi quy logistic cho kết cục có/không: đọc tỷ số chênh mà không nói quá

Một bài báo viết: “Sinh viên đi làm thêm có nguy cơ bỏ học cao gấp 2,5 lần”. Con số 2,5 là tỷ số chênh (odds ratio) từ hồi quy logistic. Khi đọc bảng số liệu gốc, tỷ lệ bỏ học của nhóm đi làm thêm là 30%, nhóm không đi làm là 15%. Nguy cơ thật chỉ cao gấp đôi. Câu “gấp 2,5 lần nguy cơ” nói quá, và lỗi này xuất hiện trong rất nhiều luận văn.

Hồi quy logistic là công cụ chuẩn khi biến kết cục chỉ có hai giá trị. Nó không khó chạy, nhưng dễ đọc sai, và phần lớn lỗi nằm ở diễn giải, không nằm ở phần mềm.

Vì sao không dùng hồi quy tuyến tính cho kết cục có/không

Nếu mã hoá bỏ học là 1, không bỏ học là 0 rồi chạy hồi quy tuyến tính (gọi là mô hình xác suất tuyến tính), bạn gặp ba vấn đề: giá trị dự báo có thể nhỏ hơn 0 hoặc lớn hơn 1, phương sai sai số không đồng nhất theo cấu trúc, và quan hệ thật thường có dạng chữ S chứ không phải đường thẳng. Mô hình xác suất tuyến tính vẫn được dùng trong một số ngành như kinh tế học với sai số chuẩn vững, nhưng nếu người hướng dẫn và tạp chí của bạn chờ logistic, hãy dùng logistic.

Ba đại lượng: xác suất, odds, log-odds

Đại lượngCông thứcVí dụ với xác suất 0,30
Xác suất (p)số ca / tổng số0,30
Oddsp / (1 − p)0,30 / 0,70 ≈ 0,43
Log-odds (logit)ln(odds)ln(0,43) ≈ −0,85

Hồi quy logistic mô hình hoá log-odds như một hàm tuyến tính của các biến giải thích. Vì vậy hệ số B mà phần mềm in ra nằm trên thang log-odds, rất khó diễn giải trực tiếp. Lấy hàm mũ của B, tức Exp(B) hay e mũ B, bạn được tỷ số chênh.

Đọc tỷ số chênh

  • OR = 1: không có khác biệt về odds.
  • OR > 1: odds của kết cục cao hơn. OR = 1,8 nghĩa là odds cao hơn 80%.
  • OR < 1: odds thấp hơn. OR = 0,6 nghĩa là odds thấp hơn 40%.

Với biến liên tục, OR là thay đổi của odds khi biến tăng một đơn vị. Nếu đơn vị quá nhỏ, như thu nhập tính bằng đồng, OR sẽ gần bằng 1 và trông vô nghĩa. Hãy đổi đơn vị (triệu đồng, mười năm tuổi) hoặc chuẩn hoá biến trước khi chạy.

Với biến phân loại, OR luôn so với nhóm tham chiếu. Hãy chọn nhóm tham chiếu có ý nghĩa và đủ lớn, và nói rõ nó trong bảng.

Tỷ số chênh không phải tỷ số nguy cơ

Tỷ số nguy cơ (risk ratio) là tỷ lệ giữa hai xác suất. Tỷ số chênh là tỷ lệ giữa hai odds. Khi kết cục hiếm (khoảng dưới 10%), hai con số gần nhau. Khi kết cục phổ biến, OR xa 1 hơn RR đáng kể.

Ví dụ ở đầu bài: nhóm đi làm thêm p = 0,30, odds ≈ 0,43; nhóm không đi làm p = 0,15, odds ≈ 0,18. OR ≈ 0,43 / 0,18 ≈ 2,4, trong khi RR = 0,30 / 0,15 = 2,0. Viết “nguy cơ cao gấp 2,4 lần” là sai. Cách viết đúng: “odds bỏ học cao hơn khoảng 2,4 lần”, hoặc tốt hơn cho người đọc phổ thông, trình bày xác suất dự báo của từng nhóm.

Xác suất dự báo: cách trình bày người đọc hiểu được

Phần lớn người đọc, kể cả phản biện, hiểu “xác suất bỏ học dự báo là 28% so với 16%” nhanh hơn nhiều so với “OR = 2,1”. Hầu hết phần mềm tính được xác suất dự báo cho các nhóm, giữ các biến khác ở giá trị trung bình hoặc giá trị tiêu biểu, hay tính hiệu ứng biên trung bình (average marginal effect). Một bảng hoặc biểu đồ xác suất dự báo đặt cạnh bảng OR làm bài mạnh hơn rõ rệt.

Bao nhiêu biến là quá nhiều

Với logistic, lượng thông tin bị giới hạn bởi số ca ở nhóm nhỏ hơn của kết cục, không phải tổng cỡ mẫu. Nếu 1.000 sinh viên có 60 người bỏ học, dữ liệu của bạn chỉ “mạnh” bằng 60 ca đó. Quy tắc kinh nghiệm cũ là khoảng 10 ca cho mỗi tham số; nghiên cứu phương pháp gần đây cho rằng con số phù hợp phụ thuộc bối cảnh và nên tính cỡ mẫu cụ thể hơn. Dù theo cách nào, nhồi 15 biến vào mô hình có 60 ca gần như chắc chắn cho kết quả không ổn định, OR phóng đại và khoảng tin cậy rất rộng.

Dấu hiệu cảnh báo: OR cực lớn (hàng chục, hàng trăm), khoảng tin cậy trải từ 0,1 đến 500, hoặc phần mềm báo không hội tụ. Thường đó là hiện tượng tách biệt hoàn toàn (complete separation): một biến dự báo hoàn hảo kết cục trong một nhóm nhỏ.

Kiểm tra mô hình

  • Tính tuyến tính của logit với biến liên tục: thử thêm dạng bậc hai hoặc spline, hoặc chia nhóm để xem xu hướng.
  • Đa cộng tuyến: kiểm tra như hồi quy tuyến tính.
  • Khả năng phân biệt: diện tích dưới đường cong ROC (AUC hay C-statistic) cho biết mô hình phân biệt hai nhóm tốt đến đâu.
  • Hiệu chuẩn (calibration): xác suất dự báo có khớp tỷ lệ quan sát không. Kiểm định Hosmer–Lemeshow phổ biến nhưng nhạy với cỡ mẫu; biểu đồ hiệu chuẩn hữu ích hơn.
  • Pseudo R bình phương (Nagelkerke, McFadden) không đọc như R bình phương của hồi quy tuyến tính; đừng dùng nó làm thước đo chính.

Áp dụng thực tế: mẫu báo cáo kết quả

  1. Nêu kết cục, cách mã hoá, số ca ở mỗi nhóm.
  2. Nêu biến đưa vào mô hình và lý do chọn (lý thuyết, nghiên cứu trước), không chọn theo từng bước tự động.
  3. Bảng: OR, khoảng tin cậy 95%, giá trị p cho mỗi biến; ghi rõ nhóm tham chiếu và đơn vị biến liên tục.
  4. Một câu diễn giải bằng odds cho kết quả chính, kèm xác suất dự báo.
  5. Thông tin mô hình: số quan sát, AUC, kết quả kiểm tra hiệu chuẩn.

Mẫu câu: “Sau khi điều chỉnh theo giới, năm học và điểm đầu vào, sinh viên đi làm thêm trên 20 giờ mỗi tuần có odds bỏ học cao hơn (OR = 2,1; KTC 95%: 1,3–3,4). Xác suất bỏ học dự báo là 24% so với 13% ở sinh viên không đi làm.”

Việc làm tiếp theo: mở bảng logistic trong luận văn hoặc bài báo gần nhất của bạn, tìm mọi câu có chữ “nguy cơ” hay “khả năng cao gấp”, và kiểm tra xem con số đi kèm có thật là tỷ số nguy cơ không. Nếu kết cục phổ biến, hãy thêm xác suất dự báo.

Câu hỏi thường gặp

Khi nào dùng hồi quy logistic thay cho hồi quy tuyến tính?

Khi biến kết cục chỉ có hai giá trị như đậu/rớt, có/không. Hồi quy tuyến tính có thể cho xác suất dự báo ngoài khoảng 0–1 và không phản ánh quan hệ hình chữ S.

Tỷ số chênh (odds ratio) có phải là tỷ số nguy cơ không?

Không. Tỷ số chênh so sánh hai odds, tỷ số nguy cơ so sánh hai xác suất. Khi kết cục phổ biến, tỷ số chênh xa 1 hơn và không nên diễn giải là “nguy cơ gấp n lần”.

Exp(B) trong SPSS là gì?

Là hàm mũ của hệ số hồi quy logistic, chính là tỷ số chênh. Hệ số B nằm trên thang log-odds, còn Exp(B) cho biết odds thay đổi bao nhiêu lần.

Hồi quy logistic cần cỡ mẫu bao nhiêu?

Thông tin bị giới hạn bởi số ca ở nhóm kết cục nhỏ hơn. Quy tắc kinh nghiệm cũ là khoảng 10 ca mỗi tham số, nhưng tốt hơn nên tính cỡ mẫu cụ thể theo bối cảnh.

Làm sao đánh giá mô hình logistic tốt hay không?

Xem khả năng phân biệt qua AUC, hiệu chuẩn qua biểu đồ hoặc kiểm định, và tính hợp lý của hệ số. Pseudo R bình phương không nên dùng làm thước đo chính.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

🧭
Bạn đang ở chặng nào của đường học vị?
Nhập chỗ bạn đang đứng và đích bạn nhắm — công cụ trả về số năm, chi phí và việc phải làm từng chặng.
Xem lộ trình của tôi →
Miễn phí, không cần tài khoản. Xem tất cả công cụ

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.

hoặc
info@fesk.com