Một khảo sát 300 hộ gia đình báo cáo “thu nhập trung bình 25 triệu đồng mỗi tháng”. Đọc kỹ dữ liệu mới thấy trung vị chỉ khoảng 12 triệu: vài hộ có thu nhập rất cao kéo trung bình lên gấp đôi. Câu “thu nhập trung bình 25 triệu” không sai về số học, nhưng khiến người đọc hình dung sai hoàn toàn về một hộ điển hình.
Thống kê mô tả thường bị coi là phần dễ, viết cho xong trước khi vào phần “thật”. Thực ra đây là chỗ phản biện kiểm tra đầu tiên xem tác giả có hiểu dữ liệu của mình không. Một Bảng 1 trình bày sai khiến mọi phân tích sau đó bị đọc với con mắt nghi ngờ.
Nhìn dữ liệu trước khi tính
Trước khi tính bất kỳ con số nào, vẽ biểu đồ tần suất (histogram) hoặc biểu đồ hộp (boxplot) cho từng biến liên tục. Ba câu hỏi cần trả lời:
- Phân phối có lệch rõ không? Thu nhập, thời gian nằm viện, số lượt trích dẫn, nồng độ sinh hoá thường lệch phải.
- Có giá trị bất thường không, và đó là lỗi nhập liệu hay giá trị thật? Tuổi 250 là lỗi; thu nhập 500 triệu có thể là thật.
- Có đống dữ liệu dồn ở một giá trị không? Nhiều số 0, hoặc dồn ở mức tối đa của thang đo (hiệu ứng trần).
Mười phút nhìn biểu đồ thường phát hiện những lỗi mà mười trang bảng không cho thấy.
Trung bình hay trung vị
| Tình huống | Thước đo trung tâm | Thước đo phân tán |
|---|---|---|
| Phân phối gần đối xứng, không có giá trị cực đoan | Trung bình | Độ lệch chuẩn (SD) |
| Phân phối lệch rõ hoặc có giá trị cực đoan | Trung vị | Khoảng tứ phân vị (IQR, từ phân vị 25 đến 75) |
| Thang đo thứ bậc ít mức (ví dụ Likert 5 mức, từng câu) | Trung vị hoặc phân bố tần suất | IQR hoặc tỷ lệ từng mức |
| Cỡ mẫu rất nhỏ | Trung vị, kèm giá trị nhỏ nhất và lớn nhất | Khoảng (min–max) |
Mẹo kiểm tra nhanh: với biến không thể âm (thời gian, chi phí), nếu SD lớn hơn khoảng một nửa trung bình, phân phối gần như chắc chắn lệch. Ví dụ thời gian nằm viện trung bình 6 ngày, SD 9 ngày: không thể có phân phối đối xứng quanh 6 với SD 9 mà không có giá trị âm. Hãy báo cáo trung vị và IQR.
SD và SE: hai thứ khác hẳn nhau
Độ lệch chuẩn (SD) mô tả các cá thể trong mẫu phân tán thế nào quanh trung bình. Sai số chuẩn của trung bình (SE) mô tả ước lượng trung bình dao động thế nào nếu lặp lại việc lấy mẫu. Công thức: SE = SD / √n.
Ví dụ: 100 sinh viên có điểm trung bình 7,0, SD 1,0. SE = 1,0 / 10 = 0,1. Viết “7,0 ± 0,1” khiến người đọc tưởng điểm của sinh viên gần như đồng đều, trong khi thực tế phần lớn sinh viên nằm trong khoảng 6 đến 8.
Quy tắc: mô tả mẫu thì dùng SD; nói về độ chính xác của ước lượng thì dùng khoảng tin cậy, tốt hơn SE vì dễ hiểu hơn. Và luôn ghi rõ con số sau dấu ± là SD hay SE, vì nhiều tạp chí trả bài về chỉ vì điểm này.
Biến phân loại: luôn có mẫu số
- Báo cáo dạng n (%) với cả số lượng và tỷ lệ, ví dụ 84 (42%).
- Khi có dữ liệu thiếu, ghi rõ mẫu số: “84/196 (43%)” hoặc thêm dòng “thiếu dữ liệu” trong bảng. Tỷ lệ tính trên 200 hay trên 196 là hai con số khác nhau.
- Với câu hỏi chọn nhiều đáp án, tổng tỷ lệ có thể vượt 100%; ghi chú điều này dưới bảng.
- Không báo cáo phần trăm cho nhóm quá nhỏ mà không kèm số đếm: “50%” của 4 người là 2 người.
Chữ số thập phân: chính xác giả là một lỗi
Báo cáo tuổi trung bình 34,5271 năm không làm nghiên cứu chính xác hơn, chỉ làm bảng khó đọc. Hướng dẫn chung: trung bình và SD lấy nhiều hơn độ chính xác đo đạc một chữ số; phần trăm với mẫu dưới vài trăm thường chỉ cần số nguyên; giá trị p báo cáo hai hoặc ba chữ số, và viết “p < 0,001” khi rất nhỏ. Bài tiếng Việt dùng dấu phẩy thập phân; bài tiếng Anh dùng dấu chấm. Thống nhất trong toàn bài.
Bảng 1: bảng đặc điểm mẫu
Bảng 1 mô tả ai có trong nghiên cứu. Cấu trúc thông dụng: mỗi dòng một biến, cột là toàn mẫu và các nhóm so sánh. Một số điểm người trong nghề chú ý:
- Ghi rõ cách trình bày ở đầu cột hoặc chú thích: “trung bình (SD), trung vị [IQR] hoặc n (%)”.
- Với thử nghiệm ngẫu nhiên, không kiểm định sự khác biệt ban đầu giữa các nhóm bằng giá trị p. Nếu phân nhóm ngẫu nhiên đúng, mọi khác biệt ban đầu đều do ngẫu nhiên, và CONSORT khuyến cáo không làm việc này. Hãy xem độ lớn khác biệt thay vì p.
- Với nghiên cứu quan sát, có thể báo cáo khác biệt chuẩn hoá (standardized difference) để cho thấy các nhóm lệch nhau đến đâu.
- Sắp xếp biến có logic: nhân khẩu học trước, rồi đặc điểm lâm sàng hoặc học thuật, rồi biến phơi nhiễm.
Áp dụng: danh sách kiểm tra phần thống kê mô tả
- Đã vẽ histogram hoặc boxplot cho mọi biến liên tục.
- Đã kiểm tra giá trị bất thường và ghi lại cách xử lý.
- Biến lệch được báo cáo bằng trung vị [IQR], biến đối xứng bằng trung bình (SD).
- Mọi dấu ± đều ghi rõ là SD.
- Biến phân loại có cả n và %, có mẫu số khi thiếu dữ liệu.
- Số chữ số thập phân thống nhất và hợp lý.
- Bảng 1 có chú thích cách trình bày, không có p-value so sánh ban đầu nếu là thử nghiệm ngẫu nhiên.
- Con số trong văn bản khớp với con số trong bảng.
Mục cuối cùng tưởng hiển nhiên nhưng là lỗi phản biện bắt được thường xuyên nhất, nhất là sau khi bảng được cập nhật mà văn bản thì chưa.
Việc làm tiếp theo: mở bộ dữ liệu của bạn, vẽ histogram cho từng biến liên tục trước khi tính bất cứ gì, và đánh dấu biến nào cần trung vị. Phần mô tả đúng ngay từ đầu giúp mọi phân tích phía sau được đọc với niềm tin.
Câu hỏi thường gặp
Khi nào dùng trung vị thay cho trung bình?
Khi phân phối lệch rõ hoặc có giá trị cực đoan, như thu nhập, chi phí, thời gian nằm viện. Khi đó báo cáo trung vị kèm khoảng tứ phân vị.
SD và SE khác nhau thế nào?
SD mô tả các cá thể trong mẫu phân tán quanh trung bình. SE mô tả độ chính xác của ước lượng trung bình và bằng SD chia căn bậc hai cỡ mẫu. Mô tả mẫu thì dùng SD.
Bảng 1 có cần giá trị p không?
Với thử nghiệm ngẫu nhiên thì không, vì khác biệt ban đầu là do ngẫu nhiên và CONSORT khuyến cáo không kiểm định. Với nghiên cứu quan sát, khác biệt chuẩn hoá thường có ích hơn p.
Nên báo cáo bao nhiêu chữ số thập phân?
Trung bình và SD thường lấy nhiều hơn độ chính xác đo đạc một chữ số; phần trăm với mẫu nhỏ chỉ cần số nguyên. Quan trọng nhất là thống nhất trong toàn bài.
Thang Likert nên báo cáo trung bình hay trung vị?
Với từng câu Likert ít mức, trung vị hoặc phân bố tần suất phản ánh dữ liệu trung thực hơn. Với điểm tổng của nhiều câu, trung bình và SD thường được chấp nhận.