Một nhóm nghiên cứu phát hiện hệ số Cronbach alpha của thang đo động lực chỉ đạt 0,41, trong khi các nghiên cứu khác báo trên 0,80. Họ tính đến chuyện bỏ thang đo. Hoá ra ba câu hỏi viết theo chiều ngược (“Tôi thấy việc học thật nhàm chán”) chưa được đảo điểm. Đảo xong, alpha lên 0,84. Họ may mắn phát hiện sớm; nhiều bài khác đi đến phản biện với lỗi tương tự còn nguyên.
Làm sạch dữ liệu không hấp dẫn, ít được dạy, và gần như không bao giờ được mô tả kỹ trong bài báo. Nhưng đây là bước quyết định các con số bạn báo cáo có đáng tin hay không.
Nguyên tắc số một: không bao giờ sửa tệp gốc
Giữ tệp dữ liệu gốc (xuất thẳng từ công cụ khảo sát hoặc nhập liệu) ở chế độ chỉ đọc. Mọi thay đổi được thực hiện bằng cú pháp hoặc mã (SPSS syntax, R, Python, Stata do-file) tạo ra một tệp sạch mới. Khi phát hiện sai ở bước nào, bạn sửa mã và chạy lại, không phải nhớ lại mình đã bấm gì trong bảng tính.
Nếu bắt buộc phải sửa tay (ví dụ đối chiếu phiếu giấy), ghi từng thay đổi vào nhật ký: mã phiếu, biến, giá trị cũ, giá trị mới, lý do, ngày, người sửa.
Sổ mã biến: viết trước khi làm sạch
Sổ mã biến (codebook) mô tả mỗi biến một dòng. Các cột tối thiểu:
| Cột | Ví dụ |
|---|---|
| Tên biến | mot_03 |
| Nội dung câu hỏi | Tôi thấy việc học thật nhàm chán |
| Thang đo và mã | 1 = Hoàn toàn không đồng ý … 5 = Hoàn toàn đồng ý |
| Chiều | Ngược, cần đảo điểm |
| Mã giá trị thiếu | 99 = không trả lời, 98 = không áp dụng |
| Khoảng hợp lệ | 1–5 |
| Thuộc thang đo | Động lực nội tại |
Sổ mã biến vừa là bảng kiểm khi làm sạch, vừa là tài liệu bắt buộc nếu bạn chia sẻ dữ liệu. Viết nó từ bảng hỏi trước khi mở dữ liệu, để bạn không vô thức điều chỉnh theo những gì dữ liệu cho thấy.
Tám bước kiểm tra theo thứ tự
- Đếm dòng và mã định danh: số phiếu có khớp số bạn nghĩ đã thu không; mã định danh có trùng không.
- Phiếu trùng: cùng người nộp hai lần, thường thấy qua dấu thời gian sát nhau và câu trả lời giống hệt. Giữ bản đầy đủ hơn hoặc bản đầu tiên, theo quy tắc định trước.
- Đồng ý tham gia và tiêu chí chọn: loại những người không đồng ý hoặc không thuộc đối tượng (sai năm học, dưới tuổi).
- Giá trị ngoài khoảng hợp lệ: 6 trên thang 1–5, tuổi 250, số giờ học mỗi tuần 300. Kiểm bằng bảng tần số và giá trị nhỏ nhất, lớn nhất của từng biến.
- Mã giá trị thiếu: đổi 99, 98 thành giá trị thiếu thật trước khi tính bất cứ gì. Để 99 lẫn vào trung bình là lỗi kinh điển.
- Đảo điểm câu ngược: trên thang 1–5, điểm mới = 6 − điểm cũ. Kiểm tra lại bằng tương quan: sau khi đảo, câu ngược phải tương quan dương với các câu cùng thang.
- Tính biến tổng hợp: điểm thang đo, nhóm tuổi. Quy định trước cách xử lý khi thiếu một vài câu.
- Kiểm tra logic chéo: người “chưa từng đi làm” nhưng báo thu nhập từ công việc; sinh viên năm nhất nhưng đã học 5 năm.
Người trả lời cẩu thả: phát hiện có quy tắc
Khảo sát trực tuyến, đặc biệt khi có quà tặng, luôn có một phần người trả lời cho xong. Các dấu hiệu thường dùng:
- Thời gian hoàn thành quá ngắn so với thời gian đọc tối thiểu. Đặt ngưỡng trước, ví dụ dưới một phần ba trung vị thời gian.
- Trả lời thẳng hàng (straightlining): chọn cùng một mức cho mọi câu trong khối, kể cả câu ngược chiều.
- Câu kiểm tra chú ý: “Với câu này, xin chọn Đồng ý”. Nên đặt khi thiết kế bảng hỏi.
- Câu trả lời mở vô nghĩa: chuỗi ký tự ngẫu nhiên, sao chép câu hỏi.
Quy tắc loại phải được ghi trước khi nhìn kết quả phân tích, và báo cáo số người bị loại theo từng lý do. Loại người trả lời sau khi thấy họ làm “hỏng” kết quả là thao túng dữ liệu.
Giá trị ngoại lai: phân biệt lỗi với dữ liệu thật
Không phải giá trị cực đoan nào cũng là lỗi. Hãy chia ba nhóm:
- Lỗi không thể (tuổi 250): sửa nếu có nguồn gốc để đối chiếu, không thì chuyển thành giá trị thiếu.
- Có thể nhưng đáng ngờ (học 90 giờ mỗi tuần): kiểm tra các câu liên quan; quyết định theo quy tắc định trước.
- Thật nhưng cực đoan (thu nhập rất cao): giữ lại; xử lý bằng phân tích phù hợp như biến đổi log, phương pháp vững, hoặc báo cáo phân tích độ nhạy có và không có các giá trị này.
Tránh các quy tắc máy móc kiểu “loại mọi giá trị cách trung bình quá ba độ lệch chuẩn” mà không xem xét bản chất biến; với phân phối lệch, quy tắc đó loại oan dữ liệu thật.
Viết phần làm sạch trong bài báo
Một đoạn ngắn trong phần Phương pháp là đủ: tổng số phiếu nhận được, số bị loại theo từng lý do (không đồng ý, không đủ điều kiện, trùng, cẩu thả), số còn lại để phân tích, cách xử lý câu ngược và giá trị thiếu. Một sơ đồ dòng chảy nhỏ giống sơ đồ PRISMA giúp người đọc thấy ngay.
Áp dụng thực tế: bộ tệp tối thiểu cho mỗi dự án
- Thư mục gốc: tệp dữ liệu xuất thẳng, đặt chỉ đọc.
- Sổ mã biến viết từ bảng hỏi.
- Tệp mã làm sạch, chia thành các khối theo tám bước ở trên, mỗi khối có chú thích.
- Nhật ký quyết định: quy tắc loại, ngưỡng thời gian, cách xử lý ngoại lai, ngày quyết định.
- Tệp dữ liệu sạch do mã tạo ra, đặt tên có ngày.
- Bảng tóm tắt số phiếu qua từng bước lọc, dùng thẳng cho phần Phương pháp.
Việc làm tiếp theo: mở tệp dữ liệu bạn đang phân tích, chạy bảng tần số cho mọi biến thang đo và tìm giá trị 0, 98, 99 hay bất cứ số nào ngoài khoảng hợp lệ. Nếu tìm thấy dù chỉ một, hãy dừng phân tích và viết mã làm sạch trước.
Câu hỏi thường gặp
Làm sạch dữ liệu khảo sát gồm những bước nào?
Thường gồm kiểm số phiếu và mã định danh, loại phiếu trùng, áp tiêu chí chọn, kiểm giá trị ngoài khoảng, mã hoá giá trị thiếu, đảo câu ngược, tính biến tổng hợp và kiểm logic chéo.
Có nên sửa trực tiếp trong tệp Excel gốc không?
Không. Giữ tệp gốc chỉ đọc và thực hiện mọi thay đổi bằng cú pháp hoặc mã để có thể chạy lại và giải thích từng bước.
Làm sao phát hiện người trả lời khảo sát cẩu thả?
Dùng thời gian hoàn thành quá ngắn, trả lời thẳng hàng một mức, câu kiểm tra chú ý và câu trả lời mở vô nghĩa, với ngưỡng đặt trước khi phân tích.
Có nên loại mọi giá trị ngoại lai không?
Không. Chỉ sửa hoặc loại giá trị là lỗi; giá trị thật nhưng cực đoan nên giữ lại và xử lý bằng phương pháp phù hợp hoặc phân tích độ nhạy.
Có cần báo cáo quá trình làm sạch dữ liệu trong bài báo không?
Có. Nêu tổng số phiếu, số bị loại theo từng lý do, số còn lại và cách xử lý câu ngược, giá trị thiếu trong phần Phương pháp.