Một học viên dùng bộ dữ liệu khảo sát hộ gia đình quốc gia để tính tỷ lệ trẻ em đi học mẫu giáo theo vùng. Kết quả của anh chênh vài điểm phần trăm so với báo cáo chính thức từ cùng bộ dữ liệu. Nguyên nhân: anh không áp trọng số mẫu, trong khi khảo sát cố ý lấy nhiều hộ hơn ở vùng dân cư thưa để có đủ quan sát. Thêm vào đó, giá trị 98 (“không biết”) được anh tính như một con số thật.
Dữ liệu thứ cấp (secondary data) là dữ liệu do người khác thu thập cho mục đích khác. Nó cho phép học viên và nghiên cứu sinh làm việc với cỡ mẫu và phạm vi không thể tự thu. Cái giá là bạn phải hiểu cách dữ liệu được tạo ra trước khi đụng tới nó.
Khi nào dữ liệu thứ cấp là lựa chọn tốt
- Câu hỏi cần mẫu đại diện quy mô lớn hoặc theo dõi nhiều năm.
- Thu thập mới quá tốn kém hoặc gây phiền cho nhóm đối tượng dễ tổn thương.
- Bạn muốn so sánh giữa các nước bằng một công cụ đo thống nhất.
Giới hạn: bạn không chọn được câu hỏi. Nếu khái niệm trung tâm của đề tài không có biến đo phù hợp, đừng ép một biến gần giống vào chỗ đó. Hãy xem trước danh mục biến, rồi mới chốt câu hỏi nghiên cứu, không làm ngược lại.
Tìm nguồn và điều kiện truy cập
Các nguồn hay dùng gồm: kho dữ liệu của cơ quan thống kê quốc gia, các chương trình khảo sát quốc tế như Demographic and Health Surveys (DHS), các kho lưu trữ dữ liệu khoa học xã hội như ICPSR hay UK Data Service, kho dữ liệu mở của các tổ chức quốc tế, và kho dữ liệu kèm theo bài báo (Dryad, Zenodo, OSF).
Điều kiện truy cập chia thành ba mức: tải về tự do; đăng ký tài khoản và mô tả mục đích; ký thoả thuận sử dụng dữ liệu có ràng buộc về lưu trữ và công bố. Mức thứ ba có thể mất vài tuần, nên nộp đơn ngay khi chốt đề tài. Đọc kỹ thoả thuận: nhiều bộ dữ liệu cấm chia sẻ lại tệp gốc, cấm cố gắng xác định danh tính, và yêu cầu gửi bản sao công bố.
Đọc sổ mã trước khi mở tệp dữ liệu
Sổ mã (codebook) và báo cáo phương pháp là hai tài liệu phải đọc trước. Những điều cần tìm:
- Đơn vị quan sát: mỗi dòng là cá nhân, hộ, hay cơ sở? Nhiều bộ dữ liệu có nhiều tệp ở các cấp khác nhau cần ghép bằng mã định danh.
- Câu hỏi gốc của từng biến, đúng như được hỏi, kèm hướng dẫn cho điều tra viên.
- Bước nhảy (skip pattern): ai được hỏi câu này? Biến “số giờ làm thêm” có thể chỉ hỏi người có việc làm, nên giá trị trống ở người thất nghiệp không phải là dữ liệu thiếu.
- Mã đặc biệt: 97, 98, 99, −9 hay 9999 thường nghĩa là từ chối, không biết, không áp dụng.
- Thiết kế mẫu: phân tầng, chọn cụm, biến trọng số tên gì và dùng cho phân tích nào.
Mã giá trị thiếu: lỗi im lặng tốn kém nhất
Phần mềm không biết 98 nghĩa là “không biết”. Nếu biến tuổi có vài quan sát bằng 98 do mã hoá “không rõ”, trung bình tuổi sẽ bị kéo lên mà không có cảnh báo nào. Trước mọi phân tích, chạy bảng tần suất cho từng biến dùng tới và tìm những giá trị bất thường ở hai đầu. Sau đó mã hoá lại chúng thành giá trị thiếu một cách tường minh trong mã phân tích, không sửa tay trong tệp.
Trọng số và thiết kế mẫu phức hợp
Các khảo sát lớn hiếm khi là mẫu ngẫu nhiên đơn giản. Chúng thường phân tầng theo vùng, chọn cụm theo địa bàn, và lấy thừa một số nhóm nhỏ. Hệ quả:
| Bỏ qua điều gì | Hậu quả | Cách xử lý |
|---|---|---|
| Trọng số mẫu | Ước lượng tỷ lệ, trung bình bị lệch về nhóm bị lấy thừa | Áp đúng biến trọng số mà sổ mã chỉ định |
| Phân tầng và cụm | Sai số chuẩn quá nhỏ, giá trị p nhỏ giả tạo | Khai báo thiết kế: gói survey trong R, lệnh svy trong Stata, mô-đun Complex Samples trong SPSS |
| Phân tích nhóm con | Loại quan sát trước khi khai báo thiết kế làm sai sai số | Dùng hàm phân tích nhóm con của gói survey thay vì xoá dòng |
Một số khảo sát có nhiều biến trọng số: cho hộ, cho cá nhân, cho mô-đun phụ chỉ hỏi một phần mẫu. Dùng nhầm trọng số cũng sai như không dùng.
Ghép nhiều đợt khảo sát
Muốn xem xu hướng qua nhiều năm, bạn sẽ gặp các vấn đề: câu hỏi được sửa cách diễn đạt, thang đo đổi từ năm mức thành bốn mức, ranh giới hành chính thay đổi, mã ngành nghề cập nhật theo phân loại mới. Hãy lập một bảng hài hoà hoá: mỗi biến một dòng, mỗi đợt một cột, ghi tên biến gốc, câu hỏi, mã giá trị và cách bạn quy đổi. Bảng này nên được đưa vào phụ lục.
Phân biệt dữ liệu cắt ngang lặp lại (mỗi đợt một mẫu mới) với dữ liệu bảng (panel, theo dõi cùng người). Chỉ dữ liệu bảng mới cho phép nói về thay đổi ở cấp cá nhân.
Quy trình làm việc tái lập được
- Giữ nguyên tệp gốc trong một thư mục chỉ đọc.
- Mọi thao tác làm sạch, mã hoá lại, ghép tệp nằm trong một tệp mã (R, Stata, Python hoặc cú pháp SPSS), không thao tác bằng chuột.
- Đầu tệp mã ghi rõ tên, phiên bản và ngày tải bộ dữ liệu.
- Kiểm tra lại kết quả của mình với một con số đã công bố trong báo cáo chính thức. Nếu tái tạo được con số đó, bạn đã áp trọng số và thiết kế đúng.
Bước 4 là phép thử rẻ nhất và đáng tin nhất. Nếu con số của bạn lệch báo cáo, dừng lại tìm nguyên nhân trước khi chạy bất kỳ mô hình nào.
Trích dẫn dữ liệu và viết phần phương pháp
Bộ dữ liệu cần được trích dẫn như một công trình, thường có DOI hoặc định dạng trích dẫn do đơn vị cung cấp chỉ định. Phần phương pháp nên nêu: nguồn và phiên bản, thiết kế mẫu gốc, cỡ mẫu phân tích sau khi loại trừ và lý do loại, cách xử lý giá trị thiếu, biến trọng số và phương pháp tính sai số chuẩn. Nếu thoả thuận dữ liệu không cho chia sẻ tệp, hãy chia sẻ mã phân tích để người khác có quyền truy cập làm lại được.
Việc nên làm trong tuần này: tải sổ mã của bộ dữ liệu bạn định dùng, tìm năm biến trung tâm, đọc câu hỏi gốc và bước nhảy của từng biến. Nếu một biến không đo đúng khái niệm của bạn, bây giờ là lúc điều chỉnh câu hỏi nghiên cứu, không phải sau khi đã chạy xong mô hình.
Câu hỏi thường gặp
Dữ liệu thứ cấp là gì?
Là dữ liệu do cá nhân hay tổ chức khác thu thập cho mục đích riêng của họ, được bạn dùng lại để trả lời câu hỏi nghiên cứu mới. Ví dụ phổ biến là các khảo sát quốc gia, dữ liệu hành chính và dữ liệu mở kèm bài báo.
Luận văn dùng dữ liệu thứ cấp có được đánh giá thấp hơn không?
Không nhất thiết. Giá trị của luận văn nằm ở câu hỏi và chất lượng phân tích. Tuy nhiên bạn phải chứng minh hiểu rõ cách dữ liệu được thu và xử lý đúng thiết kế mẫu.
Không dùng trọng số mẫu thì sao?
Các ước lượng như tỷ lệ và trung bình có thể bị lệch về những nhóm được lấy mẫu nhiều hơn, và sai số chuẩn có thể bị tính sai. Hãy dùng đúng biến trọng số và khai báo thiết kế mẫu theo hướng dẫn của sổ mã.
Sổ mã (codebook) gồm những gì?
Thường gồm tên và nhãn biến, câu hỏi gốc, các giá trị và ý nghĩa của chúng, mã giá trị thiếu, điều kiện hỏi và thông tin về thiết kế mẫu. Đây là tài liệu phải đọc trước khi mở tệp dữ liệu.
Có cần xin phép đạo đức khi dùng dữ liệu thứ cấp không?
Tuỳ quy định của trường và loại dữ liệu. Dữ liệu công khai đã ẩn danh thường được miễn hoặc xét rút gọn, nhưng dữ liệu có thông tin nhạy cảm hay có thể xác định danh tính thường cần phê duyệt. Hãy hỏi hội đồng đạo đức của trường.