Một nhóm chạy thí điểm chương trình can thiệp trên 15 người mỗi nhóm, thấy hiệu ứng d = 0,8, rồi dùng con số đó tính cỡ mẫu cho nghiên cứu chính: 26 người mỗi nhóm. Nghiên cứu chính không cho kết quả có ý nghĩa. Trong khi đó, dữ liệu thí điểm có một chi tiết không ai để ý: 6 trên 15 người ở nhóm can thiệp bỏ buổi thứ ba vì trùng giờ làm.
Nghiên cứu thí điểm (pilot study) bị hiểu sai theo đúng hướng đó: người ta nhìn vào con số hiệu quả mà bỏ qua thứ nó thật sự đo được — nghiên cứu chính có chạy nổi hay không.
Câu hỏi đúng của thí điểm: “làm được không”, không phải “có hiệu quả không”
Thí điểm là bản chạy thử thu nhỏ của nghiên cứu chính, để tìm những chỗ sẽ hỏng trước khi bỏ ra toàn bộ thời gian và kinh phí. Các câu hỏi nó trả lời được:
- Tuyển được bao nhiêu người mỗi tháng, qua kênh nào, bao nhiêu người đủ điều kiện đồng ý tham gia?
- Bao nhiêu người ở lại đến lần đo cuối?
- Người tham gia có tuân thủ can thiệp không, người thực hiện có làm đúng quy trình không?
- Công cụ đo có hiểu được, có làm xong trong thời gian dự kiến không?
- Quy trình nhập liệu, lưu trữ, phân tích có chạy trơn không?
Cần phân biệt thêm: nghiên cứu khả thi (feasibility study) là khái niệm rộng, hỏi “có nên và có thể làm không”; thí điểm là một dạng khả thi, chạy toàn bộ hoặc một phần quy trình theo đúng kế hoạch; còn thử bảng hỏi (pretest) chỉ kiểm tra công cụ đo. CONSORT có bản mở rộng riêng cho thử nghiệm thí điểm và khả thi, hữu ích khi viết báo cáo.
Đặt tiêu chí đi tiếp trước khi chạy
Một thí điểm không có tiêu chí thành công định trước sẽ luôn được kết luận là “khả thi”. Cách làm tốt là dùng tiêu chí ba mức, kiểu đèn giao thông:
| Chỉ số | Xanh: đi tiếp | Vàng: sửa rồi đi | Đỏ: dừng, thiết kế lại |
|---|---|---|---|
| Tuyển người mỗi tháng | ≥ 12 | 8–11 | < 8 |
| Giữ chân đến lần đo cuối | ≥ 80% | 65–79% | < 65% |
| Tham dự ≥ 75% số buổi | ≥ 70% người | 50–69% | < 50% |
| Hoàn thành đủ bộ đo kết cục chính | ≥ 90% | 75–89% | < 75% |
Các ngưỡng trên chỉ là ví dụ; ngưỡng thật phải suy ngược từ cỡ mẫu và thời gian của nghiên cứu chính. Nếu nghiên cứu chính cần 200 người trong 12 tháng, tuyển 12 người mỗi tháng ở một điểm có nghĩa bạn cần ít nhất hai điểm tuyển.
Sai lầm lớn nhất: dùng hiệu ứng thí điểm để tính cỡ mẫu
Với 15 người mỗi nhóm, hiệu ứng quan sát d = 0,5 có khoảng tin cậy 95% xấp xỉ từ −0,2 đến 1,2. Nghĩa là dữ liệu tương thích với cả “can thiệp gây hại nhẹ” lẫn “hiệu quả rất lớn”. Dùng điểm giữa của khoảng rộng như vậy để tính cỡ mẫu là đánh cược.
Tệ hơn, có hiệu ứng chọn lọc: nhóm nào thí điểm thấy hiệu ứng nhỏ thường bỏ ý tưởng; nhóm thấy hiệu ứng lớn thì đi tiếp. Những nghiên cứu chính được thực hiện vì thế thường dựa trên ước lượng thổi phồng, dẫn đến cỡ mẫu quá nhỏ.
Làm gì thay thế:
- Tính cỡ mẫu từ hiệu ứng nhỏ nhất có ý nghĩa thực tiễn — mức chênh lệch mà người làm nghề coi là đáng thay đổi cách làm.
- Dùng thí điểm để ước lượng độ lệch chuẩn của kết cục, và lấy cận trên khoảng tin cậy của nó (khoảng phân vị 80%) thay vì giá trị điểm, để tránh đánh giá thấp.
- Dùng thí điểm để ước lượng tỷ lệ bỏ cuộc, rồi thổi cỡ mẫu lên tương ứng.
- Với thiết kế cụm, thí điểm giúp có cảm giác về hệ số tương quan nội cụm, nhưng ước lượng từ vài cụm rất bất ổn; nên đối chiếu với giá trị đã công bố.
Và không chạy kiểm định giả thuyết về hiệu quả trên dữ liệu thí điểm. Nếu có báo cáo kết cục, chỉ báo cáo mô tả kèm khoảng tin cậy, ghi rõ là không đủ lực để kết luận.
Thí điểm cần bao nhiêu người?
Cỡ mẫu thí điểm không tính bằng lực thống kê mà bằng độ chính xác cần có cho các chỉ số khả thi. Hai phép tính đơn giản:
- Ước lượng một tỷ lệ: nếu tỷ lệ giữ chân thật khoảng 80%, với 50 người khoảng tin cậy 95% rộng chừng ±11 điểm phần trăm; với 20 người là khoảng ±18 điểm. Hãy hỏi: sai số đó có đủ để quyết định xanh hay đỏ không?
- Phát hiện một vấn đề: nếu một sự cố (hiểu sai câu hỏi, lỗi thiết bị) xảy ra ở 10% người tham gia, cần khoảng 29 người để có 95% khả năng gặp nó ít nhất một lần; với sự cố 5% thì cần khoảng 59 người.
Tài liệu phương pháp thường nhắc vài quy tắc kinh nghiệm, như khoảng 12 người mỗi nhóm để ước lượng độ lệch chuẩn, hoặc khoảng 30 người tổng cộng. Chúng là điểm khởi đầu, không thay được phép tính dựa trên chỉ số bạn thật sự cần.
Thử bảng hỏi bằng phỏng vấn nhận thức
Trước khi phát bảng hỏi cho 50 người, ngồi với 5–8 người và tìm hiểu họ trả lời như thế nào. Mỗi câu trả lời đi qua bốn bước: hiểu câu hỏi, nhớ lại thông tin, cân nhắc, rồi chọn phương án. Lỗi có thể xảy ra ở bất kỳ bước nào.
| Bước | Câu thăm dò mẫu | Lỗi hay lộ ra |
|---|---|---|
| Hiểu câu hỏi | “Theo anh chị, câu này đang hỏi gì?” | Thuật ngữ hiểu khác nhau, câu hai ý |
| Nhớ lại | “Anh chị nghĩ đến khoảng thời gian nào?” | Khung thời gian bị bỏ qua, nhớ không nổi |
| Cân nhắc | “Anh chị tính ra con số đó thế nào?” | Đoán, làm tròn, trả lời theo điều mong muốn |
| Chọn phương án | “Vì sao chọn 4 mà không chọn 5?” | Thiếu phương án, các mức thang không phân biệt |
Có hai kỹ thuật: cho người tham gia nói to suy nghĩ trong lúc làm, hoặc hỏi thăm dò sau từng câu hay cuối phiếu. Nhiều người ngại nói to, nên hỏi thăm dò cụ thể dễ lấy thông tin hơn. Làm theo vòng: 5–8 người, sửa, vòng tiếp theo với người mới, dừng khi vòng cuối không phát hiện vấn đề đáng kể. Ghi kết quả vào một ma trận câu hỏi × người × loại lỗi để thấy câu nào hỏng lặp lại. Chọn cả những người khó nhất: người lớn tuổi, người ít quen đọc, người làm trên điện thoại.
Chạy thử toàn bộ đường đi của dữ liệu
Sau phỏng vấn nhận thức, chạy thử bảng hỏi đã sửa trên 30–50 người theo đúng cách sẽ làm thật, và đo:
- Thời gian hoàn thành trung vị, đo trên điện thoại nếu người trả lời dùng điện thoại.
- Tỷ lệ bỏ dở theo từng trang — chỗ người ta dừng là chỗ có vấn đề.
- Phân phối từng câu: câu nào hơn 80% dồn về một đầu thang gần như không phân biệt được ai với ai.
- Tỷ lệ “không biết” hoặc bỏ trống từng câu.
- Logic nhảy câu có đưa đúng người đến đúng câu không.
Bước bị bỏ nhiều nhất: xuất dữ liệu thí điểm và chạy thử toàn bộ mã phân tích. Đây là lúc phát hiện biến bị mã hoá ngược, thang đo xuất ra dạng chữ thay vì số, mã định danh không khớp giữa hai lần đo.
Những việc không nên làm
- Gộp dữ liệu thí điểm vào nghiên cứu chính khi công cụ hoặc quy trình đã thay đổi.
- Báo cáo thí điểm như bằng chứng về hiệu quả.
- Gọi một nghiên cứu nhỏ không có ý nghĩa thống kê là “thí điểm” sau khi đã làm xong.
- Bỏ qua phê duyệt đạo đức: thí điểm có người tham gia vẫn cần phê duyệt như nghiên cứu chính.
Checklist cho một thí điểm có ích
- Viết ra 4–6 câu hỏi khả thi cụ thể, mỗi câu gắn một chỉ số đo được.
- Đặt ngưỡng xanh – vàng – đỏ cho từng chỉ số, suy ngược từ kế hoạch nghiên cứu chính.
- Tính cỡ mẫu thí điểm theo độ chính xác cần có, không theo lực thống kê.
- Phỏng vấn nhận thức theo vòng trước khi chạy thử trên diện rộng.
- Người thực hiện ghi nhật ký mọi sai lệch khỏi quy trình.
- Chạy thử toàn bộ mã phân tích trên dữ liệu thí điểm.
- Viết báo cáo ngắn: chỉ số khả thi kèm khoảng tin cậy, quyết định, danh sách thay đổi.
Nếu bạn đang chuẩn bị đề cương, hãy thêm một mục “Nghiên cứu thí điểm” với bảng tiêu chí đi tiếp. Hội đồng xét duyệt thường đánh giá cao một đề cương biết trước chỗ nào có thể hỏng và đã có cách kiểm tra.
Câu hỏi thường gặp
Nghiên cứu thí điểm cần bao nhiêu người?
Không có con số chung. Cỡ mẫu thí điểm nên tính theo độ chính xác cần có cho các chỉ số khả thi như tỷ lệ giữ chân hay tỷ lệ tuyển. Các quy tắc kinh nghiệm như khoảng 12 người mỗi nhóm hay 30 người tổng chỉ là điểm khởi đầu.
Có dùng kết quả thí điểm để tính cỡ mẫu nghiên cứu chính được không?
Không nên dùng hiệu ứng quan sát trong thí điểm, vì với mẫu nhỏ khoảng tin cậy rất rộng và ước lượng thường bị thổi phồng. Nên tính từ hiệu ứng nhỏ nhất có ý nghĩa thực tiễn, còn thí điểm dùng để ước lượng độ lệch chuẩn và tỷ lệ bỏ cuộc.
Nghiên cứu thí điểm khác nghiên cứu khả thi thế nào?
Nghiên cứu khả thi là khái niệm rộng, hỏi có nên và có thể làm nghiên cứu hay không. Thí điểm là một dạng khả thi, chạy thử toàn bộ hoặc một phần quy trình theo đúng kế hoạch của nghiên cứu chính.
Phỏng vấn nhận thức là gì và cần bao nhiêu người?
Đó là kỹ thuật cho người trả lời nói to suy nghĩ hoặc trả lời câu thăm dò để biết họ hiểu và trả lời từng câu hỏi ra sao. Thường làm theo vòng 5–8 người, sửa bảng hỏi rồi làm vòng mới cho đến khi không còn lỗi đáng kể.
Dữ liệu thí điểm có được gộp vào nghiên cứu chính không?
Chỉ cân nhắc khi công cụ và quy trình hoàn toàn không đổi và điều đó đã được nêu trong kế hoạch từ đầu. Nếu đã sửa bảng hỏi hay quy trình sau thí điểm thì không gộp, vì dữ liệu hai giai đoạn không còn đo cùng một thứ.