Một nghiên cứu sinh nhờ trợ lý AI viết mã R để ghép dữ liệu khảo sát với điểm thi, rồi chạy hồi quy. Mã chạy trơn tru, bảng kết quả đẹp. Ba tuần sau cô mới phát hiện phép ghép đã nhân đôi những sinh viên có hai bản ghi điểm, cỡ mẫu từ 412 thành 538, và mọi sai số chuẩn đều nhỏ hơn thực tế. Không có dòng cảnh báo nào. Mã chạy được và mã đúng là hai chuyện khác nhau.
Trợ lý AI tạo sinh là công cụ viết mã rất mạnh, đặc biệt với người không xuất thân lập trình. Nhưng nó làm dịch chuyển rủi ro: từ “không biết viết mã” sang “không biết mã đang làm gì”.
Việc gì an toàn, việc gì rủi ro
| Việc | Mức rủi ro | Vì sao |
|---|---|---|
| Giải thích một thông báo lỗi | Thấp | Bạn kiểm được ngay bằng cách chạy lại |
| Viết mã vẽ biểu đồ | Thấp | Sai thường nhìn thấy được |
| Giải thích ý nghĩa một bảng kết quả | Trung bình | Dễ bị diễn giải quá mức hoặc nhầm tham số |
| Làm sạch, ghép, tái mã hoá dữ liệu | Cao | Lỗi âm thầm, không báo gì |
| Chọn phương pháp thống kê | Cao | Đề xuất nghe hợp lý nhưng có thể sai giả định với thiết kế của bạn |
| Tải dữ liệu thật lên để AI “phân tích giúp” | Rất cao | Rủi ro dữ liệu cá nhân, và bạn không thấy các bước trung gian |
Những lỗi âm thầm hay gặp nhất
- Ghép bảng sai khoá: nhân bản dòng hoặc làm mất dòng không khớp mà không báo.
- Xử lý giá trị thiếu mặc định: nhiều hàm tự loại mọi dòng có giá trị thiếu, cỡ mẫu từng mô hình khác nhau mà bạn không để ý.
- Mã hoá ngược thang đo: câu hỏi đảo chiều không được đảo lại, hoặc bị đảo hai lần.
- Kiểu biến sai: biến phân loại được mã bằng số bị coi là biến liên tục.
- Nhóm tham chiếu không như bạn nghĩ: diễn giải hệ số ngược với thực tế.
- Gói phần mềm không tồn tại hoặc hàm bị bịa: lỗi này dễ thấy vì mã không chạy, nhưng đôi khi AI gợi ý một gói có tên gần giống gói thật, và cài nhầm gói lạ là rủi ro bảo mật.
Mô tả dữ liệu mà không tải dữ liệu thật lên
Bạn hiếm khi cần đưa dữ liệu thật cho AI để nhận được mã tốt. Thay vào đó:
- Mô tả cấu trúc: tên biến, kiểu biến, ý nghĩa, cách mã hoá, cách ký hiệu giá trị thiếu.
- Tạo vài dòng dữ liệu giả có cùng cấu trúc (hoặc nhờ AI tạo) để thử mã.
- Nêu rõ thiết kế: đo lặp, dữ liệu phân tầng theo lớp và trường, hay mẫu độc lập.
- Chạy mã trên máy của bạn, với dữ liệu thật.
Cách này vừa tránh đưa dữ liệu người tham gia ra ngoài (điều mà phiếu đồng ý của bạn gần như chắc chắn không cho phép), vừa buộc bạn hiểu rõ dữ liệu của mình.
Quy trình kiểm tra sau mỗi bước
- Đếm dòng trước và sau mỗi bước làm sạch, ghép, lọc. Ghi ra: “sau khi ghép: 412 dòng, đúng bằng số sinh viên”.
- Xem vài dòng cụ thể trước và sau khi tái mã hoá, so bằng mắt.
- Kiểm bằng trường hợp đã biết đáp án: chạy mã trên dữ liệu giả mà bạn đã biết kết quả đúng (ví dụ trung bình hai nhóm chênh đúng 5 điểm).
- Đối chiếu với công cụ khác: tính một thống kê mô tả đơn giản bằng tay hoặc bằng phần mềm khác.
- Đọc từng dòng mã và hỏi AI giải thích dòng nào bạn không hiểu. Nếu vẫn không hiểu, đừng dùng dòng đó.
Nguyên tắc cuối là quan trọng nhất: bạn phải giải thích được mọi dòng mã trong phân tích của mình trước hội đồng hay phản biện. “Trợ lý AI viết như vậy” không phải câu trả lời.
Chọn phương pháp: hỏi để học, không hỏi để quyết
AI hữu ích khi bạn muốn biết các lựa chọn: “Với dữ liệu đo lặp ba thời điểm trên cùng học sinh, những phương pháp nào thường được dùng và mỗi phương pháp giả định gì?”. Nó kém tin cậy hơn khi bạn hỏi “tôi nên dùng phương pháp nào?”, vì nó không biết những điều bạn chưa nói ra về dữ liệu. Sau khi có danh sách, hãy đọc một nguồn đáng tin (giáo trình, bài phương pháp) về lựa chọn cuối cùng, và hỏi người hướng dẫn hay chuyên gia thống kê nếu có.
Một cách hỏi hiệu quả: mô tả thiết kế, rồi yêu cầu AI nêu những giả định mà mỗi phương pháp đòi hỏi và cách kiểm từng giả định trên dữ liệu của bạn. Danh sách giả định đó thường là phần có giá trị nhất của câu trả lời.
Nguy cơ p-hacking quy mô lớn
Khi viết mã mất vài giây, thử hai mươi mô hình trở nên dễ như thử một. Đó là cánh cửa cho p-hacking mà không hề có ý định. Hãy viết kế hoạch phân tích trước, lưu nhật ký các mô hình đã chạy, và báo cáo phân tích khám phá đúng tên của nó.
Khai báo trong phần phương pháp
Nhiều tạp chí yêu cầu hoặc khuyến khích nêu việc dùng AI trong phân tích. Một câu mẫu: “Mã phân tích được viết bằng R 4.4 với sự hỗ trợ của một trợ lý AI tạo sinh trong việc soạn mã ban đầu; toàn bộ mã đã được tác giả kiểm tra, chạy lại và xác minh trên dữ liệu mô phỏng. Mã được lưu tại …”. Chia sẻ mã là cách tốt nhất để việc dùng AI không còn là điều người đọc phải đoán.
Danh sách kiểm tra trước khi đưa kết quả vào bài
- Cỡ mẫu ở mỗi bảng khớp với số người tham gia sau loại trừ.
- Chiều của các thang đo đảo ngược đã được kiểm.
- Nhóm tham chiếu và đơn vị của hệ số đã được xác nhận.
- Mọi dòng mã bạn đều giải thích được.
- Mã chạy lại từ đầu ra đúng những con số trong bản thảo.
Việc nên làm tiếp: lấy đoạn mã do AI viết gần nhất bạn đang dùng, thêm lệnh đếm số dòng sau mỗi bước xử lý và chạy lại. Nếu con số nào làm bạn bất ngờ, đó là nơi cần xem kỹ trước khi gửi bài.
Câu hỏi thường gặp
Có được dùng trợ lý AI viết mã phân tích cho luận văn không?
Thường là được nếu quy định của trường cho phép, nhưng bạn phải hiểu và giải thích được mọi dòng mã, kiểm tra kết quả và khai báo việc dùng AI khi được yêu cầu.
Có nên tải file dữ liệu khảo sát lên trợ lý AI không?
Không nên với dữ liệu thật có thông tin người tham gia. Hãy mô tả cấu trúc dữ liệu hoặc dùng dữ liệu giả để nhận mã, rồi chạy mã trên máy của bạn.
Làm sao biết mã do AI viết là đúng?
Đếm số dòng sau mỗi bước, xem vài dòng trước và sau khi xử lý, chạy thử trên dữ liệu giả đã biết đáp án và đối chiếu một vài thống kê với công cụ khác.
AI có chọn phương pháp thống kê thay mình được không?
Không nên. AI giúp liệt kê lựa chọn và giả định của chúng, nhưng quyết định cần dựa trên thiết kế nghiên cứu của bạn và được kiểm với tài liệu hoặc chuyên gia.
Có phải khai báo dùng AI trong phần phương pháp không?
Nhiều tạp chí yêu cầu hoặc khuyến khích. Một câu nêu công cụ được dùng vào việc gì và cách bạn kiểm tra mã là đủ, tốt nhất kèm đường dẫn tới mã đã chia sẻ.