- Tác giả
- Ban Biên tập IESDTD tổng hợp
- Lĩnh vực
- Trí tuệ nhân tạo, Khoa học dữ liệu & Công nghệ số
- Từ khóa
- liêm chính học thuật, AI tạo sinh, phát hiện văn bản AI, đánh giá, đạo văn
Tóm tắt
Các nghiên cứu độc lập cho thấy công cụ phát hiện văn bản do AI viết thiếu chính xác, dễ bị qua mặt và có thể quy kết oan người viết không phải bản ngữ. Bài tổng hợp bằng chứng và giới thiệu hướng thiết kế lại đánh giá, trong đó có Thang đánh giá AI năm mức.
Từ khi ChatGPT xuất hiện cuối năm 2022, câu hỏi được giáo viên và giảng viên đặt ra nhiều nhất có lẽ là: làm sao biết bài này học sinh tự viết hay do AI viết? Nhiều trường đã mua hoặc dùng thử phần mềm "phát hiện AI". Tuy nhiên, các nghiên cứu độc lập đến nay cho thấy cách tiếp cận dựa vào phát hiện có những giới hạn nghiêm trọng, và giới nghiên cứu đánh giá đang chuyển trọng tâm sang thiết kế lại bài kiểm tra.
Công cụ phát hiện AI: thiếu chính xác và dễ qua mặt
Nhóm tác giả do Debora Weber-Wulff dẫn đầu, gồm các nhà nghiên cứu về liêm chính học thuật, đã thử nghiệm 12 công cụ công khai và hai hệ thống thương mại (Turnitin và PlagiarismCheck). Kết quả, đăng trên International Journal for Educational Integrity năm 2023, kết luận rằng các công cụ phát hiện hiện có "không chính xác và cũng không đáng tin cậy", có xu hướng chủ yếu xếp văn bản vào loại "do người viết". Khi văn bản do AI tạo ra được chỉnh sửa thủ công hoặc diễn đạt lại bằng công cụ khác, hiệu quả phát hiện giảm mạnh.
Nói cách khác, công cụ vừa có thể bỏ sót bài do AI viết, vừa có thể – như phần dưới cho thấy – quy kết sai bài do người viết.
Nguy cơ quy kết oan người viết không phải bản ngữ
Nghiên cứu của Weixin Liang, James Zou và cộng sự (Đại học Stanford), đăng trên tạp chí Patterns năm 2023, đánh giá bảy công cụ phát hiện phổ biến với bài viết của người bản ngữ và không phải bản ngữ tiếng Anh. Kết quả:
- Hơn một nửa số bài luận TOEFL do người học tiếng Anh viết bị các công cụ xếp nhầm là "do AI tạo ra", trong khi bài luận của học sinh bản ngữ được nhận diện gần như chính xác.
- Nguyên nhân: văn bản của người viết có vốn từ, cấu trúc hạn chế thường "dễ đoán" hơn (độ hỗn loạn – perplexity – thấp), giống đặc điểm của văn bản do máy tạo ra.
- Ngược lại, chỉ cần yêu cầu ChatGPT viết lại bài luận do chính nó tạo ra bằng "ngôn ngữ văn chương hơn", tỉ lệ bị phát hiện của các công cụ giảm từ mức cao nhất 100% xuống còn cao nhất 13%.
Các tác giả khuyến cáo thận trọng khi dùng các công cụ này trong đánh giá và giáo dục, đặc biệt với người học không phải bản ngữ. Điều này có ý nghĩa trực tiếp với học sinh, sinh viên Việt Nam khi viết bằng tiếng Anh, và đặt ra câu hỏi tương tự về độ tin cậy của các công cụ phát hiện cho tiếng Việt – vốn chưa được nghiên cứu nhiều.
Khuyến nghị của UNESCO
Hướng dẫn về AI tạo sinh trong giáo dục và nghiên cứu của UNESCO (2023) nhận định: dù nhà cung cấp được yêu cầu gắn "thủy vân" và đã có công cụ nhận diện nội dung do AI tạo ra, rất ít bằng chứng cho thấy các biện pháp này hiệu quả. Chiến lược trước mắt là giữ vững liêm chính học thuật và trách nhiệm giải trình thông qua kiểm tra kỹ lưỡng của con người. Chiến lược lâu dài là thiết kế lại bài tập viết để không dùng chúng đánh giá những việc mà AI làm tốt hơn người học, mà hướng vào những gì con người làm được còn AI thì không, như vận dụng các giá trị nhân văn và sự sáng tạo vào các vấn đề thực tế phức tạp.
Thiết kế lại đánh giá: Thang đánh giá AI năm mức
Một công cụ được nhiều cơ sở giáo dục sử dụng là Thang đánh giá AI (AI Assessment Scale – AIAS) do Mike Perkins, Leon Furze, Jasper Roe và Jason MacVaugh đề xuất năm 2024, được cơ quan bảo đảm chất lượng giáo dục đại học Úc (TEQSA) ghi nhận như một công cụ tiềm năng. Phiên bản sửa đổi (cuối năm 2024) giữ năm mức:
| Mức | Tên | Ý nghĩa |
|---|---|---|
| 1 | Không dùng AI | Bài làm trong môi trường có kiểm soát, giám sát trực tiếp, đo năng lực tự thân của người học |
| 2 | AI hỗ trợ lập kế hoạch | AI dùng cho khâu chuẩn bị, lên ý tưởng; bài đánh giá tập trung vào việc người học phát triển ý tưởng |
| 3 | AI hỗ trợ hoàn thành nhiệm vụ | Được dùng AI khi soạn thảo; trọng tâm là khả năng đánh giá có phê phán và giữ "giọng" riêng |
| 4 | Dùng AI toàn diện | Đánh giá cách người học điều khiển AI để đạt kết quả học tập, kèm tư duy phản biện và kiến thức môn học |
| 5 | Khám phá với AI | Người học và người dạy cùng thiết kế những cách dùng AI mới để giải quyết vấn đề |
Điểm quan trọng trong bản sửa đổi: các tác giả nhấn mạnh mức 1 phải được bảo đảm bằng môi trường có kiểm soát (thi trên lớp, có giám sát), không thể chỉ "tuyên bố cấm AI" với bài làm ở nhà rồi trông vào phần mềm phát hiện. Họ cũng bỏ yêu cầu nộp kèm bản gốc ở mức 3 vì các phương pháp phát hiện hiện nay không thể xác minh tin cậy. Cách tiếp cận này đặt tính giá trị của đánh giá – bài kiểm tra có đo đúng năng lực thật của người học hay không – lên trên việc "bắt lỗi".
Giới hạn: AIAS là khung thực hành dựa trên kinh nghiệm triển khai, chưa phải là can thiệp đã được kiểm chứng bằng thử nghiệm có đối chứng về tác động đến kết quả học tập.
Một số nguyên tắc rút ra
- Không dùng kết quả của phần mềm phát hiện làm bằng chứng duy nhất để kết luận gian lận. Nếu có nghi ngờ, trao đổi trực tiếp với học sinh về quá trình làm bài, yêu cầu giải thích nội dung đã viết.
- Nói rõ mức độ được dùng AI cho từng bài ngay khi giao bài, thay vì một quy định chung chung cho cả năm học.
- Đánh giá quá trình, không chỉ sản phẩm: dàn ý, bản nháp, nhật ký học tập, thuyết trình, vấn đáp.
- Bài kiểm tra quan trọng làm trong điều kiện có kiểm soát nếu mục tiêu là đo năng lực không có AI.
- Dạy cách ghi nhận việc dùng AI: học sinh nêu rõ đã dùng công cụ nào, vào việc gì – coi đây là một phần của trung thực học thuật.
Gợi ý cho nhà trường Việt Nam
- Xây dựng quy định sử dụng AI trong học tập, kiểm tra ở cấp trường, có tham khảo thang năm mức nêu trên, và phổ biến cho cả học sinh, phụ huynh.
- Với bài viết tiếng Anh của học sinh, đặc biệt thận trọng với kết luận "do AI viết" từ phần mềm, vì nguy cơ quy kết oan người học ngoại ngữ đã được chứng minh.
- Tăng tỉ lệ các hình thức đánh giá khó "thuê AI làm hộ": thuyết trình, phỏng vấn ngắn về bài làm, bài thực hành, dự án có báo cáo tiến độ.
- Tổ chức sinh hoạt chuyên môn để giáo viên cùng thiết kế lại một số bài kiểm tra theo từng mức sử dụng AI.
Nguồn tham khảo
- Weber-Wulff, D., Anohina-Naumeca, A., Bjelobaba, S., Foltýnek, T., Guerrero-Dib, J., Popoola, O., Šigut, P. & Waddington, L. (2023). Testing of detection tools for AI-generated text. International Journal for Educational Integrity, 19, 26. https://arxiv.org/abs/2306.15666
- Liang, W., Yuksekgonul, M., Mao, Y., Wu, E. & Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns, 4. Mã nguồn và dữ liệu: https://github.com/Weixin-Liang/ChatGPT-Detector-Bias
- Perkins, M., Roe, J., Furze, L. và cộng sự (2024). The AI Assessment Scale Revisited: A Framework for Educational Assessment. arXiv:2412.09029. https://arxiv.org/abs/2412.09029
- Miao, F. & Holmes, W. (2023). Guidance for generative AI in education and research. UNESCO (CC BY-SA 3.0 IGO). https://discovery.ucl.ac.uk/id/eprint/10176438/
Trích dẫn bài viết
Ban Biên tập IESDTD tổng hợp (2026). AI tạo sinh và liêm chính học thuật: vì sao không nên trông cậy vào phần mềm phát hiện, và nên làm gì thay thế. Viện Khoa học giáo dục và phát triển Công nghệ số. https://iesdtd.edu.vn/nghien-cuu/ai-tao-sinh-va-liem-chinh-hoc-thuat