Đơn vị trực thuộc Hội Khoa học phát triển Nguồn nhân lực - Nhân tài Việt Nam

0922812345 [email protected]

Chấm điểm tự động và AI trong đánh giá học sinh: dùng ở đâu, thận trọng ở đâu?

Nghiên cứu

Tác giả
Ban Biên tập IESDTD tổng hợp
Lĩnh vực
Trí tuệ nhân tạo, Khoa học dữ liệu & Công nghệ số
Từ khóa
chấm điểm tự động, đánh giá, phản hồi bài viết, AI tạo sinh, kiểm tra đánh giá

Tóm tắt

Máy chấm bài luận và AI tạo sinh nhận xét bài viết có thể giảm tải cho giáo viên, nhưng bằng chứng cho thấy chất lượng còn thua người chấm giỏi, có thiên lệch với một số nhóm, và gây tranh cãi khi dùng cho kỳ thi quan trọng. Bài tổng hợp nghiên cứu và bài học từ Úc, Mỹ, EU.

Chấm bài là một trong những công việc tốn thời gian nhất của giáo viên, nhất là bài viết, bài luận. Chấm điểm tự động bằng máy đã được dùng ở một số kỳ thi quốc tế từ nhiều năm trước; nay, AI tạo sinh còn có thể viết nhận xét chi tiết cho từng bài. Câu hỏi thực tế với nhà trường không phải là "có nên dùng hay không", mà là dùng cho loại đánh giá nào, với điều kiện gì.

Hai loại ứng dụng cần phân biệt

Sách trắng về chấm bài luận tự động trong trường học Úc do nhóm tác giả từ Đại học Sydney và các trường khác công bố tháng 11/2022 nhấn mạnh việc đầu tiên cần xác định: công cụ được dùng cho đánh giá "rủi ro cao" hay "rủi ro thấp".

Đánh giá rủi ro cao (high-stakes)Đánh giá rủi ro thấp (low-stakes)
Ví dụThi chuyển cấp, xét tốt nghiệp, xếp hạng trường, phân luồngLuyện tập, nhận xét bản nháp, kiểm tra thường xuyên để điều chỉnh việc học
Hậu quả của sai sótẢnh hưởng nghiêm trọng đến người học, giáo viên, nhà trườngCó thể sửa chữa, người học còn cơ hội làm lại
Khuyến nghị của sách trắngTrong đa số trường hợp không khuyến nghị dùng chấm tự động; nếu dùng phải giải thích rõ cách hoạt động và hệ quả đạo đứcCó tiềm năng, đặc biệt dưới dạng phản hồi tự động (formative feedback)

Bài học từ kỳ thi NAPLAN của Úc

Cơ quan phụ trách chương trình và đánh giá quốc gia của Úc (ACARA) từng đặt mục tiêu chấm hoàn toàn tự động phần viết của kỳ đánh giá năng lực đọc viết và tính toán quốc gia (NAPLAN) vào năm 2020. Theo ABC News, tháng 12/2017 Hội đồng Giáo dục gồm bộ trưởng giáo dục các bang và vùng lãnh thổ đã quyết định không dùng chấm tự động cho bài viết NAPLAN, và mọi thay đổi trong tương lai phải có thêm nghiên cứu, được Hội đồng phê duyệt.

Giáo sư Les Perelman, chuyên gia người Mỹ về đánh giá bài viết được Liên đoàn Giáo viên bang New South Wales mời nghiên cứu, cảnh báo máy chấm có thể thưởng điểm cho "những câu vô nghĩa dài dòng" và không đánh giá được sự sáng tạo, tính châm biếm hay chất văn chương. Theo sách trắng của Đại học Sydney, những lo ngại chính khi đó gồm: nguy cơ làm giảm vai trò nghề nghiệp của giáo viên; hạ tầng không đồng đều giữa các trường; và thiếu minh bạch về cách máy ra quyết định chấm.

Thiên lệch: máy có thể chấm khác nhau với các nhóm người học

Trong chương viết cho báo cáo OECD Digital Education Outlook 2023, Baker, Hawn và Lee dẫn trường hợp hệ thống chấm bài luận tự động trong kỳ thi TOEFL – được dùng để thay một trong hai người chấm – cho điểm bài của người nói tiếng Ả Rập, tiếng Hindi và tiếng Tây Ban Nha thấp hơn so với người chấm. Đơn vị tổ chức thi đã điều chỉnh quy trình: một người chấm và máy cùng chấm; nếu chênh lệch lớn, người chấm thứ hai vào cuộc; nếu hai người thống nhất thì điểm máy bị loại bỏ. Đây là mô hình "máy hỗ trợ, người quyết định" đáng tham khảo.

Các tác giả cũng ghi nhận những nghiên cứu khác cho thấy hệ thống chấm bài luận và đánh giá phát âm tự động có thiên lệch theo quốc tịch, ngôn ngữ mẹ đẻ, trong đó có người học từ Việt Nam.

AI tạo sinh nhận xét bài viết: khá tốt nhưng chưa bằng người giỏi

Nghiên cứu của Steiss, Graham, Warschauer và cộng sự, đăng trên tạp chí Learning and Instruction năm 2024, so sánh nhận xét của ChatGPT và của người đánh giá có kinh nghiệm trên cùng 200 bài luận môn lịch sử của học sinh lớp 6–12 ở Nam California. Theo bài viết của The Hechinger Report tóm tắt nghiên cứu:

  • Trên thang 5 điểm về chất lượng nhận xét, ChatGPT đạt trung bình 3,6, người đánh giá đạt 4,0. Người đánh giá phần lớn có trên 15 năm dạy viết và được tập huấn riêng cho nghiên cứu.
  • Nhìn chung nhận xét của con người tốt hơn một chút, rõ nhất ở việc chọn điều quan trọng nhất học sinh cần cải thiện, phù hợp với trình độ hiện tại của em. Nhận xét của AI không phải lúc nào cũng chính xác.
  • ChatGPT nhỉnh hơn một chút ở việc nhận xét theo đúng tiêu chí của bài (lập luận, dùng dẫn chứng từ tài liệu).

Các tác giả cũng nêu những lo ngại: học sinh có thể để AI viết thay thay vì chỉ nhận góp ý; nếu giáo viên giao hết việc nhận xét cho AI, họ sẽ không nắm được lỗi phổ biến của lớp để điều chỉnh bài dạy; và nhận xét của AI có thể kéo mọi bài viết về một khuôn mẫu, làm mất "giọng" riêng của người viết trẻ.

Giới hạn của nghiên cứu: một bối cảnh (bài luận lịch sử ở một vùng của Mỹ), một phiên bản ChatGPT, chỉ đo chất lượng nhận xét chứ chưa đo việc học sinh có viết tốt hơn nhờ nhận xét đó hay không.

Khung pháp lý: châu Âu coi đây là ứng dụng rủi ro cao

Đạo luật AI của Liên minh châu Âu xếp các hệ thống AI dùng để đánh giá kết quả học tập, kể cả khi kết quả đó dùng để điều hướng quá trình học, vào nhóm rủi ro cao. Bên triển khai phải bảo đảm có người giám sát đủ năng lực, lưu nhật ký và thông báo cho người bị tác động. Điều này phản ánh nhận thức chung: chấm điểm là quyết định có hệ quả đối với người học, nên cần có sự kiểm soát của con người.

Câu hỏi nên đặt ra trước khi dùng công cụ chấm tự động

  1. Công cụ dùng cho đánh giá rủi ro cao hay rủi ro thấp?
  2. Nhà cung cấp có công bố mức độ trùng khớp với người chấm, tách theo nhóm học sinh không? Đã được thử với học sinh Việt Nam, bài viết tiếng Việt chưa?
  3. Giáo viên có xem lại và có quyền sửa điểm, nhận xét không?
  4. Học sinh có biết bài của mình được máy chấm hay nhận xét, và có được khiếu nại không?
  5. Bài làm của học sinh được lưu ở đâu, có bị dùng để huấn luyện mô hình không?

Gợi ý cho giáo viên Việt Nam

  • Dùng AI để góp ý bản nháp, không dùng để cho điểm chính thức. Điểm số đưa vào sổ vẫn do giáo viên quyết định.
  • Đọc lại nhận xét của AI trước khi gửi học sinh, vì độ chính xác của AI vẫn thua người chấm có kinh nghiệm.
  • Vẫn tự đọc một phần bài của lớp để nắm lỗi chung và điều chỉnh việc dạy.
  • Không đưa họ tên, thông tin cá nhân của học sinh vào công cụ AI công cộng khi nhờ nhận xét bài.
  • Với bài tiếng Anh, lưu ý bằng chứng về thiên lệch của máy chấm đối với người học không phải bản ngữ.

Nguồn tham khảo

  1. Gulson, K., Thompson, G., Swist, T., Kitto, K., Rutkowski, L., Rutkowski, D., Hogan, A., Zhang, V. & Knight, S. (2022). Automated Essay Scoring in Australian Schools: Key Issues and Recommendations. White Paper, Sydney Social Sciences and Humanities Advanced Research Centre, University of Sydney. https://www.sydney.edu.au/content/dam/corporate/documents/faculty-of-arts-and-social-sciences/research/research-centres-institutes-groups/sssharc/aes_white-paper_final.pdf
  2. ABC News (2018). NAPLAN: Robot marking of school tests scrapped by education ministers. https://www.abc.net.au/news/2018-01-30/push-to-have-robots-mark-naplan-tests-scrapped/9370318
  3. Baker, R. S., Hawn, M. A. & Lee, S. (2023). Algorithmic bias: the state of the situation and policy recommendations. Trong OECD Digital Education Outlook 2023. Bản tiền ấn phẩm: https://learninganalytics.upenn.edu/ryanbaker/Algorithmic%20Bias%20in%20Education_%20OECD%20Edition_%20preprint.pdf
  4. Steiss, J., Tate, T., Graham, S. và cộng sự (2024). Comparing the quality of human and ChatGPT feedback of students' writing. Learning and Instruction, 91, 101894. Tóm tắt: The Hechinger Report, https://hechingerreport.org/proof-points-writing-ai-feedback/
  5. Liên minh châu Âu (2024). Regulation (EU) 2024/1689 (Artificial Intelligence Act) – Phụ lục III. https://artificialintelligenceact.eu/annex/3/

Trích dẫn bài viết

Ban Biên tập IESDTD tổng hợp (2026). Chấm điểm tự động và AI trong đánh giá học sinh: dùng ở đâu, thận trọng ở đâu?. Viện Khoa học giáo dục và phát triển Công nghệ số. https://iesdtd.edu.vn/nghien-cuu/cham-diem-tu-dong-va-ai-trong-danh-gia