Đơn vị trực thuộc Hội Khoa học phát triển Nguồn nhân lực - Nhân tài Việt Nam

0922812345 [email protected]

Hệ thống gia sư thông minh và gia sư AI tạo sinh: bằng chứng nói gì về hiệu quả học tập?

Nghiên cứu

Tác giả
Ban Biên tập IESDTD tổng hợp
Lĩnh vực
Trí tuệ nhân tạo, Khoa học dữ liệu & Công nghệ số
Từ khóa
gia sư thông minh, ITS, AI tạo sinh, phân tích gộp, thử nghiệm ngẫu nhiên, hiệu quả học tập

Tóm tắt

Tổng hợp các phân tích gộp và thử nghiệm ngẫu nhiên về hệ thống gia sư thông minh: hiệu quả gần bằng gia sư người trong nghiên cứu có kiểm soát, nhỏ hơn khi triển khai đại trà; và bằng chứng mới cho thấy gia sư AI tạo sinh chỉ có ích khi được thiết kế để không đưa sẵn đáp án.

Hệ thống gia sư thông minh (Intelligent Tutoring Systems – ITS) là phần mềm hướng dẫn người học giải bài theo từng bước, theo dõi xem người học đang hiểu sai ở đâu và đưa ra gợi ý, phản hồi phù hợp. Loại công nghệ này đã được nghiên cứu hàng chục năm, trước khi AI tạo sinh xuất hiện. Nhờ đó, ITS là một trong số ít lĩnh vực AI trong giáo dục có khối bằng chứng thực nghiệm tương đối dày.

Hiện nay, nhiều sản phẩm quảng cáo "gia sư AI" dựa trên mô hình ngôn ngữ lớn. Câu hỏi đặt ra cho nhà trường và phụ huynh: bằng chứng cũ về ITS có áp dụng được cho các công cụ mới không, và trong điều kiện nào công cụ thực sự giúp học sinh học tốt hơn?

Bằng chứng từ các phân tích gộp về ITS

Gần bằng gia sư người – trong nghiên cứu có kiểm soát

Bài tổng quan của Kurt VanLehn đăng trên tạp chí Educational Psychologist năm 2011 so sánh hiệu quả của gia sư người, gia sư máy tính và việc học không có gia sư. Tác giả phân loại hệ thống máy tính theo "độ mịn" của tương tác: chỉ chấm đáp án cuối (answer-based), hướng dẫn theo từng bước giải (step-based) và chi tiết hơn nữa (substep-based).

So sánh với học không có gia sưHệ số ảnh hưởng (d)
Hệ thống chỉ chấm đáp án cuối0,31
Gia sư thông minh hướng dẫn từng bước0,76
Gia sư thông minh chi tiết dưới bước0,40
Gia sư người0,79

Hai kết luận đáng chú ý: gia sư người không mạnh tới mức "2 độ lệch chuẩn" như niềm tin phổ biến bắt nguồn từ nghiên cứu của Bloom (1984), mà khoảng 0,79; và gia sư thông minh hướng dẫn từng bước đạt hiệu quả gần tương đương. Tác giả cũng chỉ ra hiện tượng "bình nguyên": tương tác chi tiết hơn mức từng bước không mang lại thêm hiệu quả đáng kể.

Phụ thuộc nhiều vào cách đo

Phân tích gộp của James Kulik và J. D. Fletcher (Review of Educational Research, 2016) tổng hợp 50 đánh giá có đối chứng. Mức ảnh hưởng trung vị là 0,66 độ lệch chuẩn – tương đương đưa một học sinh từ bách phân vị 50 lên 75. Tuy nhiên, các tác giả nhấn mạnh mức cải thiện phụ thuộc rất nhiều vào việc đo bằng bài kiểm tra do nhóm nghiên cứu tự xây dựng hay bằng bài kiểm tra chuẩn hóa. Nói cách khác, khi bài kiểm tra bám sát nội dung hệ thống dạy, hiệu quả trông lớn hơn.

Triển khai đại trà: hiệu quả nhỏ hơn và cần thời gian

Một thử nghiệm quy mô lớn của tổ chức RAND (Pane và cộng sự, Educational Evaluation and Policy Analysis, 2014) đánh giá chương trình Cognitive Tutor Algebra I – kết hợp phần mềm gia sư thông minh với giờ học trên lớp – tại nhiều trường được ghép cặp và phân ngẫu nhiên ở Mỹ. Kết quả: năm đầu không có tác động; năm thứ hai, các trường trung học dùng chương trình có điểm cao hơn khoảng 0,2 độ lệch chuẩn (tương đương từ bách phân vị 50 lên 58). Đây là mức tác động có ý nghĩa nhưng nhỏ hơn nhiều so với các nghiên cứu quy mô nhỏ, và cho thấy giáo viên, nhà trường cần thời gian để vận hành tốt một công cụ mới.

Gia sư AI tạo sinh: bằng chứng mới, có cả mặt trái

Thử nghiệm ở Thổ Nhĩ Kỳ: không có "rào chắn" thì có hại

Nghiên cứu của Hamsa Bastani và cộng sự (Đại học Pennsylvania), đăng trên tạp chí PNAS năm 2025, là thử nghiệm thực địa với gần một nghìn học sinh trung học học toán. Nhóm nghiên cứu so sánh ba điều kiện: không dùng AI; dùng một giao diện giống ChatGPT tiêu chuẩn chạy GPT-4 ("GPT Base"); và một phiên bản được thiết kế để bảo vệ việc học ("GPT Tutor"), chủ yếu bằng cách yêu cầu AI đưa ra gợi ý do giáo viên soạn thay vì đưa đáp án.

  • Trong các buổi luyện tập có AI, điểm tăng 48% với GPT Base và 127% với GPT Tutor so với nhóm đối chứng.
  • Nhưng khi làm bài kiểm tra không có AI, nhóm GPT Base đạt điểm thấp hơn nhóm chưa từng dùng AI 17% – tức là việc dùng AI tự do đã làm giảm kết quả học.
  • Với GPT Tutor, tác động tiêu cực này gần như được loại bỏ, nhưng cũng không thấy tác động tích cực trên bài kiểm tra.

Các tác giả giải thích: không có rào chắn, học sinh dùng GPT-4 như "chiếc nạng" trong giờ luyện tập và sau đó tự làm bài kém hơn.

Thử nghiệm ở Nigeria: có giáo viên dẫn dắt thì có ích

Ngân hàng Thế giới tổ chức một chương trình sau giờ học sáu tuần (tháng 6–7/2024) tại bang Edo, Nigeria: 800 học sinh năm đầu trung học phổ thông học tiếng Anh tại phòng máy hai buổi mỗi tuần với công cụ Microsoft Copilot. Giáo viên đóng vai "nhạc trưởng": giới thiệu chủ đề, đưa câu lệnh gợi ý, kèm cặp trong lúc học sinh làm việc với AI và tổ chức hoạt động suy ngẫm cuối buổi.

Theo báo cáo sơ bộ của nhóm nghiên cứu, đánh giá ngẫu nhiên cho thấy học sinh tham gia đạt kết quả cao hơn khoảng 0,3 độ lệch chuẩn ở bài kiểm tra viết sau chương trình, trên cả tiếng Anh, hiểu biết AI và kỹ năng số; số buổi tham gia càng nhiều thì tiến bộ càng lớn; học sinh nữ – vốn có kết quả thấp hơn ban đầu – có vẻ tiến bộ nhiều hơn. Nhóm tác giả cũng ghi nhận khó khăn thực tế: mất điện, mất mạng, nhiều học sinh chưa từng dùng máy tính nên mất vài tuần đầu để làm quen.

Lưu ý: tại thời điểm công bố, đây là kết quả do chính nhóm thực hiện báo cáo trên blog của Ngân hàng Thế giới, kèm thông tin bài báo đầy đủ "sắp công bố". Cần chờ báo cáo chính thức để đánh giá đầy đủ thiết kế và giới hạn.

Tổng hợp: điều gì quyết định hiệu quả?

Yếu tốBằng chứng gợi ý
Hướng dẫn theo từng bước, không đưa đáp ánITS từng bước hiệu quả hơn hẳn hệ thống chỉ chấm đáp án; gia sư AI có rào chắn tránh được tác động tiêu cực
Vai trò giáo viênChương trình ở Nigeria do giáo viên dẫn dắt; Cognitive Tutor kết hợp giờ học trên lớp
Thời gian triển khaiTác động ở thử nghiệm của RAND chỉ xuất hiện ở năm thứ hai
Cách đo kết quảBài kiểm tra tự xây dựng thường cho hiệu quả lớn hơn bài kiểm tra chuẩn hóa
Đo khi không có AIĐiểm luyện tập có AI không phản ánh năng lực thật; cần kiểm tra khi học sinh tự làm

Về độ mạnh của bằng chứng: hiệu quả của ITS truyền thống được hỗ trợ bởi nhiều nghiên cứu và phân tích gộp, nhưng mức tác động khi triển khai đại trà nhỏ hơn đáng kể. Bằng chứng về gia sư AI tạo sinh còn mới, ít nghiên cứu, bối cảnh hẹp (một môn, một trường hoặc một địa phương, thời gian ngắn), và chưa có dữ liệu về tác động dài hạn.

Gợi ý cho nhà trường, phụ huynh Việt Nam

  • Khi chọn "gia sư AI", hỏi: công cụ có đưa sẵn lời giải không, hay buộc học sinh tự làm từng bước và chỉ gợi ý? Loại thứ hai có cơ sở bằng chứng tốt hơn.
  • Đánh giá tiến bộ bằng bài làm không có AI. Điểm cao trong lúc luyện tập với AI có thể đánh lừa cả học sinh lẫn phụ huynh.
  • Gia sư AI nên được dùng có giáo viên định hướng, gắn với nội dung trên lớp, không thay thế giờ học.
  • Kiên nhẫn: một công cụ mới thường cần ít nhất một năm học để giáo viên khai thác hiệu quả.
  • Thận trọng với số liệu quảng cáo; hỏi nhà cung cấp kết quả được đo bằng bài kiểm tra nào, trên bao nhiêu học sinh, có nhóm đối chứng không.

Nguồn tham khảo

  1. VanLehn, K. (2011). The relative effectiveness of human tutoring, intelligent tutoring systems, and other tutoring systems. Educational Psychologist, 46(4), 197–221. https://www.emergingedtech.com/-kvanlehn/Stringent/PDF/EffectivenessOfTutoring_Vanlehn.pdf
  2. Kulik, J. A. & Fletcher, J. D. (2016). Effectiveness of intelligent tutoring systems: A meta-analytic review. Review of Educational Research, 86(1). https://journals.sagepub.com/doi/abs/10.3102/0034654315581420
  3. Pane, J. F., Griffin, B. A., McCaffrey, D. F. & Karam, R. (2014). Effectiveness of Cognitive Tutor Algebra I at scale. Educational Evaluation and Policy Analysis. Phụ lục: RAND Working Paper WR-1050. https://www.rand.org/pubs/working_papers/WR1050.html
  4. Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö. & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS. https://www.pnas.org/doi/10.1073/pnas.2422633122
  5. De Simone, M. E. và cộng sự (2025). From chalkboards to chatbots: Transforming learning in Nigeria, one prompt at a time. World Bank Blogs. https://blogs.worldbank.org/en/education/From-chalkboards-to-chatbots-Transforming-learning-in-Nigeria
  6. De Simone, M. E. và cộng sự (2024). From chalkboards to chatbots in Nigeria: 7 lessons to pioneer generative AI for education. World Bank Blogs. https://blogs.worldbank.org/en/education/From-chalkboards-to-chatbots-in-Nigeria

Trích dẫn bài viết

Ban Biên tập IESDTD tổng hợp (2026). Hệ thống gia sư thông minh và gia sư AI tạo sinh: bằng chứng nói gì về hiệu quả học tập?. Viện Khoa học giáo dục và phát triển Công nghệ số. https://iesdtd.edu.vn/nghien-cuu/he-thong-gia-su-thong-minh-bang-chung-hieu-qua