- Tác giả
- Ban Biên tập IESDTD tổng hợp
- Lĩnh vực
- Khoa học giáo dục & Đổi mới giáo dục
- Từ khóa
- đánh giá quá trình, đánh giá vì sự tiến bộ, formative assessment, Black và Wiliam, đánh giá thường xuyên
Tóm tắt
Từ tổng quan "Inside the Black Box" của Black và Wiliam (1998) đến các phân tích gộp và thử nghiệm ngẫu nhiên gần đây: đánh giá quá trình giúp học sinh tiến bộ đến mức nào, vì sao con số hiệu quả bị tranh luận, và năm chiến lược cốt lõi giáo viên có thể áp dụng.
Trong mỗi tiết học, giáo viên liên tục "đánh giá": đặt câu hỏi, quan sát học sinh làm bài, đọc bài viết, nghe học sinh thảo luận. Câu hỏi then chốt không phải là có đánh giá hay không, mà là thông tin thu được có được dùng để điều chỉnh việc dạy và việc học hay chỉ để ghi điểm vào sổ. Đó là khác biệt giữa đánh giá tổng kết (assessment of learning) và đánh giá quá trình hay đánh giá vì sự tiến bộ (formative assessment, assessment for learning).
Từ cuối thập niên 1990, đánh giá quá trình trở thành một trong những chủ đề được nghiên cứu và đưa vào chính sách nhiều nhất trong khoa học giáo dục; năm 2005, OECD công bố nghiên cứu tình huống về thực hành đánh giá quá trình ở trường trung học của tám hệ thống giáo dục, trong đó có Phần Lan, Anh, Scotland, Canada và New Zealand. Ở Việt Nam, Thông tư 22/2021/TT-BGDĐT về đánh giá học sinh trung học cơ sở và trung học phổ thông cũng phân biệt đánh giá thường xuyên – thực hiện trong quá trình dạy học thông qua hỏi – đáp, viết, thuyết trình, thực hành, sản phẩm học tập – với đánh giá định kỳ, và nhấn mạnh việc động viên sự cố gắng của học sinh thay vì so sánh học sinh với nhau.
"Inside the Black Box": luận điểm khởi đầu
Năm 1998, Paul Black và Dylan Wiliam (Đại học King's College London) công bố bài viết "Inside the Black Box: Raising Standards Through Classroom Assessment" trên tạp chí Phi Delta Kappan. Hai tác giả cho rằng nhiều cải cách giáo dục chỉ tác động vào "đầu vào" (chuẩn, kỳ thi, thanh tra) mà coi lớp học như một "hộp đen", trong khi việc học diễn ra chính trong hộp đen đó.
Họ định nghĩa đánh giá là mọi hoạt động của giáo viên – và của học sinh khi tự đánh giá – cung cấp thông tin để làm phản hồi điều chỉnh việc dạy và học; và đánh giá trở thành đánh giá quá trình khi bằng chứng thực sự được dùng để điều chỉnh việc dạy cho phù hợp với nhu cầu của học sinh.
Bài viết tóm lược một tổng quan dài hơn: nhóm tác giả rà soát khoảng 580 bài báo, chương sách và sử dụng tư liệu từ 250 nguồn. Các kết luận chính:
- Các thực nghiệm về đánh giá quá trình thường cho hệ số ảnh hưởng (effect size) trong khoảng 0,4 đến 0,7 – lớn hơn phần lớn các can thiệp giáo dục khác. Theo cách giải thích của tác giả, mức 0,4 nghĩa là một học sinh trung bình được tham gia sẽ đạt kết quả ngang học sinh thuộc nhóm 35% cao nhất của nhóm không tham gia.
- Đánh giá quá trình thường giúp học sinh học yếu nhiều hơn, vừa nâng mặt bằng vừa thu hẹp khoảng cách.
- Thực tiễn phổ biến lại đi ngược: chấm điểm và xếp loại được coi trọng hơn lời khuyên giúp cải thiện; học sinh bị so sánh với nhau, khiến học sinh yếu tin rằng mình "không có khả năng".
- Khi học sinh chỉ nhận điểm số, các em không hưởng lợi từ phản hồi; phản hồi có tác dụng khi chỉ rõ điểm mạnh, điểm yếu và cách sửa, tốt nhất là không kèm điểm tổng.
- Tự đánh giá của học sinh không phải là thứ "xa xỉ" mà là thành phần thiết yếu, vì học sinh chỉ tự điều chỉnh được khi hiểu rõ mục tiêu cần đạt.
Con số 0,4–0,7 có đáng tin?
Hiệu quả "rất lớn" của đánh giá quá trình về sau bị xem xét lại. Phân tích gộp của Neal Kingston và Brooke Nash (Educational Measurement: Issues and Practice, 2011) rà soát hơn 300 nghiên cứu ở bậc phổ thông nhưng chỉ 13 nghiên cứu đủ thông tin để tính hệ số ảnh hưởng; nhiều nghiên cứu có thiết kế yếu. Từ 42 hệ số ảnh hưởng độc lập, trung vị là 0,25 và trung bình có trọng số là 0,20 – nhỏ hơn nhiều so với mức thường được trích dẫn.
Bằng chứng từ thử nghiệm ngẫu nhiên quy mô lớn cho bức tranh tương tự. Quỹ Education Endowment Foundation (EEF, Anh) đánh giá chương trình bồi dưỡng "Embedding Formative Assessment" tại 140 trường trung học với khoảng 25.000 học sinh (hoàn thành năm 2018). Giáo viên tham gia sinh hoạt cộng đồng học tập hằng tháng và dự giờ lẫn nhau theo cấu trúc. Kết quả: học sinh tiến bộ thêm tương đương 2 tháng học (đo bằng điểm tổng hợp Attainment 8 của kỳ thi GCSE), với độ tin cậy được xếp ở mức rất cao; tuy nhiên không thấy khác biệt riêng ở môn Toán hay Tiếng Anh.
| Nguồn | Loại bằng chứng | Mức hiệu quả |
|---|---|---|
| Black và Wiliam (1998) | Tổng quan tài liệu, nhiều thiết kế khác nhau | Thường 0,4–0,7 |
| Kingston và Nash (2011) | Phân tích gộp, chỉ giữ nghiên cứu đủ dữ liệu | Trung bình có trọng số 0,20 |
| EEF – Embedding Formative Assessment (2018) | Thử nghiệm ngẫu nhiên, 140 trường | +2 tháng học |
Cách đọc hợp lý: đánh giá quá trình có tác động tích cực, nhưng khi triển khai đại trà và đo bằng bài thi chuẩn hóa, mức tác động khiêm tốn hơn nhiều so với các nghiên cứu nhỏ ban đầu. Điều đó không làm giảm giá trị của cách tiếp cận – chi phí thấp, tác động dương, lợi ích nhiều hơn cho học sinh yếu – nhưng nhắc nhà quản lý không nên kỳ vọng "phép màu".
Năm chiến lược cốt lõi
Dựa trên làm việc với giáo viên, Siobhan Leahy, Christine Lyon, Marnie Thompson và Dylan Wiliam (Educational Leadership, 2005) tổng kết năm chiến lược mà họ gọi là "không thể thương lượng" của đánh giá vì sự tiến bộ:
- Làm rõ và chia sẻ mục tiêu học tập, tiêu chí thành công – học sinh cần biết "bài làm tốt" trông như thế nào.
- Tổ chức thảo luận, câu hỏi và nhiệm vụ học tập có khả năng bộc lộ mức độ hiểu của học sinh.
- Phản hồi giúp người học tiến lên – chỉ ra việc cần làm tiếp theo, không chỉ đúng/sai.
- Giúp học sinh làm chủ việc học của mình – tự đánh giá, tự theo dõi.
- Giúp học sinh trở thành nguồn hỗ trợ cho nhau – đánh giá đồng đẳng, học hợp tác.
Chiến lược xuyên suốt là: thông tin đánh giá phải được dùng để điều chỉnh việc dạy. Các tác giả nhấn mạnh không có "gói" kỹ thuật dùng chung cho mọi lớp; giáo viên cần được lựa chọn và điều chỉnh kỹ thuật cho phù hợp.
Một số kỹ thuật cụ thể
- Câu hỏi "bản lề": một câu hỏi trắc nghiệm được thiết kế kỹ, đặt ở thời điểm quyết định của tiết học. Mỗi phương án sai tương ứng một cách hiểu sai cụ thể. Nhìn câu trả lời của cả lớp, giáo viên quyết định chuyển tiếp, dạy lại hay ghép cặp học sinh hỗ trợ nhau.
- Thẻ A–B–C–D hoặc bảng con: mọi học sinh cùng trả lời một lúc, giáo viên quan sát được cả lớp thay vì chỉ vài em giơ tay.
- "Không giơ tay, trừ khi đặt câu hỏi": giáo viên gọi ngẫu nhiên (ví dụ rút que ghi tên) để mọi học sinh đều phải suy nghĩ.
- Thẻ đèn xanh – đỏ: học sinh tự báo mức độ hiểu; đây cũng là cách chuyển một phần trách nhiệm theo dõi việc học sang học sinh.
- Đánh giá đồng đẳng tập trung vào cải thiện: Leahy và cộng sự lưu ý học sinh không nên cho bạn điểm số được báo cáo chính thức; đánh giá đồng đẳng là để giúp nhau sửa bài.
Những điểm cần lưu ý khi triển khai
- Đánh giá quá trình không phải là "kiểm tra nhiều hơn". Tăng số bài kiểm tra lấy điểm nhưng không dùng kết quả để điều chỉnh dạy học thì không phải đánh giá quá trình.
- Cần thời gian. Đánh giá của EEF ghi nhận giáo viên cho rằng thay đổi trong thực hành và trong cách học của học sinh cần nhiều thời gian hơn mới phản ánh vào điểm thi.
- Phát triển chuyên môn theo hình thức cộng đồng học tập (giáo viên gặp nhau định kỳ, thử nghiệm, dự giờ, chia sẻ) được giáo viên đánh giá cao trong thử nghiệm của EEF.
- Kỳ thi quan trọng chi phối lớp học. Black và Wiliam nhận xét các kỳ thi bên ngoài có tính quyết định cao luôn chi phối việc dạy và đánh giá trong lớp, và là mô hình kém cho đánh giá quá trình.
Gợi ý cho nhà trường và giáo viên Việt Nam
- Coi đánh giá thường xuyên theo Thông tư 22/2021 là cơ hội thu thập bằng chứng để điều chỉnh bài dạy, không chỉ để có đủ "số đầu điểm".
- Mỗi tiết học nên có ít nhất một thời điểm kiểm tra mức hiểu của cả lớp (bảng con, thẻ chữ cái, phiếu ra lớp) và kế hoạch xử lý khi nhiều học sinh hiểu sai.
- Khi trả bài, ưu tiên nhận xét cụ thể về việc cần làm tiếp, và dành thời gian để học sinh sửa bài theo nhận xét.
- Tổ chuyên môn có thể chọn một kỹ thuật, cùng thử trong vài tuần rồi chia sẻ kết quả – cách làm gần với mô hình cộng đồng học tập được kiểm chứng trong thử nghiệm của EEF.
Nguồn tham khảo
- Black, P. và Wiliam, D. (1998). Inside the Black Box: Raising Standards Through Classroom Assessment. Phi Delta Kappan, 80(2), 139–148. Bản đăng lại: https://kappanonline.org/inside-the-black-box-raising-standards-through-classroom-assessment/
- Kingston, N. và Nash, B. (2011). Formative Assessment: A Meta-Analysis and a Call for Research. Educational Measurement: Issues and Practice, 30(4), 28–37. https://doi.org/10.1111/j.1745-3992.2011.00220.x
- Leahy, S., Lyon, C., Thompson, M. và Wiliam, D. (2005). Classroom Assessment: Minute by Minute, Day by Day. Educational Leadership, 63(3). https://pdo.ascd.org/LMSCourses/PD11OC101M/media/FA_M03_Reading_02_Classroom-Assessment.pdf
- Education Endowment Foundation (2018). Embedding Formative Assessment – Evaluation report. https://educationendowmentfoundation.org.uk/projects-and-evaluation/projects/embedding-formative-assessment
- OECD (2005). Formative Assessment: Improving Learning in Secondary Classrooms. OECD Publishing, Paris. https://doi.org/10.1787/9789264007413-en
- Bộ Giáo dục và Đào tạo (2021). Thông tư 22/2021/TT-BGDĐT quy định về đánh giá học sinh trung học cơ sở và học sinh trung học phổ thông. https://luatvietnam.vn/giao-duc/thong-tu-22-2021-tt-bgddt-207846-d1.html
Trích dẫn bài viết
Ban Biên tập IESDTD tổng hợp (2026). Đánh giá vì sự tiến bộ (đánh giá quá trình): bằng chứng nghiên cứu và cách làm trong lớp học. Viện Khoa học giáo dục và phát triển Công nghệ số. https://iesdtd.edu.vn/nghien-cuu/danh-gia-vi-su-tien-bo-danh-gia-qua-trinh-bang-chung