该文章提出了基于大语言模型(LLM)的LLM-MATE方法,旨在为计算机科学学生生成个性化、建设性的评估反馈,以解决大规模学生群体反馈效率低、个性化不足的问题,并通过软件架构(SA)模块案例验证了该方法的有效性。
一、文章主要内容总结
- 研究背景与问题:智能教育依赖AI技术,但当前自动化评估方法存在局限性,仅能提供简单反馈,缺乏个性化指导;大规模学生群体的评估反馈工作负担重,且人工评估易存在不一致性。
- 核心方法(LLM-MATE):该方法分四步实现,一是收集软件架构模块的匿名学生评估数据(含论文、图像、编程作业);二是通过提示工程优化ChatGPT提示词,确保反馈聚焦领域、个性化且能识别错误;三是结合预定义评分标准,用ChatGPT评估学生作业并生成反馈;四是由领域专家(模块负责人)验证反馈,解决LLM可能存在的“幻觉”问题。
- 实验与结果:以23名学生的软件架构作业(用例图、类图、三层架构图)为样本,采用零样本学习提示方式。结果显示,ChatGPT生成的反馈包含优势、改进点及评分依据,比人工反馈更详细;4名专家对ChatGPT反馈的信心评分平均为4(1-5分制),表明其可靠性较高,且能减少人工评估的不一致性。
- 局限性与未来方向:目前仅验证了用例图的评估效果,数据样本量较小;未来计划扩展到类图和三层架构图评估,增大样本量,尝试少样本学习和思维链提示法,并探索反馈对学生学习的提升作用。