CSTutorBench:作为导师评估小型语言模型在基于积木编程中的表现
大语言模型作为AI导师在K-12教育中应用越来越多,但隐私、成本和对专有模型的依赖引发担忧。小型语言模型(SLM)提供了有希望的替代方案,但针对特定教育场景(如基于积木的编程)选择合适模型依然困难。本文提出了CSTutorBench基准,用于评估语言模型在VEX VR机器人环境中担任计算机科学导师的能力。该基准包含基于17个场景的问题,采用融合教学和反馈研究的教学评分标准,并通过人机结合的LLM评分管线进行评估。对11个参数规模在4B到120B间模型的初步测试表明,模型在词汇和语气等表层指标表现良好,但在避免答案泄露和利用学生调试历史等深层教学行为上表现不足。结果显示,模型家族和指令微调方法较参数数量更能预测教学质量,经过针对性提示词优化后,10个模型的表现有所提升。这一结果强调了基于具体教育情境和教学理论的基准对SLM教育部署选择的重要性。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。