为什么两种学习增益算法结果总是不一样?
在教育心理学中,为了衡量学生在教学前后的进步,研究者常用“前测—后测”设计:开学前测试一次(前测),学期末再测一次(后测),两个分数之差就反映了学习收获。但直接比较原始分差受初始水平影响,于是有学者提出“归一化增益”(normalized gain),大意是计算“实际进步”占“最大可能进步”的比例。
然而,在具体计算小组平均增益时,存在两种常见方法:
- 方法A:先计算每个学生的归一化增益,再对全班取平均,记为
<g>; - 方法B:先求全班前测和后测的平均分,再用平均分计算归一化增益,记为
<g>(或G)。
直觉上,两种方法都试图回答“这个班学得怎么样”,但实际算出的数值往往不同。过去有文献记录了这一现象,却没人说清原因。智利学者Navarrete-Ulloa的最新研究指出,答案可能就藏在“测量误差”里。
测量误差:看不见的捣乱分子
任何测验分数都包含一定程度的测量误差——考试时的紧张、题目措辞的模糊、阅卷的主观性,都会让得分偏离真实水平。教育测量学用“信度”来描述误差的大小:信度越高,分数越可靠。
研究者用经典测量理论分析后发现:当前测和后测都存在测量误差时,方法A(平均个体增益)会系统性地低估真实学习率,而且误差越大,低估越严重;相比之下,方法B(平均学习者的增益)在样本量足够大时仍然是无偏的。也就是说,两种方法的分歧主要不是随机波动,而是由测量误差造成的系统性偏差。
打个比方:假设每个学生都有一个“真实进步值”,但观测到的分数像隔着毛玻璃看东西,模糊不清。你分别测量每个学生的“毛玻璃影像”再平均,误差会被放大;而先把整个班的影像平均成一张“合影”,再测量,误差反而抵消了一部分。
天然负相关?可能是误差的锅
另一个长期争议是:前测成绩与归一化增益之间常常呈负相关。有人据此认为,归一化增益偏袒前测低分者,不能公平地衡量不同起点的学生。但这项研究证明,即使学生的真实学习能力与前测完全无关,测量误差本身也会制造出虚假的负相关。
原因在于,前测分数包含误差,而归一化增益的计算又使用前测分数作为分母的一部分。误差越大,这种人为的相关就越明显。所以,当你看到前测与增益负相关时,先别急着下结论,检查一下测验信度可能更稳妥。研究者强调,这个机制不只影响归一化增益,任何基于不可靠分数进行非线性变换的指标(如比率分数、残差增益)都可能存在类似问题。
给实践者的三条建议
研究者在论文末尾提出了非常实用的建议,值得教育研究者和一线教师参考:
- 同时报告两种估计值。如果
<g>(平均个体增益)与G(平均学习者的增益)差距很大,这本身就是一个警示信号,提示测量误差可能正在干扰结果。 - 报告测量工具的信度。信度既是结果可信度的依据,也是解释前测-增益相关的前提。信度低时,观察到的负相关可能只是误差的产物。
- 谨慎解释前测-增益相关。在报告这类相关时,应结合信度进行条件化解释,避免将误差造成的假象误认为教学现象。
结语
这项研究并非否定归一化增益的价值,而是提醒我们:任何统计工具都建立在分数质量之上。当测量误差存在时,最好的策略不是争论哪个公式更“正确”,而是提高测量信度,并采用多种估计方法交叉验证。对家长和教育者而言,理解这一点也很重要——一个看起来“进步更小”的班级,未必真的教得差,也许只是测验不够精确罢了。